Co się stało
VentureBeat informuje, że Anthropic zaktualizowało Claude Tag, swojego agenta AI opartego na Slacku, aby czytał pełny kontekst rozmowy przed podjęciem decyzji o interwencji. Firma twierdzi, że zmiana poprawiła ocenę Claude na temat tego, kiedy zabrać głos, o około 30%, chociaż źródło nie podaje niezależnego punktu odniesienia ani szczegółowej metodologii.
VentureBeat informuje, że Anthropic zaktualizował tag Claude na początku tego miesiąca, więc Claude ocenia całą rozmowę w Slacku, zamiast oceniać wiadomości pojedynczo. W poprzednim projekcie zastosowano lekki klasyfikator do podjęcia binarnej decyzji o tym, czy Claude powinien odpowiedzieć na każdy komunikat. Zaktualizowany system podobno usuwa ten klasyfikator i zapewnia Claude szerszy kontekst kanału, jego pamięć i stałe instrukcje przed wybraniem jednej z czterech opcji: odpowiadanie bezpośrednio, rozpoczynanie głębszej pracy w wątku, kierowanie problemu do istniejącego strumienia pracy lub milczenie.
Według VentureBeat Anthropic twierdzi, że zmiana sprawiła, że Claude był o około 30% lepszy w podejmowaniu decyzji, kiedy interweniować, a kiedy nie. W artykule podano przykład dwóch inżynierów badających ten sam błąd: jedna wiadomość zawiera teorię, a druga dowody potwierdzające, mimo że żadna wiadomość sama w sobie nie uzasadnia odpowiedzi. W takiej sytuacji zaktualizowany tag Claude może podobno otworzyć wątek i rozpocząć dochodzenie. VentureBeat informuje również, że Claude może przejść w stan uśpienia na kanałach, na których wielokrotnie nie ma nic przydatnego do dodania.
W artykule napisano, że aktualizacja jest częścią szerszej strategii Anthropic dotyczącej tak zwanej „sztucznej inteligencji dla wielu graczy”. Scott White, szef produktu dla przedsiębiorstw w Anthropic, powiedział VentureBeat, że firma postrzega łączność, silniejsze modele i umiejscowienie w istniejącym oprogramowaniu do współpracy jako warunki, które czynią proaktywnych agentów praktycznymi. Źródło podaje, że dostęp Claude jest ograniczony przez najbardziej restrykcyjne nakładanie się uprawnień agenta i uprawnień żądającego użytkownika, a Anthropic twierdzi, że kontekst kanału nie będzie ujawniony w innym kanale. Twierdzenia te nie są niezależnie potwierdzone w źródle.
Szczegóły źródła: venturebeat.com ↗
Dlaczego to ma znaczenie
Aktualizacja przenosi Claude Tag w stronę proaktywnego, współdzielonego agenta w miejscu pracy, a nie chatbota, który odpowiada tylko na bezpośrednie monity. Może to ograniczyć konieczność przekazywania zadań między zespołami, ale zwiększa także znaczenie uprawnień, zabezpieczeń przed natychmiastowym wstrzyknięciem, kontroli kosztów i jasnej odpowiedzialności ludzi.
Praktyczna zmiana nie polega po prostu na tym, że Claude widzi więcej tekstu. Może teraz wykorzystywać relacje między komunikatami, aby zdecydować, czy problem zasługuje na działanie, co sprawia, że agent bardziej przypomina uczestnika pracy zespołowej. VentureBeat podaje, że White postrzega to jako przejście od sztucznej inteligencji zajmującej się izolowanymi zadaniami do realizacji większych projektów lub celów organizacyjnych. W tym modelu wartość systemu zależy od łączenia informacji pomiędzy ludźmi, kanałami i narzędziami przedsiębiorstwa, a nie od zapewniania lepszej odpowiedzi na pytanie jednego użytkownika.
VentureBeat przedstawia doświadczenie White'a w Anthropic jako przykład potencjalnych korzyści. Powiedział, że Claude może przeprowadzić analizę danych, która wcześniej wymagała przekazania analitykowi danych, co daje więcej czasu na dyskusję i ocenę między ludźmi. W artykule przedstawiono także opis przypadku użycia niezawodności witryny, w którym Claude łączy dzienniki błędów, ostatnie zmiany w kodzie i powiązane dyskusje na platformie Slack przed zatrudnieniem odpowiednich osób. Są to sprawozdania po stronie firmy, a nie niezależne badania produktywności, a źródło nie wskazuje, że te same wyniki występują w innych organizacjach.
Aktualizacja ujawnia również większy problem z zarządzaniem. Agent mający stały dostęp do Slacka i połączonych systemów może działać na podstawie informacji, których użytkownicy mogli nie przeglądać wspólnie, a błędy lub złośliwe instrukcje zawarte w treści mogą mieć wpływ na jego zachowanie. VentureBeat informuje, że Anthropic wykorzystuje klasyfikatory na poziomie modelu, konfigurowalne przez klienta mechanizmy kontroli zgodności i analityki, integracje zabezpieczeń innych firm oraz ograniczenia uprawnień, aby zaradzić tym zagrożeniom. Źródło nie podaje wskaźników awaryjności, szczegółów niezależnych testów bezpieczeństwa ani dowodów na to, że zabezpieczenia zapobiegają wszelkim scenariuszom szybkiego wstrzyknięcia lub wycieku danych.
Mechanizm interaktywny: jak to faktycznie działa
Poznaj interaktywnie technologię leżącą u podstaw tego rozwoju.
crm_get_transaction(id='4092').An agent must create a draft calendar event for Tuesday at 2 p.m. Which evidence would establish the requested result?
Co obejrzeć dalej
Kluczowe otwarte pytania dotyczą tego, czy deklarowana poprawa przekłada się na wymierne korzyści w miejscu pracy, ile ostatecznie będzie kosztować zawsze aktywny kontekst oraz w jaki sposób przedsiębiorstwa będą zarządzać agentem, który będzie mógł decydować, kiedy rozpocząć pracę. VentureBeat informuje, że Anthropic nie zobowiązał się do stałego utrzymywania rozszerzonego kontekstu poza limitami użytkowania.
Pierwszym testem jest to, czy poprawa o 30% ma praktyczne znaczenie. VentureBeat nie określa rozmiaru ani składu oceny, bazowego poziomu błędów, rodzajów testowanych rozmów ani tego, czy wynik pochodzi z oceny wewnętrznej. Nie zapewnia również niezależnych danych klientów pokazujących mniej przeoczonych problemów, mniej niepotrzebnych przerw, krótszy czas rozwiązywania problemów lub lepsze wyniki biznesowe. Kupujący powinni zatem traktować tę liczbę jako miarę produktu zgłaszaną w Anthropic, a nie ustalony dowód wzrostu produktywności.
Ceny i wykorzystanie zasobów pozostają nierozstrzygnięte. VentureBeat informuje, że kontekst dodatkowego kanału nie wlicza się obecnie do limitów wykorzystania ani wydatków w żadnym planie, ale White nie chciał powiedzieć, czy ta polityka będzie kontynuowana. Według doniesień Anthropic oferuje ograniczenia budżetowe powiązane z tożsamościami agentów lub grupami opartymi na rolach, wraz z modelowymi uprawnieniami mającymi na celu zrównoważenie kosztów i wydajności. Źródło nie pozostawia informacji, ile kontekstu system może przetworzyć, jak często ocenia kanały, jakie mogą być przyszłe ceny i czy organizacje będą w stanie kontrolować koszty proaktywnych decyzji.
Pytaniem w dłuższej perspektywie jest to, ile uprawnień przedsiębiorstwa przyznają agentom, którzy inicjują pracę bez bezpośredniego żądania. VentureBeat podaje, że White ostatecznie wyobraża sobie, że organizacje wyznaczają projekty Claude lub nawet cele kwartalne, a system decyduje, które projekty wymagają uwagi i które osoby powinny zostać zaangażowane. Pozostaje to wizją przyszłości, a nie wykazaną w tym raporcie zdolnością. Rodzi to również nierozwiązane pytania dotyczące odpowiedzialności, zgody pracowników, eskalacji, możliwości kontroli oraz tego, czy zalecenia agenta mogą po cichu kształtować priorytety organizacji. Konkurencja również będzie miała znaczenie: Microsoft, Google i Salesforce kontrolują główne platformy w miejscu pracy, podczas gdy Anthropic zakłada, że orkiestracja międzysystemowa może zrównoważyć jej zależność od dystrybucji i integracji innych dostawców.