Co się stało
GIGAZINE donosi, że Cognition, firma stojąca za Devinem, wypuściła Fusion, uprząż zaprojektowaną w celu usprawnienia planowania, wykonywania, przeglądania i odzyskiwania zablokowanych zadań przez zaawansowane modele AI. System łączy zaawansowany model planowania i przeglądu z tańszym modelem realizacji, jednocześnie uruchamiając dwóch agentów równolegle z oddzielnymi kontekstami i narzędziami.
GIGAZINE donosi, że Cognition opracowało i wypuściło Fusion jako uprząż dla GPT-6 Astra OpenAI i Claude Fable Anthropic. W artykule opisano uprząż jako warstwę dostarczającą modelom instrukcje obsługi, zasady użycia narzędzi i rozgałęzienia warunkowe, potencjalnie wpływające na to, czy agent wykona zadanie, czy też utknie w pętli.
Według GIGAZINE Fusion łączy najnowocześniejszy model planowania i przeglądu z opłacalnym modelem realizacji. Firma Cognition rekomendowała GPT-6 Astra i Claude Fable jako zaawansowane modele i określiła model kodowania SWE-2 firmy Cognition jako tańszą opcję wykonania. W artykule napisano, że kombinacja działała najlepiej z Claude Fable 5.1.
GIGAZINE podaje wynik testu porównawczego na poziomie 62,2 dla Claude Fable 5.1 z Claude Code w porównaniu z 61,7 dla Claude Fable 5.1 w połączeniu z tańszym modelem i Fusion. To drugie połączenie uznano za o 36% tańsze. W artykule podano, że w przypadku GPT-6 Astra Fusion osiągnął wydajność równoważną Codex, jednocześnie obniżając koszty o 39%.
W artykule przypisano oceny firmom zajmującym się analizą sztucznej inteligencji, Artificial Analysis i Vals AI. Mówi, że Fusion obsługuje równolegle dwóch agentów, każdy z niezależnym kontekstem i narzędziami, i wymienia jedynie podsumowania, wyniki i opinie, a nie pełną rozmowę. GIGAZINE twierdzi, że to podejście w większym stopniu wykorzystuje natychmiastowe buforowanie. Źródło nie podaje pełnej metodologii benchmarku, cen bezwzględnych ani warunków dostępności.
Szczegóły źródła: gigazine.net ↗
Dlaczego to ma znaczenie
Jeśli zgłoszone wyniki się sprawdzą, Fusion może obniżyć koszty korzystania z pionierskich agentów AI bez porównywalnej utraty wydajności kodowania. Ma to znaczenie dla programistów i organizacji korzystających z systemów wykorzystujących narzędzia na dużą skalę, gdzie wnioskowanie o modelach i powtarzające się próby agentów mogą stać się poważnymi wydatkami. Wyniki zostały opublikowane przez GIGAZINE i ocenione przez Artificial Analysis i Vals AI, ale źródło nie zapewnia wystarczającej metodologii, aby niezależnie ocenić porównania.
Zgłoszone wyniki sugerują, że architektura agentów może w istotny sposób wpłynąć na ekonomikę modeli granicznych. System, który deleguje wykonanie do tańszego modelu, zachowując silniejszy model na potrzeby planowania i przeglądu, mógłby obniżyć koszty agentów programowych bez konieczności porzucania przez użytkowników modeli o większej wydajności.
Redukcja kosztów jest szczególnie istotna w przypadku agentów kodujących, którzy mogą wykonywać wiele wywołań narzędzi, powtarzać nieudane próby lub utrzymywać długie konteksty. Jeśli raportowane obniżki o 36% i 39% będą możliwe do niezależnej reprodukcji, mogą wpłynąć na sposób, w jaki firmy projektują przepływy pracy agentów produkcyjnych i wybierają pomiędzy zastrzeżonymi zestawami narzędzi.
Dowody zawarte w dostarczonym raporcie są ograniczone. GIGAZINE udostępnia wybrane wyniki i procentowe oszczędności, ale nie podaje zestawu zadań, liczby uruchomień, założeń cenowych, opóźnień, wskaźników awaryjności ani warunków porównawczych. Dlatego też deklarowana równoważność z Codex i stwierdzony wzrost wydajności nie zostały tutaj niezależnie potwierdzone.
Mechanizm interaktywny: jak to faktycznie działa
Poznaj interaktywnie technologię leżącą u podstaw tego rozwoju.
crm_get_transaction(id='4092').An agent must create a draft calendar event for Tuesday at 2 p.m. Which evidence would establish the requested result?
Co obejrzeć dalej
Kluczowe pytania brzmią: kto może uzyskać dostęp do Fusion, jakie modele i narzędzia obsługuje, czy jest ogólnie dostępny i jak obliczane są jego koszty. Dalsze raportowanie powinno wyjaśnić zadania testowe, wartości bazowe, rozmiary próbek, założenia dotyczące pamięci podręcznej podpowiedzi oraz to, czy wyniki można przenieść poza kodowanie. Źródło używa również zarówno „SWE-2”, jak i „SWR-2” w przypadku tańszego modelu, co stanowi niespójność, którą należy usunąć.
Warunki dostępu nie są udokumentowane w źródle. Nie wiadomo, czy Fusion można pobrać publicznie, uzyskać za pośrednictwem produktów Cognition, ograniczyć się do wybranych użytkowników lub oferować w ramach innej umowy komercyjnej. Nieznane są również ceny i wymagane subskrypcje modeli.
Raporty uzupełniające powinny ustalić, czy Fusion obsługuje modele inne niż GPT-6 Astra i Claude Fable, czy użytkownicy mogą dostarczać własne narzędzia i podpowiedzi oraz jaka część oszczędności zależy od szybkiego buforowania lub cen konkretnego dostawcy.
Nazewnictwo testów porównawczych zawiera niespójność na poziomie źródła: w artykule tańszy model kodowania określono jako SWE-2, ale później odniesiono się do „SWR-2”. Oznaczenie to należy zweryfikować, zanim potraktujemy porównanie jako precyzyjną deklarację produktu.
Niezależne testy powinny zbadać wskaźniki powodzenia kodowania, opóźnienia, niezawodność, obsługę kontekstu i wydajność w przypadku zadań innych niż zgłoszony test porównawczy. Równolegli agenci mogą również zwiększyć złożoność orkiestracji lub całkowitą aktywność narzędzi, nawet gdy koszty modelu spadną.