Co się stało
TechCrunch podaje, że firmy zajmujące się fizyczną sztuczną inteligencją przyciągają duże inwestycje, ale nie wyprodukowały jeszcze robotów o szerokich możliwościach, które niezawodnie wykonują cenną pracę. Programiści na konferencji Actuate opisali niedobory wysokiej jakości danych szkoleniowych, duże wymagania obliczeniowe i nierozwiązane spory dotyczące tego, czy firmy z branży robotyki powinny wspólnie projektować sprzęt i sztuczną inteligencję, czy też budować więcej modeli niezależnych od sprzętu.
TechCrunch podaje, że fizyczna sztuczna inteligencja stała się jednym z najgorętszych obszarów inwestowania typu venture, a firmy stosują techniki związane z dużymi modelami językowymi w robotyce. Placówka łączy entuzjazm branży z firmą Unitree, opisywaną jako wiodący chiński producent robotów, która po pierwszej ofercie publicznej osiągnęła wycenę na 66 miliardów dolarów, po czym w tygodniu, w którym sporządzano raport, straciła prawie połowę tej wartości. TechCrunch twierdzi, że analitycy wskazali na główny problem: zdolności fizyczne robotów poprawiają się, ale ich zdolność do wykonywania pracy tworzącej wartość pozostaje ograniczona. Raport nie potwierdza w sposób niezależny wyceny, wielkości spadku ani tożsamości analityków poza kontem udostępnionym przez TechCrunch.
Według organizatora Foxglove, konferencja TechCrunch dla programistów tworzących systemy sztucznej inteligencji dla robotów, Actuate, rozrosła się do 1500 uczestników i była trzykrotnie większa niż w 2023 roku. Wydarzenie ujawniło zarówno entuzjazm, jak i obawy związane z „kryzysem danych w robotyce”: niedoborem wysokiej jakości danych do modeli szkoleniowych. Z raportu wynika, że uogólnione roboty, które mogą wykonać dowolne zadanie, są jeszcze odległe, a kompleksowe uczenie się w zakresie konkretnych zadań nie przyniosło jeszcze niezawodnych wyników komercyjnych. Dlatego programiści próbują dostosować praktyki z pionierskich laboratoriów AI, w tym zbierać bardziej zróżnicowane dane, eksperymentować z metodami szkoleniowymi i projektować lepsze środowiska uczenia się przez wzmacnianie.
Główna różnica zdań dotyczy tego, jak blisko inteligencja robotów powinna być powiązana z konkretnym sprzętem i branżami. TechCrunch podaje, że dyrektor generalny Wayve, Alex Kendall, woli zacząć od pojazdów autonomicznych, w przypadku których firmy mogą gromadzić istotne dane dotyczące jazdy, a głównym celem jest unikanie kontaktu, a nie manipulowanie środowiskiem. Powiedział portalowi, że infrastruktura danych, operacje symulacyjne i uczenie maszynowe mogą być wspólne dla różnych przykładów wykonania, podczas gdy modele świata fizycznego będą wymagały pewnej specjalizacji. Dyrektor generalny Genesis AI, Théophile Gervet, zajął odmienne stanowisko, mówiąc TechCrunch, że w sektorze jest za wcześnie na osobną „strategię mózgową” i że sprzęt i sztuczna inteligencja powinny być wspólnie projektowane. Z raportu wynika również, że Uber i Wayve uruchomiły laboratoria robotyki skupiające się na humanoidach, podczas gdy Tesla wraz z Optimusem podąża w podobnym kierunku.
Szczegóły źródła: techcrunch.com ↗
Dlaczego to ma znaczenie
Z raportu wynika, że postęp robotyki może w mniejszym stopniu zależeć od jednego modelu ogólnego przeznaczenia, a bardziej od infrastruktury danych, symulacji, doświadczenia w zakresie wdrażania i starannie wybranych zadań komercyjnych. Podkreśla także napięcie pomiędzy budowaniem wąskich produktów, które obecnie generują przychody i dane, a dążeniem do systemów ogólnego przeznaczenia, które mogą ostatecznie je zastąpić.
Raport ma znaczenie, ponieważ opisuje praktyczne wąskie gardło w fizycznej sztucznej inteligencji: sprawny model musi łączyć percepcję, planowanie i poruszanie się z chaotycznymi warunkami rzeczywistego świata. W tekstowej sztucznej inteligencji dodawanie danych i obliczeń może poprawić wydajność bez konieczności fizycznej interakcji maszyny z otoczeniem. Zamiast tego roboty muszą radzić sobie ze zmieniającymi się obiektami, powierzchniami, oświetleniem, odczytami czujników i ograniczeniami bezpieczeństwa. Ze sprawozdania TechCruncha wynika, że branża nie znalazła jeszcze zasadniczo niezawodnego sposobu na przekształcenie tych danych wejściowych w użyteczną pracę.
Strategia komercyjna opisana przez TechCrunch jest kompromisem. Firmy skupione na wąskim zadaniu mogą szybciej umieścić roboty w rzeczywistych środowiskach, uzyskując przychody i zbierając dane dotyczące wdrożenia. W raporcie jako przykłady przytacza się prace Gritta na farmach fotowoltaicznych, wdrożenia przemysłowe Agility i autonomiczne koparki Bedrock. Jednak dane dotyczące konkretnego zadania mogą nie być wystarczająco zróżnicowane, aby stworzyć model ogólnego przeznaczenia. Gervet powiedział TechCrunch, że wąska firma zbudowana w oparciu o model wczesnej generacji może w końcu zostać wyprzedzona przez firmę o silniejszym modelu ogólnym. I odwrotnie, robot ogólnego przeznaczenia, który sprawdza się tylko w około 80% przypadków, może nie być wystarczająco przydatny dla klientów.
Relacja pokazuje również, dlaczego infrastruktura może być tak samo istotna jak sam robot. TechCrunch podaje, że symulacja o wysokiej wierności wymaga większej ilości danych i zasobów obliczeniowych, w tym procesorów graficznych przystosowanych do śledzenia promieni. Firma Foxglove, założona przez byłych pracowników Cruise, jest opisywana jako firma tworząca narzędzia do wyszukiwania i zarządzania gęstymi danymi wizualnymi i lidarowymi generowanymi przez systemy robotyki. Jej nowy produkt, zbudowany w oparciu o otwarty model świata Cosmos firmy Nvidia, ma umożliwić inżynierom korzystanie z zapytań w języku naturalnym do tworzenia ocen i symulacji oraz przyspieszyć selekcję i debugowanie. Twierdzenia te pochodzą z raportów TechCrunch i opisów firm; źródło nie zapewnia niezależnych testów wydajności, wyników klientów ani porównań z alternatywnymi narzędziami.
Mechanizm interaktywny: jak to faktycznie działa
Poznaj interaktywnie technologię leżącą u podstaw tego rozwoju.
crm_get_transaction(id='4092').Which component of an AI application is the machine-learning model itself?
Co obejrzeć dalej
Najważniejszymi sygnałami będą niezawodne wdrożenia, powtarzalna wydajność i dowody na to, że roboty radzą sobie z manipulacją poza kontrolowanymi środowiskami. TechCrunch informuje również, że Foxglove wprowadziło produkt do wyszukiwania danych w języku naturalnym, oparty na modelu świata Cosmos firmy Nvidia, który może pomóc programistom w szybszej ocenie i debugowaniu fizycznych systemów sztucznej inteligencji.
Najjaśniejszym testem będzie to, czy firmy zajmujące się fizyczną sztuczną inteligencją będą w stanie wykazać powtarzalną wydajność w rzeczywistych wdrożeniach, a nie w izolowanych demonstracjach. TechCrunch podaje, że pojazdy autonomiczne przodują częściowo dlatego, że firmy mogą gromadzić duże ilości danych dotyczących jazdy, a prowadzenie pojazdu wymaga głównie unikania kontaktu. Manipulacja jest trudniejsza: robot musi chwytać, pchać, ciągnąć, ustawiać i puszczać przedmioty pomimo różnic w otoczeniu. W raporcie nie przedstawiono standardowych wskaźników powodzenia, liczby wdrożeń, wskaźników awaryjności ani niezależnych ocen omawianych w nim firm.
TechCrunch identyfikuje kilka możliwych kamieni milowych. Kendall stwierdził, że znaczącym przełomem dla konsumentów będzie oderwanie wzroku od pojazdu, wykorzystującego sprzęt o wartości poniżej 1000 dolarów, natomiast Gervet opisał robota, który będzie w stanie zrozumieć żądania w języku naturalnym i wykonywać podstawowe zadania manipulacyjne z niezawodnością wynoszącą co najmniej około 80% od razu po wyjęciu z pudełka. Są to definicje sukcesu respondentów, a nie zademonstrowane rezultaty. Źródło nie określa, kiedy może nastąpić którykolwiek z kamieni milowych, czy próg kosztu sprzętu obejmuje wszystkie koszty systemu ani w jaki sposób będzie mierzona niezawodność w poszczególnych zadaniach i środowiskach.
Kierunek sektora będzie również zależał od tego, czy wyspecjalizowane wdrożenia stworzą trwałą ścieżkę do ogólnej inteligencji, czy jedynie wygenerują izolowane systemy. Dyrektor ds. technicznych firmy Bedrock powiedział TechCrunch, że wykopaliska były początkowym sposobem badania manipulacji w niekontrolowanych warunkach, a długoterminowym celem była warstwa wywiadowcza obejmująca wiele maszyn budowlanych. Dyrektor generalny Foxglove, Adrian Macneil, argumentował, że robotyka może nie mieć ani jednego momentu w stylu ChatGPT, ponieważ dystrybucja przydatnych maszyn w świecie fizycznym jest znacznie trudniejsza niż dystrybucja oprogramowania. Nie wiadomo, czy lepsza symulacja i narzędzia do przetwarzania danych mogą wypełnić tę lukę, ile będzie wymagało wdrożenia nadzoru ze strony człowieka i czy klienci zapłacą za roboty, zanim pojawią się możliwości ogólnego przeznaczenia.