Powrót do Wiadomości
PolitykaAI Understanding odprawa

Scale AI wymaga zwiększenia funduszy federalnych na testowanie modeli granicznych

Scale AI argumentuje, że obecne finansowanie przez rząd USA oceny sztucznej inteligencji jest niewystarczające, aby zaradzić zagrożeniom bezpieczeństwa narodowego, powołując się na nowe badania dotyczące słabych punktów agentów.

4 min readRead the primary source
Source-provided image accompanying Scale AI calls for increased federal funding for frontier model testing
Dokument źródłowyŹródło zapisane
Wydawca
scale.com
Link źródłowy
scale.comhttps://scale.com/blog/steer-the-ai-frontier-washington-must-build-its-testing-power
Typ źródła
Dokument podstawowy — oficjalne ogłoszenie, dokument, zgłoszenie lub strona własna, którą czytamy bezpośrednio.
KontekstZrozum to w 60 sekund

Zacznij tutaj

Sprawdź sięQuiz dotyczący etyki AI

Co się stało

Scale AI wystosowało publiczne wezwanie do rządu USA o znaczne zwiększenie finansowania i infrastruktury na potrzeby niezależnych, pionierskich testów modeli sztucznej inteligencji. Firma argumentuje, że obecny poziom inwestycji federalnych – w szczególności 15–27 mln dolarów zaproponowane dla rządowego granicznego centrum testowania sztucznej inteligencji (CAISI) w roku podatkowym 2027 – jest nieadekwatny do skali obecnego rozwoju sztucznej inteligencji. Scale AI twierdzi, że rząd musi wyjść poza poleganie na wewnętrznych testach laboratoryjnych, aby ustalić własne, oparte na dowodach standardy w zakresie zagrożeń cybernetycznych, biologicznych i związanych z autonomią.

Stanowisko Scale AI podkreśla rosnącą lukę między szybkim rozwojem pionierskich modeli sztucznej inteligencji a zdolnością rządu federalnego do ich oceny. Firma argumentuje, że obecnie proponowane finansowanie rządowego granicznego centrum testowania sztucznej inteligencji, CAISI, jest niewystarczające, aby sprostać wymaganiom współczesnego nadzoru nad sztuczną inteligencją.

Firma podkreśla, że ​​rząd musi stworzyć własną, niezależną infrastrukturę testową, aby oceniać ryzyko w takich obszarach, jak cyberobrona, zagrożenia biologiczne i systemy autonomiczne. Spowodowałoby to przeniesienie ciężaru dowodu z prywatnych laboratoriów, które obecnie wykonują większość testów bezpieczeństwa wewnętrznie.

Szczegóły źródła: scale.com ↗

Dlaczego to ma znaczenie

Debata na temat regulacji dotyczących sztucznej inteligencji jest obecnie utrudniana przez brak standardowych, niezależnych pomiarów. Opierając się na wewnętrznych testach firm, decydenci ryzykują albo nadmierną regulacją opartą na spekulacjach, albo niedostateczną regulacją krytycznych zagrożeń bezpieczeństwa. Ustalenia Scale AI sugerują, że obecne modele mają specyficzne, pomijane luki – takie jak podatność na złośliwe instrukcje podczas przerw w wyjaśnianiu zadań i tendencja do odmawiania pomocy w defensywnych scenariuszach cybernetycznych – które mogą zagrozić infrastrukturze krajowej, takiej jak sieci energetyczne i systemy bankowe, jeśli nie zostaną odpowiednio ocenione przez niezależne podmioty wspierane przez rząd.

Podstawowym problemem jest „luka diagnostyczna” w polityce dotyczącej sztucznej inteligencji. Bez niezależnych, standardowych testów decydenci nie są w stanie rozróżnić hipotetycznego ryzyka od wykazanych zagrożeń. Ta niepewność komplikuje rozwój skutecznych regulacji chroniących bezpieczeństwo publiczne bez tłumienia innowacji.

Wewnętrzne badania Scale AI dostarczają konkretnych przykładów pokazujących, dlaczego jest to istotne: odkryły, że agenci sztucznej inteligencji są podatni na „wstrzyknięcie instrukcji”, gdy zatrzymują się, aby poprosić o wyjaśnienia podczas wykonywania zadań takich jak bankowość lub zarządzanie pocztą elektroniczną. Ponadto zaobserwowali, że modele często odmawiają pomocy w defensywnych operacjach cybernetycznych, co może narazić infrastrukturę krytyczną na ataki w świecie rzeczywistym.

Odkrycia te podkreślają potrzebę testowania środowisk symulujących zagrożenia ze świata rzeczywistego, a nie polegania na standardowych, statycznych testach porównawczych, które mogą przeoczyć szczegółowe awarie zabezpieczeń.

Interactive Mechanism

Mechanizm interaktywny: jak to faktycznie działa

Poznaj interaktywnie technologię leżącą u podstaw tego rozwoju.

Agent Lifecycle Stage:
1
User Intent & Planning: "Audit customer refund request #4092 and settle payment."
2
Tool Calling: Emits structured JSON call crm_get_transaction(id='4092').
3
Guardrail & Verification:🛡️ Paused: High-value action requires human operator sign-off.
4
Final Settlement: Refund recorded, email receipt dispatched, and audit log stored.
Core takeaway: An AI agent is not just a language model—it is a closed loop of planning, tool invocation, and environment feedback. Production systems require self-healing retries and strict human approval guardrails.
Interaktywna kontrola koncepcji+10 Points
AI Ethics Quiz

Why can ethical evaluation not be reduced to one model score?

Co obejrzeć dalej

Obserwatorzy powinni monitorować nadchodzące negocjacje w sprawie budżetu federalnego dotyczące centrum egzaminacyjnego CAISI oraz potencjalnych nowych partnerstw między rządem a prywatnymi firmami oceniającymi. Scale AI wskazało, że w nadchodzących tygodniach udostępni więcej informacji na temat swojej bieżącej pracy z międzynarodowymi rządowymi organami oceniającymi. Dodatkowo skuteczność przyszłej polityki będzie zależała od tego, czy rządowi uda się pomyślnie przejść od teoretycznej oceny ryzyka do wdrożenia rygorystycznych, wystandaryzowanych standardów diagnostycznych dla modeli pionierskich.

Główny nacisk położony jest na proces legislacyjny dotyczący budżetu na rok budżetowy 2027 dotyczący oceny sztucznej inteligencji. Kluczowym punktem spornym pozostaje rozbieżność między żądaniem prezydenta wynoszącym 27 milionów dolarów a propozycją Izby wynoszącą 15 milionów dolarów.

Scale AI obiecało udostępnić więcej informacji na temat współpracy z organami rządowymi w USA, Wielkiej Brytanii, Korei i Singapurze. Partnerstwa te mogą służyć jako wzór tego, w jaki sposób sektor prywatny może wspierać działania ewaluacyjne prowadzone przez rząd.

Branża będzie obserwować, czy rząd przyjmie bardziej agresywne stanowisko w sprawie niezależnych testów, co zasadniczo zmieniłoby krajobraz zgodności w przypadku firm opracowujących pionierskie modele.

Powiązane przewodniki i quizy

Etyka AIWyjaśnienie modeli AIAgenci AIPrzyszłość AISprawdź swoją wiedzę — wypróbuj darmowy quiz dotyczący sztucznej inteligencjiWyszukaj termin związany ze sztuczną inteligencją w naszym glosariuszuPostępuj zgodnie ze ścieżką do śledzenia regulacji AI
Uznałeś to za przydatne?