Vad hände
Anthropic öppnade en forskningsförhandsvisning av sin Model Hardware Standard (MHS) för en första grupp av vetenskapliga forskningslabb och avancerade tillverkare. Specifikationen är utformad för att ge AI-agenter ett vanligt sätt att upptäcka, övervaka och kontrollera programmerbara fysiska enheter, inklusive mikroskop, vätskehanterare, robotarmar, plattläsare och andra instrument.
Anthropic säger att MHS är en delad specifikation för AI-agenter som använder fysisk utrustning och är initialt tillgänglig för utvalda forskningslabb och avancerade tillverkare. Företaget utvecklade det med HHMI Janelia Research Campus och säger att det arbetar med partners inom vetenskap, robotik, elektronik och tillverkning innan de gör standarden med öppen källkod. MHS beskrivs som modellagnostisk: vilken agent som helst kan komma åt den via standardprotokoll som Model Context Protocol, och den är avsedd att fungera med enheter som exponerar ett programmerbart gränssnitt. Källan anger inte ett allmänt utgivningsdatum, listar inte de första förhandsvisningsdeltagarna i sin helhet eller fastställer att standarden har antagits oberoende utöver de beskrivna projekten.
Kärndesignen är en standardiserad drivrutin som översätts mellan en dator och en hårdvaruenhet. Dess grundläggande funktioner inkluderar kommandon som att läsa en temperatur eller skriva en ny temperatur, medan ett delat upptäcktsformat låter enheter och agenter hitta varandra över nätverk. MHS stöder också taggar på naturligt språk som beskriver egenskaper som kanske inte är uppenbara från koden, såsom en robotarms vikt eller en enhets säkerhetsgränser. Föraren använder dessa taggar för att skapa en referensfil som beskriver vad en enhet kan mäta, vad som kan justeras och vilka gränser som bör tillämpas. Agenter kan sedan styra utrustning via MCP, ett kommandoradsgränssnitt eller kodfiler, vilket gör att flera instrument kan orkestreras från en enda kodrad eller ett arbetsflöde på högre nivå.
Partnerexemplen var demonstrationer snarare än färdigställda autonoma produktionssystem. Genentech använde MHS med en vätskehanterare, robotarm och plattläsare för en proof-of-concept BCA-proteinanalys. Anthropic säger att Claude optimerade vätskeöverföringsflöden med hjälp av färgad vätska, mätningar av plattläsare och en expertjämförelse, och nådde cirka 140 mikroliter per sekund för vatten och 10 mikroliter per sekund för viskös BSA i den uppsättningen. Vid Carnegie Mellon University använde forskare MHS för att koordinera en vätskehanterare, plåtläsare, robotarm och kameror över tre datorer; de rapporterar att de utvecklar integrationen och slutförde en autonom repris på åtta timmar, jämfört med en typisk leverantörsinstallation som tar flera veckor. De rapporterar också att systemet blockerade sex artificiellt framkallade osäkra förhållanden innan utrustningen flyttades. Andra demonstrationer involverade qPCR-övervakning, fjärrinstrumentstatus och samordnade plattöverlämningar.
Källinformation: anthropic.com ↗
Varför det spelar roll
MHS riktar sig mot en praktisk barriär för AI-riktad experimentering: utrustning från olika leverantörer använder ofta inkompatibel programvara och kräver skräddarsydda integrationer. Anthropic och dess partners säger att standarden minskade vissa integrationsuppgifter från veckor eller månader till timmar, samtidigt som agenterna kunde sekvensera experiment, justera parametrar och svara på vissa fel. Demonstrationer visar också varför fysisk AI kräver mer än generella resonemang: modeller kan agera autonomt samtidigt som de missförstår orsakerna till hårdvaru- och laboratoriefel.
Källan identifierar utrustningsintegration som en flaskhals i både akademisk forskning och industriella experiment. Laboratorier kombinerar ofta instrument med olika programmeringsspråk, dataformat, styrsystem eller inget formellt API alls. University of Washington-exemplet beskriver sex instrument som ansluts på mindre än en vecka, inklusive drivrutinsutveckling, medan Carnegie Mellon-exemplet involverade en plåtläsare som styrdes genom dess grafiska gränssnitt, en vätskehanterare som använder ett äldre Windows-skriptgränssnitt och en robotarm som drivs av schemalagda filer. Om de rapporterade minskningarna av installationstiden generaliseras, skulle ett gemensamt gränssnitt kunna göra små eller akademiska laboratorier mer kapabla att automatisera flexibla experiment utan att driftsätta ett stort anpassat system.
MHS är särskilt viktigt eftersom det gör AI-agenten till en aktiv koordinator för fysiskt arbete snarare än bara ett verktyg för samtal eller analys. I de beskrivna arbetsflödena tar agenten emot driftsdata, sekvenserar steg över instrument, övervakar resultat och ändrar parametrar när förhållandena ändras. Claude utforskade också en laserjusteringsuppgift genom att justera lasern, observera strålen genom en kamera och upprepa processen innan den packade in det den lärde sig i ett deterministiskt skript. I exemplen Genentech och Carnegie Mellon utvärderade agenten mätningar och bestämde sig för att ändra en procedur eller acceptera ett resultat. Dessa är användbara funktioner för experiment som involverar upprepade överlämningar, men källan presenterar dem som tidiga demonstrationer, inte som bevis på bred vetenskaplig autonomi eller förbättrade medicinska resultat.
Demonstrationerna avslöjar också ett centralt säkerhetsproblem. Anthropic säger att Claude återhämtade sig från vissa tipphämtnings- och vätskedetekteringsfel, men reagerade initialt på bubblor under vätskehanteringen genom att försöka samma brunn igen, vilket förvärrade problemet. Forskare var tvungna att förklara den fysiska orsaken, flytta till en ren brunn och minska blandningscyklerna; dessa lektioner kodades senare som återanvändbara färdigheter. Carnegie Mellons säkerhetskontroller var avsiktligt inducerade tester, och dess dosresponsarbete använde ett kolorimetriskt färgämne snarare än en riktig läkemedelskandidat. Källan stöder därför en snävare slutsats: MHS kan hjälpa agenter att driva och koordinera utrustning i begränsade proof-of-concept-miljöer, medan fysisk, kemisk och biologisk bedömning förblir en viktig begränsning.
Interaktiv mekanism: hur det faktiskt fungerar
Utforska den underliggande tekniken bakom denna utveckling interaktivt.
An agent must create a draft calendar event for Tuesday at 2 p.m. Which evidence would establish the requested result?
Vad du ska titta på härnäst
Förhandsvisningen är inte bevis på att helt autonoma laboratorier är redo för rutinbruk. Anthropic säger att de planerar fler säkerhetsutvärderingar, ytterligare hårdvarustöd och tydligare regler för mänskligt godkännande av högriskbeslut. Viktiga okända är bland annat hur tillförlitligt MHS fungerar över enheter och domäner, hur ofta agenter återhämtar sig på ett säkert sätt från fel, vilka långsiktiga övervakningskostnader och om andra tillverkare och modellutvecklare använder den föreslagna standarden.
Nästa steg är validering bortom kontrollerade demonstrationer. Carnegie Mellon säger att de planerar att testa riktiga läkemedelskandidater och ersätta färgämnessignalen med mätningar av biologiska effekter. Anthropic säger att bredare arbetsflöden för upptäckt av läkemedel kommer att kräva stöd för centrifuger, inkubatorer, analysinstrument och sensorer, tillsammans med agentselar som förstår förhållanden som sträcker sig från molekyler till levande celler. University of Washingtons arbete beskriver på liknande sätt mer komplexa design-bygg-test-lär-cykler som ett framtida mål. Dessa expansioner kommer att testa om ett standardgränssnitt kan bevara säkerhet och tillförlitlighet när experiment involverar fler enheter, längre körtider och mindre förutsägbara material.
Säkerhetsutvärdering och mänsklig tillsyn kommer att vara avgörande. Anthropic säger att de delar den tidiga standarden med partners för att utveckla säkerhetsutvärderingar och bästa praxis, medan Carnegie Mellon säger att de planerar ytterligare kontroller, kontinuerlig övervakning av enhetens känslighet och förfinade procedurer för att kräva mänskligt godkännande av högriskbeslut. Källan anger inte godkännandetrösklar, felfrekvenser, revisionsmetoder eller konsekvenser när en agent fattar ett felaktigt fysiskt beslut. Det fastställer inte heller om det rapporterade återhämtningsbeteendet förblir tillförlitligt över olika instrument, laboratorier eller agentmodeller. De saknade mätningarna är nödvändiga för att bedöma om MHS är en pålitlig driftstandard snarare än ett användbart integrationslager för demonstrationer.
Adoption och ekonomi förblir öppna frågor. Anthropic säger att MHS bör minska det skräddarsydda integrationsarbetet och att standardiserade drivrutiner som utvecklats i Carnegie Mellon-projektet kommer att göras allmänt tillgängliga, men tidpunkten och omfattningen av frisläppandet av öppen källkod anges inte. University of Washington-kontot noterar att kontinuerlig agentövervakning har beräkningskostnader som måste vägas mot forskarens sparade tid. Framtida täckning bör undersöka vem som underhåller enhetsdrivrutiner, hur säkerhetsgränser verifieras, om tillverkare stöder standarden, hur åtkomst styrs under förhandsvisningen och om modellagnostisk drift fungerar i praktiken. Det bredare påståendet att autonoma vetenskapliga arbetsflöden dygnet runt blir tillgängliga förblir en framåtblickande ambition, inte ett självständigt demonstrerat resultat.