Co se stalo
AWS publikoval technickou příručku a ukázkové nasazení pro systém poháněný umělou inteligencí, jehož cílem je zachovat a získat institucionální znalosti. Systém využívá generování rozšířeného načítání k zodpovězení otázek z vlastních dokumentů organizace s přístupem k textu a hlasu, volitelnou interakcí s avatarem a ukládáním do mezipaměti navrženým tak, aby omezilo opakované volání modelu.
Příspěvek AWS popisuje implementovatelný prototyp pro uchování toho, co nazývá institucionální nebo „kmenové“ znalosti: postupy, zásady a praktické znalosti, které mohou být obtížně dostupné, když zkušení zaměstnanci odejdou. Organizace nahrávají dokumenty do Amazon S3, kde Amazon Bedrock Knowledge Base zpracovává dokumenty, jejich vkládání a vyhledávání. Vybraný základní model pak generuje odpovědi založené na pasážích získaných z těchto dokumentů. Systém tyto odpovědi prezentuje prostřednictvím rozhraní prohlížeče, které podporuje textovou a hlasovou interakci, a může se připojit k konfigurovatelnému avataru AI. AWS umístí návrh pro nastavení, jako je výroba, zdravotnictví, finanční služby, energetika a státní správa, ale příspěvek nedokumentuje produkční nasazení žádného jmenovaného zákazníka.
Architektura kombinuje Amazon Cognito pro autentizaci, API Gateway pro řízený přístup, AWS Lambda pro orchestraci, Amazon S3 pro aplikační soubory a zdrojový materiál a Amazon OpenSearch Serverless jako vektorové úložiště za znalostní bází. Amazon Titan Text Embeddings se používá pro vkládání dokumentů. Volitelné modely generování odpovědí uvedené v příspěvku jsou Amazon Nova Pro a Anthropic Claude 3 Sonnet. Hlasový vstup je převeden na text pomocí funkce Amazon Transscribe, zatímco Amazon Polly vytváří mluvené odpovědi. Integrace avatarů používá WebRTC pro streamování a WebSockets pro ovládání a příspěvek říká, že technologie avatarů je založena na DeepBrain AI. Organizace mohou změnit poskytovatele avatarů, vzhled, hlas a chování, podle AWS.
Nasazení je poskytováno jako aplikace založená na CloudFormation, kterou podle AWS lze nainstalovat během několika hodin, počínaje jednorázovým nastavením týmem IT nebo DevOps. Uživatelé nahrají zdrojové složky aplikace do bucketu S3, vytvoří zásobník CloudFormation, nakonfigurují přihlašovací údaje a otevřou výslednou adresu URL frontendu. Průvodce byl napsán a testován pro region USA-východ-1, který byl podle AWS vybrán pro širokou dostupnost modelu základů a avatarů. Nasazení jinde vyžadují kontrolu dostupnosti modelu a avatara a v případě potřeby změnu pevně zakódované oblasti. Návrh podporuje dokumenty Word, PDF, prostý text, Markdown a JSON dokumenty, i když AWS pro výkon vyhledávání doporučuje Markdown nebo strukturovaný JSON.
Ukládání do mezipaměti je pro prototyp zásadní. Nejméně používaná mezipaměť na straně prohlížeče ukládá nedávné interakce, zatímco DynamoDB ukládá širší výsledky odezvy s nastavením doby životnosti, která se liší podle typu obsahu. AWS uvádí, že pracovní zátěže s mnoha opakovanými otázkami dosáhly při testování úspěšnosti 50–70 procent, ale zdůrazňuje, že skutečné úspory závisí na mixu dotazů. Implementace odpovídá přesnému textu dotazu spíše než sémantické podobnosti, takže různě formulované verze stejné otázky nemusí znovu použít odpověď. AWS také říká, že nové nebo změněné dokumenty se stanou dotazovatelnými pouze po dokončení úlohy automatického příjmu, nikoli okamžitě.
Podrobnosti o zdroji: aws.amazon.com ↗
Proč na tom záleží
Návrh nabízí organizacím konkrétní způsob, jak přeměnit rozptýlené postupy a odbornou dokumentaci na službu konverzačních znalostí. Jeho praktickou hodnotu zmírňují pokračující náklady, závislost na spolehlivé konektivitě, omezená shoda mezipaměti, zpoždění při přijímání a riziko, že uzemněné odpovědi mohou být stále špatné.
Systém řeší skutečný provozní problém: důležité znalosti se často šíří napříč dokumenty, úložišti a jednotlivými zaměstnanci. Rozhraní v přirozeném jazyce by mohlo usnadnit vyhledávání postupů pro pracovníky, kteří nevědí, kde jsou informace uloženy, nebo kteří dávají přednost mluvení místo psaní. Hlasový přístup může být také užitečný, když pracovníci kontrolují postupy se zaneprázdněnýma rukama, ačkoli zdroj neposkytuje uživatelské studie prokazující, že zlepšuje přijetí nebo důvěru. Smysluplným vývojem je zde kombinace vyhledávání AI založené na dokumentech, zpracování hlasu, ukládání do mezipaměti a avatar do reprodukovatelné cloudové architektury.
Pro organizace vzorek snižuje inženýrskou zátěž spojenou s nezávislou montáží těchto komponent. AWS říká, že vlastní systém Bedrock s hlasem, vykreslováním avatarů, načítáním a ukládáním do mezipaměti by vyžadoval týdny až měsíce a specializované odborné znalosti, zatímco vzorek poskytuje šablony infrastruktury a tok aplikací. Díky tomu bude experimentování přístupnější pro menší technické týmy. Neodstraňuje práci s výběrem autoritativních dokumentů, nastavováním oprávnění, správou uchovávání, kontrolou generovaných odpovědí nebo integrací se stávajícími repozitáři. Tvrzení v článku, že urychlovač je „výrobní kvalita“, je charakteristikou dodavatele; zdroj neposkytuje žádné nezávislé hodnocení ani důkazy od zákazníků.
Architektura také zviditelňuje ekonomiku a řízení podnikové umělé inteligence. Vektorový obchod OpenSearch Serverless má vždy zapnuté minimum a podle AWS může představovat fixní základní náklady ve výši několika stovek amerických dolarů měsíčně při výchozím minimu, před variabilním odvozením a dalšími servisními poplatky. Ukládání do mezipaměti může snížit opakovaná volání modelu, ale neodstraňuje náklady na úložiště, vektorové ukládání, řeč, síť nebo provozní náklady. Zabezpečení závisí na správně nakonfigurované identitě a řízení přístupu napříč několika službami AWS. Protože znalostní báze může obsahovat interní postupy nebo citlivé institucionální informace, nasazení vyžaduje pečlivou autorizaci, správu dokumentů a monitorování. Uzemnění odpovědí v načtených dokumentech může snížit nepodporované odpovědi, ale AWS výslovně říká, že neodstraňuje chyby.
Interaktivní mechanismus: Jak to vlastně funguje
Interaktivně prozkoumejte základní technologii tohoto vývoje.
A route planner searches possible journeys using explicit rules. What does this illustrate about AI?
Na co se dále dívat
Hlavními otázkami je, zda mohou organizace ověřovat prototyp v rámci své vlastní pracovní zátěže, kontrolovat citlivé znalosti a náklady a přidat zabezpečení, které AWS identifikuje jako budoucí nebo doporučená vylepšení. Nezávislé testování je potřebné pro stanovení přesnosti, latence, škálovatelnosti a vlivu interakce založené na avatarech na přijetí.
Prvním testem tohoto systému je přesnost vlastního materiálu organizace, zejména pokud jsou dokumenty v konfliktu, jsou neúplné nebo používají specializovaný jazyk. AWS doporučuje vyhledávat citace zdrojů, ale příspěvek neuvádí přesnost citací, míru přesnosti odpovědí, míru chybných odpovědí ani srovnání s běžným vyhledáváním. Organizace by měly otestovat, zda generované odpovědi věrně odrážejí nejnovější schválený postup a zda uživatelé dokážou rozpoznat, kdy v systému chybí důkazy. Příspěvek doporučuje udržovat člověka ve smyčce pro vysoce důsledková nebo bezpečnostní rozhodnutí. Explicitní prahové hodnoty spolehlivosti a kontroly ověření odpovědí jsou identifikovány jako doporučená vylepšení, nikoli implementované funkce.
Provozní výkon bude třeba měřit spíše než předpokládat z orientačních čísel AWS. Příspěvek uvádí, že výchozí nastavení zvládlo zhruba 50 až 100 souběžných uživatelů s odpověďmi uloženými v mezipaměti za sekundu, zatímco vyšší kvóty by mohly podporovat zhruba 500 až 1 000 uživatelů a stejná architektura by mohla překročit 5 000 s proaktivním zvýšením kvóty. Čerstvé dotazy na znalostní bázi údajně zabraly asi dvě až čtyři sekundy a další čas na zpracování hlasu. Tato čísla závisí na oblasti, modelu, velikosti dokumentu, četnosti přístupů do mezipaměti a kvótách služeb. Zdroj neposkytuje testovací úlohy, metodiku, chybové úsečky ani nezávislou replikaci, takže by se s nimi mělo zacházet spíše jako s odhady plánování než se zárukami.
Konektivita a aktuálnost informací jsou významnými omezeními. Každý dotaz závisí na zpáteční cestě k AWS a avatar vyžaduje stabilní připojení s nízkou latencí a přiměřeně velkou šířkou pásma. AWS říká, že prototyp nemá žádné možnosti offline, okrajového nebo zhoršeného režimu, což omezuje jeho vhodnost pro odpojená nebo přerušovaně připojená průmyslová prostředí. Potrubí přijímání dokumentů je také asynchronní a ukládání přesného textu do mezipaměti může sloužit jako předchozí odpověď, pokud znění a základní okolnosti vyžadují podrobnější kontrolu. Budoucí práce by zahrnovala sémantické porovnávání mezipaměti, offline záložní řešení, elegantní degradaci na text, silnější ověřování odpovědí a přísnější kontroly nákladů. Zdroj neuvádí, kdy nebo zda budou tato vylepšení dodána.