Ce sa întâmplat
AWS a publicat un ghid tehnic și un exemplu de implementare pentru un sistem alimentat cu inteligență artificială menit să păstreze și să recupereze cunoștințele instituționale. Sistemul folosește generarea de recuperare sporită pentru a răspunde la întrebările din documentele proprii ale unei organizații, cu acces text și voce, interacțiune opțională cu avatar și stocare în cache concepute pentru a reduce apelurile repetate de model.
Postarea lui AWS descrie un prototip implementabil pentru păstrarea a ceea ce numește cunoștințe instituționale sau „tribale”: proceduri, politici și expertiză practică care pot deveni dificil de accesat atunci când angajații cu experiență pleacă. Organizațiile încarcă documente în Amazon S3, unde Amazon Bazele de cunoștințe Bedrock se ocupă de fragmentarea, încorporarea și preluarea documentelor. Un model de fundație selectat generează apoi răspunsuri bazate pe pasaje preluate din acele documente. Sistemul prezintă aceste răspunsuri printr-o interfață de browser care acceptă interacțiunea text și vocală și se poate conecta la un avatar AI configurabil. AWS poziționează designul pentru setări precum producție, asistență medicală, servicii financiare, energie și guvern, dar postarea nu documentează o implementare a producției de către niciun client numit.
Arhitectura combină Amazon Cognito pentru autentificare, API Gateway pentru acces controlat, AWS Lambda pentru orchestrare, Amazon S3 pentru fișiere de aplicație și material sursă și Amazon OpenSearch Serverless ca magazin de vectori din spatele bazei de cunoștințe. Amazon Titan Text Embeddings este utilizat pentru încorporarea documentelor. Modelele selectabile de generare a răspunsurilor enumerate în postare sunt Amazon Nova Pro și Anthropic Claude 3 Sonnet. Intrarea vocală este convertită în text cu Amazon Transcribe, în timp ce Amazon Polly produce răspunsuri vorbite. Integrarea avatarului folosește WebRTC pentru streaming și WebSockets pentru control, iar postarea spune că tehnologia avatarului se bazează pe DeepBrain AI. Organizațiile pot schimba furnizorul de avatar, aspectul, vocea și comportamentul, conform AWS.
Implementarea este furnizată ca o aplicație bazată pe CloudFormation despre care AWS spune că poate fi instalată în câteva ore, începând cu o configurare unică de către o echipă IT sau DevOps. Utilizatorii încarcă folderele sursă ale aplicației într-un bucket S3, creează o stivă CloudFormation, configurează detaliile de conectare și deschid adresa URL de front-end rezultată. Ghidul a fost scris și testat pentru Regiunea us-east-1, despre care AWS spune că a fost selectată pentru disponibilitatea amplă a modelului de bază și a difuzării avatarului. Implementările în altă parte necesită verificarea disponibilității modelului și avatarului și schimbarea Regiunii hardcoded, acolo unde este necesar. Designul acceptă documente Word, PDF, text simplu, Markdown și JSON, deși AWS recomandă Markdown sau JSON structurat pentru performanța de recuperare.
Memorarea în cache este esențială pentru prototip. O memorie cache folosită cel mai puțin recent din partea browser-ului stochează interacțiunile recente, în timp ce DynamoDB stochează rezultate mai ample de răspuns cu setări de durată de viață care variază în funcție de tipul de conținut. AWS raportează că sarcinile de lucru cu multe întrebări repetate au atins rate de accesare a memoriei cache de 50-70 la sută în timpul testării sale, dar subliniază că economiile reale depind de mixul de interogări. Implementarea se potrivește cu textul interogării exacte, mai degrabă decât cu similaritatea semantică, astfel încât versiunile formulate diferit ale aceleiași întrebări nu pot reutiliza un răspuns. AWS spune, de asemenea, că documentele noi sau modificate devin interogabile numai după finalizarea unei sarcini de asimilare automată, mai degrabă decât imediat.
Detalii sursa: aws.amazon.com ↗
De ce contează
Designul oferă organizațiilor o modalitate concretă de a transforma procedurile dispersate și documentația expertă într-un serviciu de cunoștințe conversaționale. Valoarea sa practică este temperată de costurile continue, dependența de conectivitate fiabilă, potrivirea limitată a memoriei cache, întârzierile de asimilare și riscul ca răspunsurile bazate pe pământ să fie încă greșite.
Sistemul abordează o problemă operațională reală: cunoștințele importante sunt adesea răspândite în documente, depozite și angajați individuali. O interfață în limbaj natural ar putea face procedurile mai ușor de localizat pentru lucrătorii care nu știu unde sunt stocate informațiile sau care preferă să vorbească în loc să tasteze. Accesul vocal poate fi, de asemenea, util atunci când lucrătorii examinează procedurile cu mâinile ocupate, deși sursa nu oferă studii despre utilizatori care să demonstreze că îmbunătățește adoptarea sau încrederea. Dezvoltarea semnificativă aici este combinația dintre recuperarea AI bazată pe documente, procesarea vocii, stocarea în cache și un avatar într-o arhitectură cloud reproductibilă.
Pentru organizații, eșantionul reduce sarcina de inginerie a asamblarii acestor componente în mod independent. AWS spune că un sistem Bedrock personalizat cu voce, redare avatar, recuperare și stocare în cache ar necesita săptămâni până la luni și expertiză specializată, în timp ce eșantionul oferă șabloane de infrastructură și un flux de aplicații. Acest lucru poate face experimentarea mai accesibilă pentru echipele tehnice mai mici. Nu elimină munca de selectare a documentelor autorizate, stabilirea permisiunilor, gestionarea păstrării, revizuirea răspunsurilor generate sau integrarea cu depozitele existente. Afirmația articolului că acceleratorul este „calitate de producție” este o caracterizare a furnizorului; sursa nu oferă nicio evaluare independentă sau dovezi ale clienților.
Arhitectura face, de asemenea, vizibile economia și guvernanța IA a întreprinderii. Magazinul de vectori OpenSearch Serverless are un minim permanent și, conform AWS, poate reprezenta un cost de bază fix de câteva sute de dolari SUA pe lună la nivelul implicit, înainte de inferența variabilă și alte taxe de serviciu. Memorarea în cache poate reduce apelurile repetate de model, dar nu elimină costurile de stocare, stocare vectorială, vorbire, rețea sau costurile operaționale. Securitatea depinde de identitatea configurată corect și controalele de acces în mai multe servicii AWS. Deoarece baza de cunoștințe poate conține proceduri interne sau informații instituționale sensibile, o implementare necesită o autorizare atentă, guvernare și monitorizare a documentelor. Punerea la pământ a răspunsurilor în documentele preluate poate reduce răspunsurile neacceptate, dar AWS spune în mod explicit că nu elimină erorile.
Mecanism interactiv: cum funcționează de fapt
Explorați tehnologia care stau la baza acestei dezvoltări în mod interactiv.
A route planner searches possible journeys using explicit rules. What does this illustrate about AI?
Ce să urmărești în continuare
Principalele întrebări sunt dacă organizațiile pot valida prototipul sub propriile sarcini de lucru, pot controla cunoștințele și costurile sensibile și pot adăuga garanții pe care AWS le identifică ca îmbunătățiri viitoare sau recomandate. Este necesară testarea independentă pentru a stabili acuratețea, latența, scalabilitatea și efectul interacțiunii bazate pe avatar asupra adoptării.
Primul test pentru acest sistem este acuratețea materialului propriu al unei organizații, mai ales atunci când documentele sunt în conflict, sunt incomplete sau folosesc limbaj specializat. AWS recomandă citirea surselor la suprafață, dar postarea nu raportează acuratețea citărilor, ratele de acuratețe a răspunsurilor, ratele de răspuns fals sau comparații cu căutarea obișnuită. Organizațiile ar trebui să testeze dacă răspunsurile generate reflectă cu fidelitate cea mai recentă procedură aprobată și dacă utilizatorii pot recunoaște când sistemul nu are dovezi. Postarea recomandă menținerea unui om la curent pentru deciziile cu consecințe mari sau legate de siguranță. Pragurile explicite de încredere și verificările de validare a răspunsurilor sunt identificate ca îmbunătățiri recomandate, nu funcții implementate.
Performanța operațională va trebui să fie măsurată mai degrabă decât presupusă din cifrele indicative ale AWS. Postarea raportează că configurația implicită a gestionat aproximativ 50 până la 100 de utilizatori concurenți cu răspunsuri în cache în mai puțin de secunde, în timp ce cote mai mari ar putea suporta aproximativ 500 până la 1.000 de utilizatori și aceeași arhitectură ar putea depăși 5.000 cu creșteri proactive ale cotei. Interogările noi din baza de cunoștințe au durat aproximativ două până la patru secunde, cu timp suplimentar pentru procesarea vocii. Aceste cifre depind de regiune, model, dimensiunea documentului, rata de accesare a memoriei cache și cotele de servicii. Sursa nu furnizează încărcături de lucru de testare, metodologie, bare de eroare sau replicare independentă, așa că ar trebui tratate ca estimări de planificare și nu ca garanții.
Conectivitatea și prospețimea informațiilor sunt constrângeri semnificative. Fiecare interogare depinde de o călătorie dus-întors la AWS, iar avatarul necesită conectivitate stabilă, cu latență scăzută și cu lățime de bandă destul de mare. AWS spune că prototipul nu are capacitate offline, edge sau în mod degradat, limitându-și adecvarea pentru medii industriale deconectate sau conectate intermitent. Conducta de asimilare a documentelor este, de asemenea, asincronă, iar memorarea în cache a textului exact poate servi un răspuns anterior atunci când formularea și circumstanțele subiacente necesită o revizuire mai atentă. Lucrările viitoare ar include potrivirea semantică a memoriei cache, backline offline, degradarea grațioasă a textului, validarea mai puternică a răspunsurilor și controale mai stricte ale costurilor. Sursa nu spune când sau dacă vor fi livrate acele îmbunătățiri.