Torna alle notizie
ImpresaAI Understanding briefing

AWS pubblica un prototipo distribuibile di gestione della conoscenza dell'intelligenza artificiale per la conoscenza istituzionale

AWS ha pubblicato un sistema di gestione della conoscenza basato sull'intelligenza artificiale personalizzabile che risponde a domande testuali o vocali utilizzando documenti archiviati da un'organizzazione. Il prototipo combina Amazon Bedrock Knowledge Base, un archivio vettoriale, memorizzazione nella cache delle risposte e un'interfaccia avatar opzionale, mentre AWS avverte che rimane dipendente dal cloud...

6 min readRead the primary source
Primary-source image accompanying AWS publishes deployable AI knowledge-management prototype for institutional knowledge
Documento di origine primariaFonte registrata
Editore
aws.amazon.com
Collegamento alla fonte
aws.amazon.comhttps://aws.amazon.com/blogs/machine-learning/democratizing-institutional-knowledge-building-an-ai-powered-knowledge-management-system-with-aws/
Tipo di fonte
Documento principale: un annuncio ufficiale, un documento, un documento o una pagina proprietaria che leggiamo direttamente.
ContestoComprendilo in 60 secondi

Inizia qui

Termini chiave

API (interfaccia di programmazione dell'applicazione)
Un modo strutturato con cui un sistema software invia richieste e riceve risposte da un altro sistema.
RAG (generazione aumentata di recupero)
Un metodo che recupera la conoscenza esterna e la alimenta nella generazione al momento dell'inferenza.
Modello di fondazione
Un modello pre-addestrato di grandi dimensioni che può essere adattato a molte attività a valle.
Mettiti alla provaCos'è l'intelligenza artificiale? Quiz

Cosa è successo

AWS ha pubblicato una guida tecnica e un esempio di implementazione di un sistema basato sull'intelligenza artificiale destinato a preservare e recuperare la conoscenza istituzionale. Il sistema utilizza la generazione aumentata di recupero per rispondere alle domande dai documenti di un'organizzazione, con accesso vocale e testuale, interazione opzionale con avatar e memorizzazione nella cache progettata per ridurre le chiamate ripetute ai modelli.

Il post di AWS descrive un prototipo implementabile per preservare quella che chiama conoscenza istituzionale o “tribale”: procedure, politiche e competenze pratiche a cui può diventare difficile accedere quando i dipendenti esperti se ne vanno. Le organizzazioni caricano i documenti su Amazon S3, dove Amazon Bedrock Knowledge Bases gestisce la suddivisione, l'incorporamento e il recupero dei documenti. Un modello di fondazione selezionato genera quindi risposte basate su passaggi recuperati da tali documenti. Il sistema presenta queste risposte attraverso un'interfaccia browser che supporta l'interazione testuale e vocale e può connettersi a un avatar AI configurabile. AWS posiziona il progetto per ambienti quali produzione, sanità, servizi finanziari, energia e governo, ma il post non documenta un'implementazione della produzione da parte di alcun cliente nominato.

L'architettura combina Amazon Cognito per l'autenticazione, API Gateway per l'accesso controllato, AWS Lambda per l'orchestrazione, Amazon S3 per i file applicativi e il materiale sorgente e Amazon OpenSearch Serverless come archivio vettoriale dietro la knowledge base. Amazon Titan Text Embeddings viene utilizzato per gli incorporamenti di documenti. I modelli selezionabili per la generazione di risposte elencati nel post sono Amazon Nova Pro e Anthropic Claude 3 Sonnet. L'input vocale viene convertito in testo con Amazon Transcribe, mentre Amazon Polly produce risposte vocali. L'integrazione dell'avatar utilizza WebRTC per lo streaming e WebSocket per il controllo e il post afferma che la tecnologia avatar è basata su DeepBrain AI. Secondo AWS, le organizzazioni possono modificare il fornitore dell'avatar, l'aspetto, la voce e il comportamento.

La distribuzione viene fornita come applicazione basata su CloudFormation che secondo AWS può essere installata in poche ore, a partire da una configurazione una tantum da parte di un team IT o DevOps. Gli utenti caricano le cartelle di origine dell'applicazione su un bucket S3, creano uno stack CloudFormation, configurano i dettagli di accesso e aprono l'URL frontend risultante. La guida è stata scritta e testata per la regione degli Stati Uniti orientali-1, che secondo AWS è stata selezionata per l'ampia disponibilità di modelli di base e streaming di avatar. Le distribuzioni altrove richiedono il controllo della disponibilità del modello e dell'avatar e la modifica della regione codificata ove necessario. Il design supporta documenti Word, PDF, testo semplice, Markdown e JSON, sebbene AWS consigli Markdown o JSON strutturato per le prestazioni di recupero.

La memorizzazione nella cache è fondamentale per il prototipo. Una cache lato browser utilizzata meno di recente memorizza le interazioni recenti, mentre DynamoDB memorizza risultati di risposta più ampi con impostazioni di time-to-live che variano in base al tipo di contenuto. AWS segnala che i carichi di lavoro con molte domande ripetute hanno raggiunto tassi di successo della cache del 50-70% nei suoi test, ma sottolinea che i risparmi effettivi dipendono dal mix di query. L'implementazione corrisponde al testo esatto della query piuttosto che alla somiglianza semantica, quindi versioni della stessa domanda formulate in modo diverso potrebbero non riutilizzare una risposta. AWS afferma inoltre che i documenti nuovi o modificati diventano interrogabili solo dopo il completamento di un processo di inserimento automatizzato, anziché immediatamente.

Dettagli della fonte: aws.amazon.com ↗

Perché è importante

Il progetto offre alle organizzazioni un modo concreto per trasformare procedure sparse e documentazione di esperti in un servizio di conoscenza conversazionale. Il suo valore pratico è mitigato dai costi continui, dalla dipendenza da una connettività affidabile, dalla corrispondenza limitata della cache, dai ritardi di acquisizione e dal rischio che le risposte fondate possano ancora essere errate.

Il sistema affronta un vero problema operativo: la conoscenza importante è spesso diffusa tra documenti, archivi e singoli dipendenti. Un'interfaccia in linguaggio naturale potrebbe facilitare l'individuazione delle procedure per i lavoratori che non sanno dove sono archiviate le informazioni o che preferiscono parlare anziché digitare. L’accesso vocale può essere utile anche quando i lavoratori rivedono le procedure con le mani occupate, sebbene la fonte non fornisca studi sugli utenti che dimostrino che ciò migliori l’adozione o la fiducia. Lo sviluppo significativo qui è la combinazione di recupero AI basato su documenti, elaborazione vocale, memorizzazione nella cache e avatar in un'architettura cloud riproducibile.

Per le organizzazioni, il campione riduce l'onere ingegneristico di assemblare questi componenti in modo indipendente. AWS afferma che un sistema Bedrock personalizzato con voce, rendering di avatar, recupero e memorizzazione nella cache richiederebbe settimane o mesi e competenze specializzate, mentre l'esempio fornisce modelli di infrastruttura e un flusso di applicazioni. Ciò può rendere la sperimentazione più accessibile ai team tecnici più piccoli. Non elimina il lavoro di selezione di documenti autorevoli, impostazione di autorizzazioni, gestione della conservazione, revisione delle risposte generate o integrazione con repository esistenti. L’affermazione dell’articolo secondo cui l’acceleratore è “qualità di produzione” è una caratterizzazione del fornitore; la fonte non fornisce alcuna valutazione indipendente o prova del cliente.

L’architettura rende inoltre visibili gli aspetti economici e la governance dell’intelligenza artificiale aziendale. L'archivio vettoriale OpenSearch Serverless ha un minimo sempre attivo e, secondo AWS, può rappresentare un costo di base fisso di poche centinaia di dollari USA al mese al prezzo minimo predefinito, prima dell'inferenza variabile e di altri costi di servizio. La memorizzazione nella cache può ridurre le chiamate di modello ripetute, ma non elimina i costi di archiviazione, memorizzazione di vettori, voce, rete o operativi. La sicurezza dipende dall'identità configurata correttamente e dai controlli di accesso su diversi servizi AWS. Poiché la base di conoscenza può contenere procedure interne o informazioni istituzionali sensibili, una distribuzione richiede un'attenta autorizzazione, governance dei documenti e monitoraggio. Fondare le risposte nei documenti recuperati può ridurre le risposte non supportate, ma AWS afferma esplicitamente che non elimina gli errori.

Interactive Mechanism

Meccanismo interattivo: come funziona realmente

Esplora la tecnologia alla base di questo sviluppo in modo interattivo.

System Requirements:
Best ArchitecturePure RAGRecommended pattern
Hallucination RiskVery LowGrounding efficacy
Update Cost$0 (Vector sync)Ongoing maintenance
Core takeaway: Fine-tuning teaches models how to speak (form, style, syntax); RAG teaches models what to say (verifiable facts). Never use fine-tuning alone for factual memory.
Verifica concettuale interattiva+10 Points
What is AI? Quiz

A route planner searches possible journeys using explicit rules. What does this illustrate about AI?

Cosa guardare dopo

Le domande principali sono se le organizzazioni possono convalidare il prototipo in base ai propri carichi di lavoro, controllare conoscenze e costi sensibili e aggiungere garanzie che AWS identifica come miglioramenti futuri o consigliati. Sono necessari test indipendenti per stabilire l’accuratezza, la latenza, la scalabilità e l’effetto dell’interazione basata su avatar sull’adozione.

Il primo test per questo sistema è l’accuratezza del materiale di un’organizzazione, soprattutto quando i documenti sono in conflitto, sono incompleti o utilizzano un linguaggio specializzato. AWS consiglia di far emergere citazioni di fonti, ma il post non riporta l'accuratezza delle citazioni, i tassi di accuratezza delle risposte, i tassi di risposte false o i confronti con la ricerca ordinaria. Le organizzazioni dovrebbero verificare se le risposte generate riflettono fedelmente l’ultima procedura approvata e se gli utenti possono riconoscere quando il sistema manca di prove. Il post raccomanda di tenere un essere umano informato sulle decisioni con conseguenze elevate o relative alla sicurezza. Le soglie di confidenza esplicite e i controlli di convalida delle risposte sono identificati come miglioramenti consigliati, non come funzionalità implementate.

Le prestazioni operative dovranno essere misurate piuttosto che ipotizzate in base alle cifre indicative di AWS. Il post riporta che la configurazione predefinita gestiva circa 50-100 utenti simultanei con risposte memorizzate nella cache in meno di un secondo, mentre quote più elevate potrebbero supportare circa 500-1.000 utenti e la stessa architettura potrebbe superare i 5.000 con aumenti proattivi delle quote. Secondo quanto riferito, le nuove query sulla knowledge base hanno richiesto dai due ai quattro secondi, con tempo aggiuntivo per l'elaborazione vocale. Queste cifre dipendono dalla regione, dal modello, dalle dimensioni del documento, dalla percentuale di riscontri nella cache e dalle quote di servizio. La fonte non fornisce carichi di lavoro di test, metodologia, barre di errore o replica indipendente, quindi dovrebbero essere trattati come stime di pianificazione piuttosto che come garanzie.

La connettività e la freschezza delle informazioni rappresentano vincoli significativi. Ogni query dipende da un viaggio di andata e ritorno verso AWS e l'avatar richiede una connettività stabile, a bassa latenza e con larghezza di banda ragionevolmente elevata. AWS afferma che il prototipo non ha funzionalità offline, edge o modalità degradata, limitando la sua idoneità per ambienti industriali disconnessi o connessi in modo intermittente. Anche la pipeline di inserimento dei documenti è asincrona e la memorizzazione nella cache del testo esatto può fornire una risposta preventiva quando la formulazione e le circostanze sottostanti richiedono una revisione più approfondita. Il lavoro futuro includerebbe la corrispondenza semantica della cache, il fallback offline, la degradazione in testo, una convalida più forte delle risposte e controlli dei costi più severi. La fonte non dice quando o se tali miglioramenti verranno apportati.

Guide e quiz correlati

Cos'è l'intelligenza artificiale?ChatGPT e LLMAgenti dell'intelligenza artificialeSpiegazione dei modelli di intelligenza artificialeMetti alla prova ciò che sai: prova un quiz gratuito sull'intelligenza artificialeCerca un termine AI nel nostro glossarioSegui il tracker dei finanziamenti AI
Lo hai trovato utile?