Что случилось
AWS опубликовал техническое руководство и пример развертывания системы на базе искусственного интеллекта, предназначенной для сохранения и извлечения институциональных знаний. Система использует генерацию с расширенным поиском для ответа на вопросы из собственных документов организации с текстовым и голосовым доступом, дополнительным взаимодействием с аватаром и кэшированием, предназначенным для уменьшения повторных вызовов модели.
В сообщении AWS описывается развертываемый прототип для сохранения того, что он называет институциональными или «племенными» знаниями: процедуры, политики и практический опыт, доступ к которым может стать затруднительным, когда уходят опытные сотрудники. Организации загружают документы в Amazon S3, где Amazon Bedrock Knowledge Bases обрабатывает фрагменты документов, встраивание и извлечение. Выбранная базовая модель затем генерирует ответы, основанные на отрывках из этих документов. Система представляет эти ответы через интерфейс браузера, который поддерживает текстовое и голосовое взаимодействие, и может подключаться к настраиваемому ИИ-аватару. AWS позиционирует дизайн для таких сфер, как производство, здравоохранение, финансовые услуги, энергетика и правительство, но в публикации не документируется развертывание производства каким-либо названным клиентом.
Архитектура сочетает в себе Amazon Cognito для аутентификации, API Gateway для контролируемого доступа, AWS Lambda для оркестрации, Amazon S3 для файлов приложений и исходных материалов, а также Amazon OpenSearch Serverless в качестве векторного хранилища базы знаний. Amazon Titan Text Embeddings используется для встраивания документов. В публикации перечислены доступные модели генерации ответов: Amazon Nova Pro и Anthropic Claude 3 Sonnet. Голосовой ввод преобразуется в текст с помощью Amazon Transcribe, а Amazon Polly производит голосовые ответы. Интеграция аватаров использует WebRTC для потоковой передачи и WebSockets для управления, и в сообщении говорится, что технология аватаров основана на DeepBrain AI. По данным AWS, организации могут менять поставщика аватаров, внешний вид, голос и поведение.
Развертывание предоставляется в виде приложения на базе CloudFormation, которое, по словам AWS, можно установить за несколько часов, начиная с однократной настройки командой ИТ или DevOps. Пользователи загружают исходные папки приложения в корзину S3, создают стек CloudFormation, настраивают данные для входа и открывают полученный URL-адрес внешнего интерфейса. Руководство было написано и протестировано для региона us-east-1, который, по словам AWS, был выбран из-за широкой доступности базовой модели и потоковой передачи аватаров. Развертывания в других местах требуют проверки доступности модели и аватара и изменения жестко закодированного региона, где это необходимо. Проект поддерживает документы Word, PDF, обычный текст, Markdown и JSON, хотя AWS рекомендует Markdown или структурированный JSON для производительности поиска.
Кэширование занимает центральное место в прототипе. Кэш на стороне браузера, который использовался реже всего в последнее время, хранит недавние взаимодействия, а DynamoDB хранит более широкие результаты ответов с настройками времени жизни, которые различаются в зависимости от типа контента. AWS сообщает, что при тестировании рабочие нагрузки с множеством повторяющихся вопросов достигли показателя попадания в кеш 50–70 процентов, но подчеркивает, что фактическая экономия зависит от состава запросов. Реализация соответствует точному тексту запроса, а не семантическому сходству, поэтому версии одного и того же вопроса с разными формулировками не могут повторно использовать ответ. AWS также сообщает, что новые или измененные документы становятся доступными для запроса только после завершения автоматического задания приема, а не сразу.
Подробности об источнике: aws.amazon.com ↗
Почему это важно
Проект предлагает организациям конкретный способ превратить разрозненные процедуры и экспертную документацию в интерактивную службу знаний. Его практическая ценность сдерживается постоянными затратами, зависимостью от надежного подключения, ограниченным сопоставлением кэша, задержками при приеме и риском того, что обоснованные ответы все равно могут быть неверными.
Система решает реальную операционную проблему: важные знания часто распространяются по документам, хранилищам и отдельным сотрудникам. Интерфейс на естественном языке может облегчить поиск процедур для работников, которые не знают, где хранится информация, или предпочитают говорить, а не печатать. Голосовой доступ также может быть полезен, когда работники просматривают процедуры с занятыми руками, хотя источник не предоставляет исследований пользователей, демонстрирующих, что это улучшает принятие или доверие. Значимым достижением здесь является объединение поиска ИИ на основе документов, обработки голоса, кэширования и аватара в воспроизводимой облачной архитектуре.
Для организаций образец снижает инженерную нагрузку по самостоятельной сборке этих компонентов. AWS утверждает, что для создания специальной системы Bedrock с голосовой связью, рендерингом аватаров, поиском и кэшированием потребуются недели или месяцы и специализированные знания, в то время как образец предоставляет шаблоны инфраструктуры и поток приложений. Это может сделать экспериментирование более доступным для небольших технических команд. Это не исключает работу по выбору авторитетных документов, настройке разрешений, управлению хранением, просмотру сгенерированных ответов или интеграции с существующими репозиториями. Утверждение в статье о том, что ускоритель соответствует производственному качеству, является характеристикой производителя; источник не предоставляет независимой оценки или свидетельств клиентов.
Архитектура также делает видимой экономику и управление корпоративным ИИ. Бессерверное векторное хранилище OpenSearch имеет всегда включенный минимум и, согласно AWS, может представлять собой фиксированную базовую стоимость в несколько сотен долларов США в месяц при минимальной цене по умолчанию, без вычета переменных и других затрат на обслуживание. Кэширование может сократить количество повторных вызовов моделей, но не устраняет затраты на хранение, векторное хранилище, речь, сетевые или эксплуатационные расходы. Безопасность зависит от правильно настроенных средств управления идентификацией и доступом в нескольких службах AWS. Поскольку база знаний может содержать внутренние процедуры или конфиденциальную институциональную информацию, развертывание требует тщательной авторизации, управления документацией и мониторинга. Обоснование ответов в извлеченных документах может уменьшить количество неподдерживаемых ответов, но AWS прямо заявляет, что это не устраняет ошибок.
Интерактивный механизм: как он на самом деле работает
Изучите технологию, лежащую в основе этой разработки, в интерактивном режиме.
A route planner searches possible journeys using explicit rules. What does this illustrate about AI?
Что посмотреть дальше
Основные вопросы заключаются в том, смогут ли организации проверить прототип под собственными рабочими нагрузками, контролировать конфиденциальные знания и затраты, а также добавить меры безопасности, которые AWS определяет как будущие или рекомендуемые улучшения. Необходимо независимое тестирование для установления точности, задержки, масштабируемости и влияния взаимодействия на основе аватара на внедрение.
Первым испытанием для этой системы является точность собственных материалов организации, особенно когда документы противоречат друг другу, являются неполными или используют специализированный язык. AWS рекомендует публиковать цитирования источников, но в сообщении не сообщается о точности цитирования, показателях точности ответов, показателях ложных ответов или сравнениях с обычным поиском. Организациям следует проверить, точно ли сгенерированные ответы отражают последнюю утвержденную процедуру и могут ли пользователи распознать, когда в системе отсутствуют доказательства. В сообщении рекомендуется держать человека в курсе важных решений или решений, связанных с безопасностью. Явные пороговые значения достоверности и проверки проверки ответов определяются как рекомендуемые улучшения, а не как реализованные функции.
Эксплуатационные показатели необходимо будет измерять, а не предполагать на основе ориентировочных цифр AWS. В сообщении сообщается, что настройка по умолчанию обрабатывает примерно от 50 до 100 одновременных пользователей с кешированными ответами менее секунды, в то время как более высокие квоты могут поддерживать примерно от 500 до 1000 пользователей, а та же архитектура может превысить 5000 при упреждающем увеличении квот. Сообщается, что новые запросы к базе знаний заняли от двух до четырех секунд, плюс дополнительное время для обработки голоса. Эти цифры зависят от региона, модели, размера документа, частоты попадания в кэш и квот на услуги. Источник не предоставляет тестовые рабочие нагрузки, методологию, планки ошибок или независимое копирование, поэтому их следует рассматривать как плановые оценки, а не как гарантии.
Связь и свежесть информации являются существенными ограничениями. Каждый запрос зависит от обращения к AWS, а аватару требуется стабильное соединение с низкой задержкой и достаточно высокой пропускной способностью. AWS утверждает, что прототип не имеет возможности автономного, периферийного или ограниченного режима, что ограничивает его пригодность для отключенных или периодически подключаемых промышленных сред. Конвейер приема документов также является асинхронным, и кэширование точного текста может служить предварительным ответом, когда формулировка и основные обстоятельства требуют более тщательного анализа. Будущая работа будет включать в себя сопоставление семантического кэша, резервный режим в автономном режиме, постепенное преобразование в текст, более строгую проверку ответов и более жесткий контроль затрат. Источник не сообщает, когда и будут ли эти улучшения реализованы.