对话式人工智能
对话式人工智能是一种让人们通过自然的来回对话、文本或语音(而不是菜单和表格)与计算机进行交互的技术。
概述
It underpins virtual assistants, customer-service chatbots, and voice helpers like those on phones and smart speakers.
深入探讨
对话式人工智能涵盖了任何旨在与人进行自然对话的系统。经典管道将工作分为几个阶段:自然语言理解 (NLU) 找出用户的意图并提取称为槽位的关键细节,对话管理器跟踪对话状态并决定下一步做什么,自然语言生成 (NLG) 表达答复。语音助手将其封装在语音识别和文本转语音中。旧系统是基于规则的或依赖于严格定义的意图,这使得当用户意外地表达事物时它们变得脆弱。现代对话人工智能越来越多地使用大型语言模型,这些模型可以直接生成流畅的回复,并且可以处理开放式对话,通常基于检索到的文档,因此答案保持准确。持续存在的挑战是记住多个回合的上下文,知道何时将其交给人类,以及避免自信地给出错误答案。
技术洞察
传统的面向任务的助手运行一个 NLU 模块,该模块对用户的意图进行分类(例如,“book_flight”)并提取槽(日期、目的地)、一个记住已填写内容的对话状态跟踪器、一个选择下一个操作的策略以及一个生成措辞的 NLG 步骤。现代基于 LLM 的系统通常会破坏这些阶段,在使用工具、函数调用和检索来获取事实或采取行动的同时生成端到端的响应。将正在运行的对话历史记录作为上下文来维护,可以让机器人记住之前的对话。
战略影响
速度与规模
语言工作流程可以在不牺牲一致性的情况下更快地移动。
交通与覆盖范围
它扩展了跨语言和沟通方式的访问。
更清晰的判决
团队可以花更多时间进行判断,而自动化则可以处理重复。
对话式人工智能的未来
对话式人工智能正在从狭隘的脚本机器人转向法学硕士驱动的助手,后者可以推理、调用工具并完成预订或故障排除等多步骤任务。期待更多语音优先、低延迟体验、多语言支持以及代表用户采取实际行动的“代理”系统。通过检索和更坚固的护栏来接地对于减少幻觉和保持答复的可信度至关重要。最大的实际前沿是可靠的长期记忆、与人类的优雅交接,以及为医疗保健和金融等高风险领域提供足够好的安全性和准确性。
现实世界的实施
银行的客户服务聊天机器人可通过对话检查您的余额、解释费用并重置密码
智能音箱上的语音助手可以设置计时器、回答问题以及通过语音控制智能家居设备
医疗保健症状检查机器人,可提出后续问题并引导患者找到正确的护理选择
应用内购物助手在结帐时以自然语言推荐产品并回答问题
风险与防护栏
幻觉的事实可以悄悄地进入报告、支持流程或研究成果。
及时的敏感性可能会在类似的请求中产生不一致的结果。
如果访问控制薄弱,敏感文本数据可能会暴露。
实施路线图
在推出之前定义输出格式、语气和质量标准。
当准确性很重要时,请使用可信来源进行地面响应。
为高风险输出保留人工审查检查点。
跟踪故障模式并定期重新训练提示或工作流程。
不断探索
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Conversational AI quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
常见问题
What is Conversational AI?
对话式人工智能是一种让人们通过自然的来回对话、文本或语音(而不是菜单和表格)与计算机进行交互的技术。它支持虚拟助理、客户服务聊天机器人以及手机和智能扬声器等语音助手。
在经典的面向任务的对话式 AI 管道中,自然语言理解 (NLU) 组件的作用是什么?
NLU 解释用户的消息,对意图(他们想要什么)进行分类,并提取系统需要执行操作的槽(具体细节,例如日期或目的地)。
对话管理器(或对话状态跟踪器)的工作是什么?
对话管理器跟踪已说过的内容以及仍需要哪些信息,然后选择系统的下一步操作,使对话在轮流中保持连贯性。
为什么旧的基于规则或严格的基于意图的聊天机器人经常被描述为“脆弱”?
基于规则的系统仅处理它们明确编程的模式,因此不寻常或意外的措辞很容易破坏它们。
现代基于大语言模型的对话系统与经典管道有何不同?
基于法学硕士的助理可以直接生成流畅的响应,而不是依赖僵化的意图槽,处理更多开放式对话,并经常使用工具或事实检索。
是什么让对话式人工智能系统“记忆”之前在聊天中所说的话?
通过将先前的轮次作为上下文,系统可以引用先前的陈述并在多轮对话中保持连贯。