返回新闻
创新AI Understanding 简报

Cohere 地图显示人工智能代理工具正在影响人类工作

Cohere Labs 表示,其新的 Agentic Task Ecosystem 数据集发现,在近 700,000 个公共 MCP 工具中,只有 2.6% 端到端地执行公认的职业任务。

4 min readRead the primary source
Source-provided image accompanying Cohere maps where AI agent tools are reaching human work
主要来源文件来源记录
出版商
cohere.com
来源链接
cohere.comhttps://cohere.com/blog/automations-early-footprint
来源类型
主要文件——我们直接阅读的官方公告、文件、文件或第一方页面。
背景60 秒内了解这一点

从这里开始

关键术语

人工智能代理
一种可以观察、推理并采取行动来实现目标的软件系统,通常使用工具和内存。
MCP(模型上下文协议)
一种开放协议,允许人工智能应用程序以标准方式连接到外部工具、数据源和上下文提供者。
数据集
用于训练、验证或测试的结构化或非结构化示例的集合。
测试一下自己AI 代理测验
Source video from cohere.com · shown with attribution.

发生了什么

Cohere Labs 发布了代理任务生态系统,这是一个由 123,069 个公共模型上下文协议服务器上列出的 696,291 个工具构建的数据集。随附的分析检查了开发人员正在构建人工智能代理来执行哪些职业任务,并发现代理工具是集中的、分布不均匀的,并且还没有广泛采用的证据。

Cohere Labs 表示,它于 2026 年 5 月从七个目录中的 123,069 个公共 MCP 服务器列表中收集了 696,291 个工具,并在多个地方列出了重复数据删除的服务器。该公司将由此产生的代理任务生态系统描述为同类中最大的开放数据集,但来源没有提供下载位置、许可证或访问条件。定价没有记录。

研究人员使用语言模型将工具与 O*NET 任务语句相匹配,进行了严格的测试:工具必须从头到尾执行一项公认的职业任务,而不是提供信息或仅完成一个人仍然协调的步骤。根据该测试,2.6% 的工具合格。 Cohere 报告称,923 个职业中有 419 个没有代表性的代理工具活动。

该分析将大多数无与伦比的工具分组为现有工作的较小部分、多个记录任务的组合或操作代理所需的基础设施。 Cohere 确定了 35 个类别(约占所检查类别的 3%),显然是新工作,没有合理的职业对应物,主要涉及代理管理,例如选择合成声音、切换人工智能角色以及评估代理是否可信。

Cohere 报告称,已实现的工具与 178 种职业中的理论人工智能暴露程度相关,但暴露程度并不能预测工具是否能够完成日常任务或专业工作。消息人士称,工具延伸到医疗保健和计算领域的专业工作,同时集中在法律、生产和销售职业的常规边缘。这些是作者报告的发现;该来源没有确定下游经济影响。

来源详情: cohere.com ↗

为什么这很重要

该研究提供了人工智能自动化的早期供应方观点:开发人员为代理打包的内容,而不是公司已部署的内容或工人当前使用的内容。科赫的分析表明,总体暴露指标并不能揭示工作的哪些部分受到影响。这种区别可能对工资、招聘、培训以及工人如何获得专业知识很重要,特别是当人工智能涉及基于软件的专业工作时。

该数据集衡量的是供应量,而不是采用率、可靠性或经济影响。公共工具显示开发人员认为一项任务足够具体,可以打包给代理,但它并没有显示公司使用该工具、它在生产中可靠地工作或工人已被取代。

消息人士认为,自动化在工作中的位置可能比暴露的工作总份额更重要。取消日常工作可能会让员工承担更专业的责任,而自动化专业工作可能会减少剩余工作所需的专业知识。这两种模式都可能对工资和就业产生不同的影响。

Cohere 还报告说,专家对技术可行性的判断可以预测哪些职业会获得工具,而工人对他们想要自动化的东西的偏好则不能预测。这一发现提出了一个实际的治理问题:人工智能的开发是否会遵循工人和受影响社区的价值观,或者主要遵循开发人员认为技术上易于处理的内容。

该研究存在明显的可见性限制。它涵盖了公共目录并省略了定制的内部 MCP 服务器,Cohere 表示这些服务器可能集中在后台流程中。因此,作者所报告的 2.6% 份额只是一个下限,而不是自动化的完整衡量标准。

Interactive Mechanism

互动机制:它实际上是如何运作的

以交互方式探索这一发展背后的基础技术。

Agent Lifecycle Stage:
1
User Intent & Planning: "Audit customer refund request #4092 and settle payment."
2
Tool Calling: Emits structured JSON call crm_get_transaction(id='4092').
3
Guardrail & Verification:🛡️ Paused: High-value action requires human operator sign-off.
4
Final Settlement: Refund recorded, email receipt dispatched, and audit log stored.
Core takeaway: An AI agent is not just a language model—it is a closed loop of planning, tool invocation, and environment feedback. Production systems require self-healing retries and strict human approval guardrails.
交互式概念检查+10 Points
AI Agents Quiz

An agent must create a draft calendar event for Tuesday at 2 p.m. Which evidence would establish the requested result?

接下来看什么

研究人员、雇主和政策制定者需要将数据集与私营企业部署、实际使用、就业和工资数据进行比较。最重要的未解决问题是,消除日常入门级任务的工具是否也会减少员工发展专业知识的机会。

该数据集的有用性将取决于其他研究人员是否可以访问和检查它、重现分类并测试公共工具格局变化的速度。来源没有说明该版本的许可证、文章之外的文档或维护计划。

未来的证据应该将公共工具与私人部署、工人使用和可衡量的劳动力市场结果联系起来。如果没有这些联系,ATE 的调查结果就无法表明某个职业是否受到经济威胁,或者某种工具是否可以提高生产力。

该消息人士强调了入门级工作的一个特殊风险:如果日常任务实现自动化,员工在承担专门职责之前通过这些任务学习的机会可能会减少。组织是否重新设计培训和职业道路是一个悬而未决的问题。

该分析还值得仔细审查,因为职业匹配和类别分组部分依赖于语言模型判断。 Cohere 报告了对 120 个指向同一方向的类别进行的盲目人工检查,但消息来源在此没有提供足够的详细信息来评估完整的验证过程或错误率。

相关指南和测验

人工智能代理AI 的未来人工智能模型解释测试你所知道的——尝试免费的人工智能测验在我们的词汇表中查找人工智能术语关注 AI 模型发布跟踪器
觉得这有用吗?