发生了什么
《财富》杂志报道称,总部位于香港的 Votee AI 正在通过重新训练 Meta 和阿里巴巴等开发者的开放权重模型来构建以粤语为主的语言模型。该公司表示,通过在线抓取、社区和大学贡献、之前的数据业务内容和合成数据,其粤语训练语料库已从约 1 亿个代币扩大到超过 5 亿个。据报道,其模型拥有约 700 亿个参数,该公司估计培训成本约为 25 万美元。
据《财富》杂志报道,Votee AI 是一家香港初创公司,专注于粤语和其他语言,该公司称这些语言在领先的人工智能系统中服务不足。据报道,该公司采用了 Meta 和阿里巴巴等开发商的开放权重模型,并使用粤语数据进行了额外的训练。 Votee 将最终的系统出售给银行、大学和政府部门。该报告将公司的工作视为对当前人工智能市场中英语和普通话主导地位的回应,而不是试图建立一个在整体规模上直接竞争的通用前沿模型。
《财富》杂志报道称,粤语在语法和词汇上与普通话不同,尤其是在香港,说话者可能会在同一个句子中在粤语和英语之间切换。文章称,有超过 8000 万人讲粤语,这一人口数量与讲韩语的人数相当,但比讲意大利语或泰语的人数还要多。然而报告称,标准化书面数据,尤其是广东话口语的供应相对有限。 《财富》杂志引用了 HKCanto-Eval,这是由九州大学、香港教育大学和当地人工智能社区 hon9kon9ize 的研究人员开发的基准。 《财富》杂志表示,这项基准测试是由 Votee 赞助的,它发现主流模型可以合理地处理日常粤语,但在文化和当地知识方面却经常失败。
所报告的培训过程结合了多个来源。 《财富》杂志表示,Votee 会抓取在线材料,包括来自香港电台的内容,并且还接收来自社区和大学的数据。该公司利用其早期大数据业务的材料,创建用于培训的合成粤语数据集。据《财富》杂志报道,这些努力使语料库从 1 亿个代币增加到 5 亿多个。据描述,该初创公司的模型拥有大约 700 亿个参数。首席执行官 Pak-Sun Ting 告诉《财富》杂志,Votee 使用 5 亿至 10 亿个代币来训练其模型,而英语模型则使用了数万亿个代币,并估计成本约为 25 万美元。 《财富》杂志不会独立验证这些数据,也不会描述该模型的架构、发布条款、评估方法或向公众提供的可用性。
为什么这很重要
粤语的使用人数超过 8000 万人,但《财富》杂志报道说,口语和本地化的书面数据相对稀缺。根据 Votee 赞助的 HKCanto-Eval 基准测试,主流模型可以处理日常粤语,但在文化和当地知识方面表现不佳。更好的本地语言系统可能会影响教育、医疗保健、警务和政府服务领域面向公众的使用,同时也支持更广泛的努力,以构建更少依赖英语和普通话的人工智能。
《财富》杂志的报道说明了为什么语言覆盖是一个实际的人工智能问题,而不仅仅是文化保护的问题。丁告诉该刊物,粤语用于教育、医疗保健和警察通讯,他认为不处理这些情况的系统用途有限。如果准确的话,该公司的重点是广泛的多语言主张与理解当地术语、机构、社会习俗和混合语言演讲或写作的能力之间的差距。无论人工智能系统用粤语汇总信息、支持工作人员或与居民交流,其后果都可能是重大的。
该报告还将 Votee 的工作置于更广泛的所谓主权人工智能运动中。 《财富》杂志介绍了印度尼西亚的 Sahabat AI、新加坡 AI 的 SEA-LION 项目以及韩国政府支持的选择国内基础模型提供商的相关努力。共同目标是更好地控制本地数据、模型和应用程序,而不是完全依赖海外提供商。丁告诉《财富》杂志,拥有人工智能供应链的每个部分都很困难,但政府可以优先考虑对基础模型和应用程序的控制。他还认为,许多公共部门的任务可能不需要前沿规模的系统,可以由较小的本地模型来处理,可能在幕后使用更强大的英语或中文模型。
该模型具有实际的权衡。本地系统可能会改善语言适应性,并使机构能够更好地控制敏感部署,但较小或专门的模型可能具有较窄的功能,并且仍然依赖于外国模型提供商、芯片或基础设施。 《财富》报道称,Votee 可与 MiniMax 和 SenseTime 的模型配合使用,并可以使用 Nvidia 芯片,这强调了本地语言所有权并不一定意味着整个堆栈的技术独立。 Ting 表示,文章还将 Votee 描述为一家营利性公司,其收入目前超过成本,客户合同为其提供了大部分资金。 《财富》报道称 Allan Zeman 是一名顾问,Votee 正在与 AI Singapore 进行积极讨论,但它没有独立确认该公司的财务、合同、客户部署或这些讨论的状态。
互动机制:它实际上是如何运作的
以交互方式探索这一发展背后的基础技术。
A route planner searches possible journeys using explicit rules. What does this illustrate about AI?
接下来看什么
尚未解答的关键问题是,Votee 的模型在该公司自己的声明及其赞助的基准之外是否可靠地运行。 《财富》不提供独立评估、错误率、公开模型发布、定价、客户数量或有关数据许可和隐私保护的详细信息。进一步的报告应审查真实粤语任务的表现、废弃材料的来源和同意状态、部署规模,以及该公司与新加坡人工智能公司的讨论是否会形成具体的合作伙伴关系。
第一个优先事项是独立的性能测试。 《财富》报道了 HKCanto-Eval 的调查结果以及 Votee 对粤语理解和推理的主张,但文章没有提供分数、特定模型之间的比较、样本任务、失败率或独立审计师的评估。有用的审查将测试广东话口语、英语语码转换、地区词汇、公共服务术语和特定文化问题。它还应该评估当系统遇到不熟悉的主题而不是类似于其训练数据的材料时,改进是否持续存在。
数据治理是另一个尚未解决的问题。 《财富》杂志表示,Votee 使用在线抓取、香港电台内容、社区和大学贡献、先前的商业数据和合成数据。消息来源没有说明哪些材料获得了许可、贡献者如何给予许可、个人信息是否被删除,或者如何处理版权和广播权。这些问题对于医疗、教育、治安和政府用途的系统尤其重要。未来的披露应澄清语料库的出处、同意和保留政策,以及防止复制私人或受版权保护的材料的保障措施。
公司的商业和区域扩张将决定该项目是否成为持久的公共能力或仍然是专业服务业务。据《财富》杂志报道,Votee 向机构客户销售产品,称其收入超过成本,并希望将业务从香港扩展到东南亚,并最终致力于东亚、北美和非洲的濒危语言。该来源不提供客户数量、部署量、公共访问、定价、服务水平承诺或采用证据。敬请关注公开模型发布、独立验证的合同、实际部署的结果、已确认的 AI 新加坡合作伙伴关系以及该系统可以提供可靠效益的证据,而无需夸大 700 亿参数广东模型的功能。