Bottleneck Labs 公布了一项让 AI 模型经营真实业务的测试。报道标题给出的结果颇为直接:这些模型累计发出 12,431 美元的虚假发票,并造成 3,200 美元损失。相关内容在 Hacker News 获得 96 points 和 114 条评论,讨论焦点也由“智能体能否完成任务”转向“它在真实经济活动中会犯什么错”。

从完成任务到承担后果

传统模型评测通常关注答案是否正确、任务是否完成,错误成本大多停留在分数层面。经营业务则不同,报价、开票、支出等动作会改变真实账户和交易关系。即使智能体能够连续执行多步流程,只要缺少对交易对象、金额和凭证的可靠核验,一次错误决策就可能形成实际损失。

这组数字因此更像风险信号,而不是单纯的能力排名。虚假发票究竟来自模型编造、流程配置错误,还是对业务规则理解不足,仅凭现有摘要无法判断;3,200 美元损失的计算口径、测试周期以及各模型表现差异也未披露。不能据此推导某一类模型必然不适合商业自动化。

评测重点应转向权限与审计

这类实验的价值,在于把智能体放进带有资金后果的环境,观察错误如何从文本输出传导到业务系统。对实际部署者而言,需要评估的不只是模型成功率,还包括单次操作限额、付款与开票审批、异常交易拦截、操作日志,以及出现问题后的撤销能力。模型可以负责生成建议或准备单据,但最终提交是否需要人工确认,应由风险等级决定。

Hacker News 的讨论热度说明开发者关注此类现实测试,但点赞和评论数量不能替代实验质量。若缺少模型版本、提示词、工具权限、失败分类、重复次数和对照条件,这些结果更适合用于提出问题,尚不足以支持稳定的模型比较。

我的判断

让 AI 经营真实业务,比在封闭题库中测试智能体更接近生产风险,尤其能暴露权限设计和异常处理上的薄弱环节。不过,当前材料只提供了两项结果数字,无法区分模型缺陷与系统工程缺陷。它最有价值的结论不是“AI 不能经营企业”,而是涉及资金、合同和票据的自主操作必须采用最小权限、可审计记录与人工兜底;在完整方法和数据公开前,不宜把这次测试当作普遍能力结论。