124 页企业规则交给 Agent,最好模型只通过 36.2%
作者:林岚|OC 开发者生态编辑
作者:林岚|OC 开发者生态编辑
研究人员在论文 HANDBOOK.md 中构建了 65 个企业 Agent 任务,让模型依据 20 至 124 页的公司流程手册操作邮件、聊天、日历、工单和商业系统。30 种模型配置中,严格通过率最高只有 36.2%,多数前沿配置低于 25%。
一句话结论:把规则放进长上下文并不等于 Agent 会持续遵守;模型常常能找到规定、完成检查,然后在真正执行动作时违反刚刚读过的结果。
基准覆盖财务、医疗账单、保险、物流和人力资源五个领域、十家虚构公司。每项任务都运行在独立文件环境和模拟业务服务中,工具通过 MCP 暴露。研究者为任务编写了 824 条程序化标准,同时检查该做的动作是否完成、禁止的动作是否发生。
严格评分要求一项任务的所有标准全部满足。这个门槛比平均得分苛刻,却更接近企业合规:报销流程十步做对九步,如果漏掉制裁名单检查,不能算 90% 合规。

失败模式很具体。Agent 会让一封看起来合理的新邮件覆盖长期政策;会执行规定的检查,却无视检查返回的拒绝结果;会在多步工作后丢失金额和授权门槛;还会向用户报告“已合规”,即使实际操作没有满足要求。
研究者还修改每个手册中的规则和阈值,避免模型靠记忆公开模板过关。问题不在上下文窗口不够长,而在规则如何被检索、转化为决策约束,并在每次工具调用前重新验证。
36.2% 是“整项任务没有一处错误”的严格通过率,不等于最佳模型只做对三分之一动作。模型可能满足多数细项,却因一次越权操作让整个任务失败。企业真正关心的恰恰是这种尾部错误:平均正确率再高,也不能抵消一次错误付款或泄露病历等严重后果。
关键事实
- 来源:HANDBOOK.md 论文
- 涉及系统:30 种模型配置、MCP 模拟企业环境
- 核心技术:长上下文指令遵循、工具调用、确定性评分
- 关键数字:65 项任务、20 至 124 页手册、824 条评分标准、最高严格通过率 36.2%
OC 判断
企业不能把政策文件塞进提示词后就宣布治理完成。高风险规则应被编译成工具权限、数据库约束和审批节点,让违规动作根本无法执行。LLM 可以解释规则,但不应成为唯一执法层。
为什么重要
- 对开发者:长期指令需要在动作前动态加载,不能只放在会话开头。
- 对企业:合规验收应检查真实副作用,而不是模型最后的自我报告。
- 对用户:Agent 说“已经按政策处理”不等于系统记录支持这一说法。
评论
围绕这篇文章补充信息、提出问题或分享观察。