Kapa用真实公司知识测检索,grep也要付阅读成本
据 Kapa 公布 Company Knowledge Bench,使用生产查询和知识库快照,比较固定检索流程与代理驱动检索。
作者:林岚|OC 开发者生态编辑
据 Kapa 公布 Company Knowledge Bench,使用生产查询和知识库快照,比较固定检索流程与代理驱动检索。
一句话结论:找到答案只是第一步,结果是否完整、权威和精简,会继续影响回答成本。
测试包含一千个案例,知识来源覆盖文档、工单、聊天和内部知识库。Kapa 用完整性、最少必要片段和来源优先级定义正确检索:旧帖子即使内容相关,也可能不如最新参考页适合回答。
在公司测试中,较强模型配合 grep 得分 0.61,与 Kapa Default 相同,但前者耗时约 17 秒,后者 3.3 秒。这个分数是该基准定义下的检索得分,不是“61% 的回答正确”,也不是 grep 对所有公司资料的通用结论。

Kapa 强调全部检索器由团队搭建,并使用其入库流程。这种一致性有助于比较,也形成供应商与方法偏差。评价排名时,需要区分可复制的测试设计和产品自身在特定测试里的优势。
代理检索还能返回大量片段,回答模型随后要为这些内容支付输入成本。测试中的 grep 方案约返回四万 token,显著高于经过筛选的方案。工具调用阶段省下一部分工作,可能在阅读阶段重新付出。
企业建立自己的测试集时,可以从真实失败问题开始:资料是否过时、答案是否分散、查询是否含糊,以及是否根本没有支持证据。让代理学会在没有答案时返回空结果,同样属于检索质量,而不是需要被掩饰的失败。
关键事实
- 规模:一千个生产查询案例。
- 比较性质:Kapa 内部测试,全部方案由其搭建。
- 指标:检索得分、延迟、必要片段比例与返回 token。
OC 判断
有价值的方向是把检索结果本身变成可测对象。模型能搜很多次,并不等于找到了更适合回答的证据。
为什么重要
- 对开发者:同时测来源质量、完整性和上下文量。
- 对企业:用真实问题建立自己的检索评估。
- 对用户:更少且可靠的证据有助于快速核验回答。
评论
围绕这篇文章补充信息、提出问题或分享观察。