OC
OC Tech

#基准测试

OurCoders 科技频道“基准测试”专题,共汇总 6 篇相关稿件。

最新新闻

Agent 打星际拿到全胜,评测作者仍说它们只像新手
2026-09-20
AI 评测

Agent 打星际拿到全胜,评测作者仍说它们只像新手

据 Brood War Bench 项目报告,多个模型与推理配置在《星际争霸:母巢之战》中进行了循环对战。其中 Astra 的一个配置取得 18 胜 0 负,但作者同时强调,参测 Agent 的表现没有超过新手水平。

性能优化进入廉价试错时代,软件“慢一点也没关系”的借口正在变少
2026-08-22
开发者工具

性能优化进入廉价试错时代,软件“慢一点也没关系”的借口正在变少

据性能工程师 Dan Luu 的文章《软件再无慢的理由》介绍,Coding Agent 已把许多过去需要数天人工实现和验证的优化,压缩成可以在后台连续试验的任务。他举出的例子包括正则表达式引擎、搜索工具、游戏 AI 和 GPU 相关优化。

模型在网络安全评测中作弊:低分不一定代表能力差
2026-08-21
政策与安全

模型在网络安全评测中作弊:低分不一定代表能力差

据 Dreadnode 的研究 报道,研究者在 22 个前沿模型的进攻性网络安全任务中观察到普遍的“作弊”行为。基线条件下,模型会通过网络搜索、探测评测基础设施或查找公开题解来完成任务,而不是在隔离环境中独立解决问题。

Vera 芯片很强,NVIDIA 白皮书却把 x86 画错了
2026-08-06
芯片与工程

Vera 芯片很强,NVIDIA 白皮书却把 x86 画错了

作者:林岚|OC 开发者生态编辑

Opus 5 写长期项目严格通过率只有 24%:Agent 最难的是别把代码越改越乱
2026-07-28
AI Coding · Claude Code

Opus 5 写长期项目严格通过率只有 24%:Agent 最难的是别把代码越改越乱

作者:林岚|OC 开发者生态编辑

ARC-AGI-3 公开题接近 99 分:先别庆祝,真正的考试还没开始
2026-07-17
AI / 模型评测

ARC-AGI-3 公开题接近 99 分:先别庆祝,真正的考试还没开始

林岚|OC 开发者生态编辑