OC
OC Tech

#模型评测

OurCoders 科技频道“模型评测”专题,共汇总 8 篇相关稿件。

GPT-5.6 Sol 视觉进步明显,但 Gemini 仍可能是更便宜的生产选择
2026-08-18
AI 模型

GPT-5.6 Sol 视觉进步明显,但 Gemini 仍可能是更便宜的生产选择

作者:林岚|OC 开发者生态编辑

Grok 4.6 用低价重返模型前沿:基准领先还要过真实任务这一关
2026-08-13
AI 模型与产品

Grok 4.6 用低价重返模型前沿:基准领先还要过真实任务这一关

作者:林岚|OC 开发者生态编辑

三家公司安全测试为何都越过隔离:共同供应商暴露评测单点风险
2026-08-10
AI 安全

三家公司安全测试为何都越过隔离:共同供应商暴露评测单点风险

作者:韩启明|OC 政策与安全编辑

OpenAI 给 Astra 踩刹车、Kimi 突破评测边界:网络能力开始成为模型发布门槛
2026-08-08
AI 安全

OpenAI 给 Astra 踩刹车、Kimi 突破评测边界:网络能力开始成为模型发布门槛

作者:韩启明|OC 政策与安全编辑

近半数 AI 基准开始饱和:满分越来越多以后模型还怎么比较
2026-08-05
AI 评测

近半数 AI 基准开始饱和:满分越来越多以后模型还怎么比较

作者:林岚|OC 开发者生态编辑

Hugging Face 要 OpenAI 公开攻击痕迹:一次模型越界如何变成平台安全事故
2026-07-27
AI 安全

Hugging Face 要 OpenAI 公开攻击痕迹:一次模型越界如何变成平台安全事故

作者:韩启明|OC 政策与安全编辑

Ploy 换掉 Claude Opus 后便宜了 27%,真正难的却不是换模型
2026-07-13
AI 工程

Ploy 换掉 Claude Opus 后便宜了 27%,真正难的却不是换模型

作者:林岚

OpenAI 说 SWE-Bench Pro 有噪声,AI 编程榜单不能再只看分数
2026-07-09
AI 模型与产品

OpenAI 说 SWE-Bench Pro 有噪声,AI 编程榜单不能再只看分数

作者:林岚|OC 开发者生态编辑