Codex 把 GPU 内核跑快 232 倍:排名第 12 说明数字必须放回测试条件
作者:林岚|OC 开发者生态编辑
作者:林岚|OC 开发者生态编辑
开发者 Sankalp 在比赛复盘中称,他借助 Codex、Claude 和自动化测试循环,在 GPU Mode 与 Core Automation 举办的 QR 分解竞赛中,把基准总耗时从约 419000 微秒降至 1805 微秒,约快 232 倍,最终排名第 12,共 183 名参赛者。
一句话结论:232 倍不是 AI 把任意生产 CUDA 程序普遍加速 232 倍,而是在固定 B200、固定输入分布和竞赛校验器下,用 14 天、1500 多次提交把通用库基线改成高度专用内核。
任务要求对一批 FP32 方阵执行紧凑 Householder QR 分解,返回与 torch.geqrf 相同形式的 H 和 tau。校验器会重建 Q,检查 A≈QR、正交性和上三角结果,再按多种尺寸与条件数样本的几何平均耗时排名。内部可以使用 FP16、FP8 或 NVFP4,但返回结果仍要通过接近 FP32 的检查。
性能突破来自把串行工作限制在窄面板,再用 blocked Householder 和 WY 表示把后续更新变成适合 Tensor Core 的矩阵乘法。不同矩阵尺寸、批量和低秩分布又使用不同策略。换句话说,模型没有发明 QR 分解,而是快速组合了成熟算法、低精度余量、融合和硬件特化。

Codex 的作用是执行长反馈循环:修改代码、通过 Modal 和分析器测量、提交排行榜、记录成功失败,再维护多个候选分支。作者仍要学习算法、判断瓶颈、设计提示并阻止局部最优。自动化降低的是实验吞吐成本,不是领域知识归零。
此前 OC 报道过,一批通过标准测试的 AI 生成 GPU 内核在严格验证下有 98.5% 失败。今天的案例不是反例,因为这个比赛有明确校验器且最终结果被持续测试;它同时提醒我们,竞赛正确性仍只覆盖给定合同,不能自动外推到所有输入、硬件和生产容错要求。
关键事实
- 任务:NVIDIA B200 上的批量紧凑 Householder QR 分解
- 结果:约 419000 微秒降至 1805 微秒,作者报告约 232 倍加速
- 投入:14 天、超过 1500 次提交,最终第 12/183
- 边界:相对特定基线、硬件、输入分布和校验器
OC 判断
这类自动研究最适合目标可执行、反馈便宜、正确性可机器判定的任务。AI 能把一次次试验变成流水线,但人仍要定义合同和判断哪些捷径越界。没有严格测试,232 倍可能只是 232 倍地更快算错。
为什么重要
- 对开发者:应先投资可重复基准、正确性检查和实验日志,再扩大 Agent 循环。
- 对团队:专用内核可能带来巨大收益,也会增加硬件绑定和维护成本。
- 对读者:性能倍数必须连同基线、数据分布、精度与排行榜名次一起阅读。
评论
围绕这篇文章补充信息、提出问题或分享观察。