LLM 做表格预测为什么输给老算法:维度一高,语言优势就消失
作者:林岚|OC 开发者生态编辑
林岚
一篇新论文用受控实验追问,为什么大型语言模型在表格分类上常常输给传统机器学习。研究者排除了 CSV 格式、数字分词、查询数量和简单非线性等解释,发现性能下降最稳定地出现在特征维度增加时。
一句话结论:LLM 可以在低维表格上模拟一种近邻式判断,但特征列一多,这种从文本序列临时推断决策边界的方法就迅速失效;把数据转成 CSV 并不会让语言模型自动获得树模型的归纳偏置。
实验采用最纯粹的一次推理设置:提示中同时放入完整训练样本和待预测数据,不调用代码工具、不微调模型,也不增加外部脚手架。研究者依次测试噪声与非线性、CSV 表达、数字 token 化、一次查询的测试点数量和数据维度五种假设。
前四种解释都没有在控制变量后稳定复现性能崩溃。决定性变化来自维度。研究者对 31 个数据集进行随机线性投影,并与 252 种配置下的 9 类经典方法比较;维度增加时,只有 LLM 的准确率持续下降,传统方法大多持平或改善。

在二维任务中,LLM 产生的决策区域与局部、基于距离的方法很相似,网格预测最高有 91.6% 一致。但进入高维后,即使给经典模型加入噪声,也没有一种方法能完整复现 LLM 的退化轨迹。论文因此只描述行为,没有声称已经找到模型内部机制。
这个结论的适用范围很窄但很实用。它针对的是把表格直接塞进提示词的一次性预测,不涵盖会运行 Python、训练 XGBoost、调用检索或专为表格预训练的 Agent。一个 LLM 完全可以正确选择并操作传统模型,但那是工具编排能力,不是语言模型自身完成表格归纳。
企业最容易犯的错误,是因为 LLM 能读懂列名和解释结果,就让它直接承担数值预测。语义理解适合用于数据清洗、特征说明和报告生成;真正的预测层仍应与树模型、线性模型和专用表格模型做严格交叉验证。
关键事实
- 研究使用一次推理设置,不提供工具、微调或外部程序
- 五种候选解释中,数据维度最能稳定解释 LLM 性能下降
- 实验覆盖 31 个数据集,并与 9 类、252 种配置的经典方法比较
- 低维行为类似局部距离方法,但论文没有确定内部计算机制
OC 判断
“LLM 能理解表格”包含至少三件不同的事:解释字段、调用分析工具和直接从样本预测。前两项可以很强,第三项却受归纳偏置限制。工程团队应把自然语言接口和统计预测器拆开评估,而不是用一段看似合理的解释替代验证集成绩。
为什么重要
- 对开发者:高维表格应优先训练专用模型,让 LLM 负责工具选择和结果解释。
- 对企业:信用、医疗和风控场景不能把自然语言流畅度当成预测可靠性。
- 对研究者:需要进一步测试模型规模、上下文长度和专门训练能否改变维度退化。
评论
围绕这篇文章补充信息、提出问题或分享观察。