OC

Netflix 用语言模型重做推荐:40 倍少样本,不等于替换整套系统
科技 · 2026-08-16 · AI 应用 · 阅读 1

Netflix 用语言模型重做推荐:40 倍少样本,不等于替换整套系统

作者:林岚|OC 开发者生态编辑

作者:林岚|OC 开发者生态编辑

Netflix 技术博客,Netflix 正在测试名为 GenRec 的 LLM 原生推荐架构。它把观看历史、内容元数据和场景信息转成语言模型可处理的上下文,再用专门的打分头排序候选内容。离线测试,第二阶段排序器只使用约四十分之一的标注样本,平均倒数排名仍提升约 1.6%。

一句话结论:Netflix 不是让聊天机器人猜用户想看什么,而是借用语言模型的预训练能力减少特征工程和样本需求,再把输出限制回传统排序任务。

传统推荐系统依赖数千个人工设计特征。用户是否刚看完一部剧、是否在周末、某类内容最近看了多少次,都要被编码成固定字段。GenRec 则把这些信息“语言化”,让模型直接从较长历史学习关系。基础模型来自开放模型,再用 Netflix 自有语料和目标训练。

关键是它不在在线阶段生成文字。系统只运行预填充,用最后一层隐藏状态配合条目向量和打分头计算排名,避免逐 Token 解码。重复事件会被摘要,低信号历史被省略,共享前缀还能复用计算。这些工程处理比“换成 LLM”本身更决定成本。

模型不生成推荐文案而是直接输出候选内容分数

奖励也不是单一点击率。Netflix 把短期互动、长期满意度和业务目标组合进加权损失,但这仍不是完整的强化学习。更小的蒸馏模型、上下文压缩和批处理场景,都是它能进入生产测试的前提。

在线 A/B 测试覆盖约 10% 流量、持续约四周,报告称短期和长期指标均有显著提升。不过目前验证集在可批量计算的页面,实时推荐是否能承受延迟和成本仍待验证。这不是整套 Netflix 推荐系统已经被 LLM 替换。

关键事实

  • 架构:语言化用户历史,LLM 编码,专用打分头排序
  • 离线结果:第二阶段标注样本约少 40 倍,MRR 提升约 1.6%
  • 在线测试:约 10% 流量、约四周,报告称核心指标有显著提升
  • 边界:目前主要用于批处理页面,实时场景仍需验证

OC 判断

GenRec 最有价值的不是“推荐系统聊天化”,而是让同一套预训练表示接住更多上下文,减少每个团队手搓特征的成本。问题也随之转移:上下文怎么压缩、目标怎么加权、昂贵模型何时刷新,这才是开发者真正会撞上的地方。

为什么重要

  • 对开发者:LLM 可以成为表示层和排序器,不必承担文本生成任务。
  • 对平台:更少标注数据能加快新场景上线,但算力与目标偏差仍需在线实验约束。
  • 对用户:推荐可能更理解长期偏好,也更难看懂平台为什么把某个内容排在前面。

参考来源

相关阅读

基于标题、摘要和正文内容自动匹配。

更多科技

评论

围绕这篇文章补充信息、提出问题或分享观察。

0
暂无评论。

发表评论

继续看看 OC 用户围绕这个话题说了什么、做了什么。

相关碎碎念

更多

从有这个想法,在OC做一个碎碎念 https://x.com/tinyfool/status/2084451008298791131 到做好,https://x.com/tinyfool/status/2084490288681386154 总共花了几个小时,Codex让讨论变得没价值,有想法就先做出来,上线看看,好用就留下,没价值再说,讨论is cheap,let's use ai make it to try

tinyfool 1 0

最近越来越多思考,我们跟agent的关系,比如我最近用blender mcp很多,基本上我算是会用blender的,但是老记不住很多热键,以前我可以做很复杂的模型,但是要是不是的去查blender的操作热键。现在我完全不参与模型的建模,只让codex帮我生成。 但是我还是在查blender的热键,我现在需要的是numpad .这样聚焦到一个对象的方法,我需要的是numpad /这样的方法来把除了选中的对象,其他都隐藏的热键。 换言之,我现在需要高效的人工视觉复检blender mcp的成果,这是我对自己目前blender能力的需求了。

tinyfool 2 0

正在做OC产品频道,支持独立开发者提交自己的app,网站,在OC得到宣传和外链。基础功能已经实现,还有一堆在路上。我们独特的是有一个能力让你把产品的用户写的文章视频也可以列在你的产品页下方。方便更多用户了解,这不是想替代你自己的产品页面,而是帮你把做每个产品页各种复杂的互动都自动化,这个产品页还是可以导流到你自己的产品页的

tinyfool 1 2

相关帖子

更多

你们的Codex额度提前耗完了没?戒断反应如何?

<p>我在第三天就消耗了只剩1%,忍了一天,然后今天干脆用这最后的1%,开着5.6 Sol 极高 强推我一个提示词笔记本应用的功能落地。最终用时3小时,居然还是跑完了。但是现在还是出现一些戒断反应,感觉啥也做不了,就无精打采的,困。</p> <p>我做了一个Prompt Notebook,专门用来收藏或者记录自己手搓的生图提示词。带Chrome一键收藏插件。支持AI优化提示词。支持提示词中提取常用字段作为提示词百科词汇。也自带生图功能用来测提示词。但是要搭配Cloudflare R2+Worker的图床。</p> <p>今天主要是做一个AI模特的资产库。将常用的AI模特固定下来,进行身份设定,以及模特的一些角色定妆图。之后生图可以直接调用AI模特自动作为垫图。</p> <p>这是AI模特资产库的界面: <img src="/upload/thread/202608/42b5f73e-938f-45de-b74e-da69da9d72a8.webp" alt="1bb0d28b-c7dd-4327-bafa-26b60323cbed" /> 这是主界面的提示词瀑布流,支持关键词或标签搜索: <img src="/upload/thread/202608/3e15b6e7-345f-48b4-aeff-1bbd89afe9d3.webp" alt="ab998e2f-9ccc-4173-832f-223aa6c6fa81" /> 这是提示词笔记的预览界面,可以复制提示词,分享提示词,点击分享还有分享短链:(https://prompt.jintao.co.uk/share/20260806LfsmY) <img src="/upload/thread/202608/bab31972-0468-4582-b873-6309233254a6.webp" alt="20260806-201213" /> 可惜现在没额度了,我又不想换模型折腾。现在还有些界面细节和小功能需要落地完善,可能还要虫子要抓。弄好了,打算放GitHub开源。</p> <p>有朋友想试试的么?</p>

shynloc 2 4

测试OurCoders能否发布照片

<p>今天小区的彩虹🌈<img src="https://share.icloud.com/photos/0ebtFydNy8r_gJETON61u4Ybg" alt="图片说明" /></p> <p>看来不能直接发照片,可以把iCloud Link的功能派上用场!</p>

梁建溢 15 45

重返OurCoders

<p>从2014年以来好久没逛过这个谈论了,不知道这个谈论的运营现在怎么样,开发人员是不是原来的人,前端UI做得不太好</p>

梁建溢 4 18

你为什么不移民?

<p>我是一定要移了,在这里连正常呼吸都不行了。以前正常呼吸指的是言论自由,现在是生物学意义的正常呼吸问题了。</p> <p>你为什么不移民?</p>

tinyfool 740 15