OC

让 LLM 看视频最难的不是上下文:选错帧就只剩一堆截图
科技 · 2026-08-04 · 开发者工具 · 阅读 10

让 LLM 看视频最难的不是上下文:选错帧就只剩一堆截图

作者:林岚|OC 开发者生态编辑

作者 林岚 林岚

开源工具 claude-real-video 的作者复盘了让视觉语言模型“观看”视频的工程方法:不把整段视频直接输入模型,而是在约 100 至 150 帧预算内完成场景检测、去重,再把关键帧与字幕或本地 Whisper 转录按同一时间线融合。

一句话结论:把视频送给 LLM 的核心不是抽帧,而是决定哪些变化值得占用昂贵的图像 token;固定每秒一帧既会浪费在相似画面上,也会错过一闪而过的关键动作。

均匀采样最容易实现,但对内容结构一无所知。访谈会产生大量近似帧,快速演示却可能恰好漏掉报错。作者先使用 FFmpeg 场景分数,再根据滚动平均动态调整阈值,让动画、慢速移动和安静长镜头使用各自的变化基线。

去重后来被拆成三个通道。全局通道用缩小后的 RGB 网格过滤相似构图,并和最近四个已保留帧比较,避免 A-B-A 剪辑重复收录。动作通道保留占画面很小但变化剧烈的主体,解决远景人物永远达不到全局变化比例的问题。

全局变化小主体动作和局部状态更新由三个通道共同筛选

第三个“稳定状态”通道使用更高分辨率签名,捕捉字幕切换、白板多一行字或 UI 局部更新。它只在整体静止时工作,并加入冷却,避免旗帜、烟雾等持续微动吃光帧预算。这些阈值来自作者和用户处理 2181 个真实视频后的迭代,不是公开学术基准的最优参数。

文字部分优先使用内嵌字幕,否则本地 Whisper。工具会把转录片段和对应帧提前连接,静音超过 1.5 秒则生成只有画面的区间,避免模型自己在长视频里对错时间。最终输出只是 JPEG、文本和清单,也可以通过 MCP 的 watch_video 工具调用。

边界很明确。关键帧能告诉模型画面出现了什么,却无法保留镜头移动、剪辑节奏、声调和连续动作。作者也没有提供与原生视频模型或均匀采样的标准化准确率对比。它是一套可解释、可本地运行的压缩管线,不是“模型真的完整看过视频”的证明。

关键事实

  • 帧预算:常规设计约保留 100 至 150 张关键帧
  • 选择方法:动态场景阈值加全局、动作和稳定状态三路去重
  • 文本融合:内嵌字幕优先,否则本地 Whisper,并提前按时间对齐
  • 发布形式:MIT 许可开源工具,提供 CLI 和 MCP 接口

OC 判断

这套方案适合教程、演示、会议和屏幕录制,尤其重视可检查的间结果。用于体育、舞蹈、驾驶或镜头语言分析时,抽帧会丢掉最重要的时间信息,应该选择真正建模连续视频的系统。

为什么重要

  • 对开发者:帧预算、选择规则和时间对齐通常比单纯提高图片分辨率更影响结果。
  • 对企业:本地处理能减少视频上传,但字幕模型、缓存和下载来源仍需审计。
  • 对用户:模型基于关键帧回答时,应明确它没有获得完整运动和声音细节。

参考来源

相关阅读

基于标题、摘要和正文内容自动匹配。

更多科技

评论

围绕这篇文章补充信息、提出问题或分享观察。

0
暂无评论。

发表评论

继续看看 OC 用户围绕这个话题说了什么、做了什么。

相关帖子

更多

你们的Codex额度提前耗完了没?戒断反应如何?

<p>我在第三天就消耗了只剩1%,忍了一天,然后今天干脆用这最后的1%,开着5.6 Sol 极高 强推我一个提示词笔记本应用的功能落地。最终用时3小时,居然还是跑完了。但是现在还是出现一些戒断反应,感觉啥也做不了,就无精打采的,困。</p> <p>我做了一个Prompt Notebook,专门用来收藏或者记录自己手搓的生图提示词。带Chrome一键收藏插件。支持AI优化提示词。支持提示词中提取常用字段作为提示词百科词汇。也自带生图功能用来测提示词。但是要搭配Cloudflare R2+Worker的图床。</p> <p>今天主要是做一个AI模特的资产库。将常用的AI模特固定下来,进行身份设定,以及模特的一些角色定妆图。之后生图可以直接调用AI模特自动作为垫图。</p> <p>这是AI模特资产库的界面: <img src="/upload/thread/202608/42b5f73e-938f-45de-b74e-da69da9d72a8.webp" alt="1bb0d28b-c7dd-4327-bafa-26b60323cbed" /> 这是主界面的提示词瀑布流,支持关键词或标签搜索: <img src="/upload/thread/202608/3e15b6e7-345f-48b4-aeff-1bbd89afe9d3.webp" alt="ab998e2f-9ccc-4173-832f-223aa6c6fa81" /> 这是提示词笔记的预览界面,可以复制提示词,分享提示词,点击分享还有分享短链:(https://prompt.jintao.co.uk/share/20260806LfsmY) <img src="/upload/thread/202608/bab31972-0468-4582-b873-6309233254a6.webp" alt="20260806-201213" /> 可惜现在没额度了,我又不想换模型折腾。现在还有些界面细节和小功能需要落地完善,可能还要虫子要抓。弄好了,打算放GitHub开源。</p> <p>有朋友想试试的么?</p>

shynloc 2 4

重返OurCoders

<p>从2014年以来好久没逛过这个谈论了,不知道这个谈论的运营现在怎么样,开发人员是不是原来的人,前端UI做得不太好</p>

梁建溢 4 18

测试OurCoders能否发布照片

<p>今天小区的彩虹🌈<img src="https://share.icloud.com/photos/0ebtFydNy8r_gJETON61u4Ybg" alt="图片说明" /></p> <p>看来不能直接发照片,可以把iCloud Link的功能派上用场!</p>

梁建溢 15 45