HuaRenCa
返回论坛
日常交流

AI Agent 的新范式:video-use 如何用文本代替视频完成智能剪辑

meisan
meisan

2个月前

browser-use 团队最近开源了一个叫 video-use 的项目,一天涨了近一千星。

它做的事听上去很科幻:你把一段没剪过的原始素材丢给 Claude,它能自动剪掉口头禅、对齐切点、加字幕和调色,最后吐出一条成片。

但让我停下来的是它的做法。

AI 会剪视频已经不算新鲜,怎么剪的才有意思。

这个能剪视频的 AI,从头到尾没有看过视频。

它没有一帧一帧去理解画面,没有把视频喂给多模态模型,大部分时间它面对的只是一份十几 KB 的文本。

这不是偷工减料。

这是目前最聪明的一批 agent 产品共享的同一套做法。

搞懂它,比知道"又出了个 AI 剪辑工具"有用得多。


假设你要让模型看懂一条十分钟的视频。

最直觉的做法是抽帧:每秒抽几帧,整条片子三万帧上下,每帧丢给多模态模型大约要一千五百个 token。

乘一乘,光是把画面看一遍,就要烧掉四千五百万 token。

而且看完模型记住的多半是噪音——它知道第 1.2 万帧有个人在说话,但说了什么、哪里该剪,画面本身根本告诉不了它。

这不是假想。

今年五月有个公开测评发现,纯靠看屏幕干活的视觉 agent,完成同一个任务消耗的 token 是直接调接口的 45 倍

算力账单是一方面,更要命的是它还做得更差——看截图点按钮的 agent 经常点错位置、被弹窗带偏。

让模型直接啃原始数据,是个又贵、又笨、还容易错的方向。


video-use 换了个问法

video-use 没有问:

"这帧画面里有什么?"

它问的是:

"这段话是怎么说的?"

它先用 ElevenLabs 的语音转写,把整条素材变成一份带逐字时间戳、能区分说话人、连"(笑)(停顿)"都标出来的文本。

这份文本只有十几 KB。

Claude 拿到的就是它——一份可以用文字精度去推理的剧本。

剪辑说到底就是在时间线上做决策:

  • 哪句重复了
  • 哪里卡壳了
  • 这段留还是删

这些判断在文本上做,比在画面上做又快又准。

模型读到:

"嗯……那个,我们今天来聊……"

立刻知道这是要删的废话,根本不需要看脸。


那画面什么时候才用得上?

只在拿不准的关键节点。

比如:

  • 两条都说得不错的备选片段要二选一
  • 某个停顿到底是口误还是故意的

这时候它才临时生成一张由胶片缩略图、声波图和文字标签拼起来的合成图,看一眼。

昂贵的感知全程关着,只在卡壳的节点上才点开一下。

整条片子剪下来,文本十几 KB,加上几张关键节点的图,跟四千五百万 token 的笨办法比,几乎可以忽略。


这套做法,browser-use 早就用过一遍

如果你觉得眼熟,是因为 browser-use 自己就是靠同一招起家的。

让 AI 操作网页,笨办法是截屏给它看,让它判断:

"登录按钮在哪、点哪里。"

browser-use 不截屏。

它把网页的 DOM 结构——也就是页面背后那棵标签树——整理成文本给模型。

模型读到的是结构化的数据,看图这一步被整个省掉了。

效果是同一个方向:

有研究发现,用结构化的元素定位代替整页截图,能省下九成以上的上下文;

而且模型读的是确定的结构,不会被样式、弹窗这些视觉噪音带偏,第一次就点对的概率高得多。


往回看你会发现,这些年真正跑起来的 agent,几乎都在做同一件事:

  • 写代码的 agent,读的是文本和语法树,不是你 IDE 的截图;
  • 操作浏览器的 agent,读的是 DOM,不是网页画面;
  • 剪视频的 agent,读的是转写文本,不是视频帧。

它们处理的领域天差地别,但解题思路是同一个。


可以带走的判断框架

把上面这条线抽出来,就是一个能反复用的思维模型:

强大的 AI agent,几乎从不让模型直接面对原始世界。

它先把所在领域压成一种模型本来就擅长的结构(文本、树、序列),在结构上做绝大部分推理,只在关键决策点才动用昂贵的原始感知。

视频被压成转写文本。

网页被压成 DOM。

代码本来就是文本。

找到这个低成本的结构表示,是这类产品能不能成立的胜负手。


所以下次再看到一个号称全自动的 AI agent,与其听它演示,不如拿三个问题去戳它:

第一,它有没有把领域压成结构化的表示?

还是让模型硬啃原始数据(截图、视频帧、整页 HTML)?

后者基本意味着又慢、又贵、又不稳,很难规模化。


第二,昂贵的原始感知是全程开着,还是只在关键节点按需调用?

全程开着的,成本会随任务长度爆炸。

demo 好看,真用起来烧不起。


第三,那层结构表示本身准不准?

video-use 的命门在转写——转写错一个字,后面所有剪辑判断都建在错的地基上。

一个 agent 的上限,往往不取决于模型多聪明,而取决于它把世界翻译成结构时丢了多少、错了多少。


这三个问题,不光能用来挑工具,也能用来想自己手上的活:

如果你想让 AI 接管某件事,第一步不是急着把原始材料一股脑塞给它,而是先想清楚——

这件事有没有一种又便宜又准的结构表示,能让模型在上面动脑子。

想明白这一层,往往比换一个更大的模型更管用。


video-use 表面是个剪辑工具。

它展示的是这一代 agent 看待世界的方式:

与其睁大眼睛盯着原始画面,不如先把世界翻译成自己读得懂的语言,再开始动脑子。

0
8

评论 (0)

Your avatar
点击登录后即可评论