browser-use 团队最近开源了一个叫 video-use 的项目,一天涨了近一千星。
它做的事听上去很科幻:你把一段没剪过的原始素材丢给 Claude,它能自动剪掉口头禅、对齐切点、加字幕和调色,最后吐出一条成片。
但让我停下来的是它的做法。
AI 会剪视频已经不算新鲜,怎么剪的才有意思。
这个能剪视频的 AI,从头到尾没有看过视频。
它没有一帧一帧去理解画面,没有把视频喂给多模态模型,大部分时间它面对的只是一份十几 KB 的文本。
这不是偷工减料。
这是目前最聪明的一批 agent 产品共享的同一套做法。
搞懂它,比知道"又出了个 AI 剪辑工具"有用得多。
假设你要让模型看懂一条十分钟的视频。
最直觉的做法是抽帧:每秒抽几帧,整条片子三万帧上下,每帧丢给多模态模型大约要一千五百个 token。
乘一乘,光是把画面看一遍,就要烧掉四千五百万 token。
而且看完模型记住的多半是噪音——它知道第 1.2 万帧有个人在说话,但说了什么、哪里该剪,画面本身根本告诉不了它。
这不是假想。
今年五月有个公开测评发现,纯靠看屏幕干活的视觉 agent,完成同一个任务消耗的 token 是直接调接口的 45 倍。
算力账单是一方面,更要命的是它还做得更差——看截图点按钮的 agent 经常点错位置、被弹窗带偏。
让模型直接啃原始数据,是个又贵、又笨、还容易错的方向。
video-use 换了个问法
video-use 没有问:
"这帧画面里有什么?"
它问的是:
"这段话是怎么说的?"
它先用 ElevenLabs 的语音转写,把整条素材变成一份带逐字时间戳、能区分说话人、连"(笑)(停顿)"都标出来的文本。
这份文本只有十几 KB。
Claude 拿到的就是它——一份可以用文字精度去推理的剧本。
剪辑说到底就是在时间线上做决策:
- 哪句重复了
- 哪里卡壳了
- 这段留还是删
这些判断在文本上做,比在画面上做又快又准。
模型读到:
"嗯……那个,我们今天来聊……"
立刻知道这是要删的废话,根本不需要看脸。
那画面什么时候才用得上?
只在拿不准的关键节点。
比如:
- 两条都说得不错的备选片段要二选一
- 某个停顿到底是口误还是故意的
这时候它才临时生成一张由胶片缩略图、声波图和文字标签拼起来的合成图,看一眼。
昂贵的感知全程关着,只在卡壳的节点上才点开一下。
整条片子剪下来,文本十几 KB,加上几张关键节点的图,跟四千五百万 token 的笨办法比,几乎可以忽略。
这套做法,browser-use 早就用过一遍
如果你觉得眼熟,是因为 browser-use 自己就是靠同一招起家的。
让 AI 操作网页,笨办法是截屏给它看,让它判断:
"登录按钮在哪、点哪里。"
browser-use 不截屏。
它把网页的 DOM 结构——也就是页面背后那棵标签树——整理成文本给模型。
模型读到的是结构化的数据,看图这一步被整个省掉了。
效果是同一个方向:
有研究发现,用结构化的元素定位代替整页截图,能省下九成以上的上下文;
而且模型读的是确定的结构,不会被样式、弹窗这些视觉噪音带偏,第一次就点对的概率高得多。
往回看你会发现,这些年真正跑起来的 agent,几乎都在做同一件事:
- 写代码的 agent,读的是文本和语法树,不是你 IDE 的截图;
- 操作浏览器的 agent,读的是 DOM,不是网页画面;
- 剪视频的 agent,读的是转写文本,不是视频帧。
它们处理的领域天差地别,但解题思路是同一个。
可以带走的判断框架
把上面这条线抽出来,就是一个能反复用的思维模型:
强大的 AI agent,几乎从不让模型直接面对原始世界。
它先把所在领域压成一种模型本来就擅长的结构(文本、树、序列),在结构上做绝大部分推理,只在关键决策点才动用昂贵的原始感知。
视频被压成转写文本。
网页被压成 DOM。
代码本来就是文本。
找到这个低成本的结构表示,是这类产品能不能成立的胜负手。
所以下次再看到一个号称全自动的 AI agent,与其听它演示,不如拿三个问题去戳它:
第一,它有没有把领域压成结构化的表示?
还是让模型硬啃原始数据(截图、视频帧、整页 HTML)?
后者基本意味着又慢、又贵、又不稳,很难规模化。
第二,昂贵的原始感知是全程开着,还是只在关键节点按需调用?
全程开着的,成本会随任务长度爆炸。
demo 好看,真用起来烧不起。
第三,那层结构表示本身准不准?
video-use 的命门在转写——转写错一个字,后面所有剪辑判断都建在错的地基上。
一个 agent 的上限,往往不取决于模型多聪明,而取决于它把世界翻译成结构时丢了多少、错了多少。
这三个问题,不光能用来挑工具,也能用来想自己手上的活:
如果你想让 AI 接管某件事,第一步不是急着把原始材料一股脑塞给它,而是先想清楚——
这件事有没有一种又便宜又准的结构表示,能让模型在上面动脑子。
想明白这一层,往往比换一个更大的模型更管用。
video-use 表面是个剪辑工具。
它展示的是这一代 agent 看待世界的方式:
与其睁大眼睛盯着原始画面,不如先把世界翻译成自己读得懂的语言,再开始动脑子。
