El nuevo paradigma de los agentes de IA: cómo video-use utiliza texto en lugar de video para la edición inteligente

2 months ago
El equipo de browser-use lanzó recientemente un proyecto de código abierto llamado video-use, que ganó casi mil estrellas en un día.
Lo que hace suena a ciencia ficción: le das a Claude un material original sin editar, y automáticamente elimina muletillas, alinea puntos de corte, añade subtítulos y ajusta el color, para finalmente producir un video terminado.
Pero lo que me hizo detenerme fue su método.
Que la IA pueda editar videos ya no es novedad; lo interesante es cómo lo hace.
Esta IA que edita videos nunca ha visto el video.
No ha entendido el fotograma a fotograma, no ha alimentado el video a un modelo multimodal; la mayor parte del tiempo solo se enfrenta a un texto de unos pocos KB.
Esto no es un atajo.
Es el mismo enfoque que comparten los productos de agentes más inteligentes en la actualidad.
Entenderlo es mucho más útil que saber "salió otra herramienta de edición de IA".
Supongamos que quieres que un modelo entienda un video de diez minutos.
El enfoque más intuitivo es extraer fotogramas: unos pocos por segundo, totalizando alrededor de treinta mil fotogramas, cada uno de los cuales cuesta aproximadamente 1500 tokens al pasarlo por un modelo multimodal.
Multiplicando, solo para ver las imágenes, se quemarían 45 millones de tokens.
Y después de verlo, el modelo recordaría principalmente ruido: sabe que en el fotograma 12,000 hay alguien hablando, pero lo que dice, dónde cortar, la imagen por sí sola no puede decírselo.
Esto no es una suposición.
En mayo de este año, una evaluación pública encontró que un agente visual que solo trabaja viendo la pantalla consume 45 veces más tokens para completar la misma tarea que uno que llama directamente a una interfaz.
La factura de cómputo es un aspecto, pero lo peor es que además lo hace peor: el agente que hace clic en botones viendo capturas de pantalla a menudo hace clic en el lugar equivocado o se desvía por ventanas emergentes.
Hacer que el modelo mastique datos brutos es un enfoque caro, torpe y propenso a errores.
video-use cambió la pregunta
video-use no preguntó:
"¿Qué hay en este fotograma?"
Preguntó:
"¿Cómo se dijo esta frase?"
Primero usa la transcripción de voz de ElevenLabs para convertir todo el material en un texto con marcas de tiempo palabra por palabra, que distingue hablantes e incluso marca "(risa) (pausa)".
Este texto tiene solo unos pocos KB.
Claude recibe eso: un guion sobre el que puede razonar con precisión textual.
Editar, al final, es tomar decisiones en la línea de tiempo:
- ¿Qué frase se repitió?
- ¿Dónde se trabó?
- ¿Este segmento se queda o se elimina?
Estos juicios se hacen más rápido y con mayor precisión en texto que en imágenes.
El modelo lee:
"Eh... esto, hoy vamos a hablar de..."
Inmediatamente sabe que es basura que debe eliminar, ni siquiera necesita ver la cara.
¿Cuándo se usan las imágenes entonces?
Solo en los puntos clave donde no está seguro.
Por ejemplo:
- Dos fragmentos alternativos igualmente buenos, hay que elegir uno
- Si una pausa es un error o intencional
En ese momento genera temporalmente una imagen compuesta de miniaturas de película, ondas de sonido y etiquetas de texto, y la mira.
La costosa percepción está apagada todo el tiempo, solo se enciende en los puntos de atasco.
Todo el video se edita con unos pocos KB de texto más algunas imágenes de puntos clave, casi insignificante en comparación con el enfoque torpe de 45 millones de tokens.
Este enfoque, browser-use ya lo usó antes
Si te resulta familiar, es porque browser-use se hizo famoso con el mismo truco.
Para que la IA opere una página web, el enfoque torpe es tomar una captura de pantalla y hacer que la IA determine:
"Dónde está el botón de inicio de sesión, dónde hacer clic."
browser-use no toma capturas.
En su lugar, convierte la estructura DOM de la página web —el árbol de etiquetas detrás de la página— en texto y se lo da al modelo.
El modelo recibe datos estructurados, y el paso de ver la imagen se elimina por completo.
El efecto va en la misma dirección:
Un estudio encontró que usar la localización de elementos estructurados en lugar de capturas de pantalla completas ahorra más del 90% del contexto;
Además, el modelo lee una estructura determinista, no se deja desviar por ruidos visuales como estilos o ventanas emergentes, y la probabilidad de acertar a la primera es mucho mayor.
Mirando hacia atrás, los agentes que realmente han tenido éxito en los últimos años casi todos hacen lo mismo:
- Los agentes que escriben código leen texto y árboles de sintaxis, no capturas de tu IDE;
- Los agentes que operan navegadores leen el DOM, no la imagen de la página;
- Los agentes que editan videos leen transcripciones de texto, no fotogramas de video.
Los dominios que manejan son muy diferentes, pero la idea de solución es la misma.
Un marco de juicio que puedes llevarte
Extrayendo la línea anterior, obtenemos un modelo mental reutilizable:
Un agente de IA poderoso casi nunca deja que el modelo se enfrente directamente al mundo real.
Primero comprime el dominio en una estructura que el modelo ya maneja bien (texto, árbol, secuencia), realiza la mayor parte del razonamiento sobre esa estructura, y solo en puntos de decisión clave utiliza la costosa percepción original.
El video se comprime en texto de transcripción.
La página web se comprime en DOM.
El código ya es texto.
Encontrar esta representación estructurada de bajo costo es el factor decisivo para que este tipo de productos tenga éxito.
Así que la próxima vez que veas un agente de IA que dice ser totalmente automático, en lugar de escuchar su demostración, hazle tres preguntas:
Primero, ¿ha comprimido el dominio en una representación estructurada?
¿O hace que el modelo mastique datos brutos (capturas de pantalla, fotogramas de video, HTML completo)?
Lo segundo generalmente significa lento, caro e inestable, difícil de escalar.
Segundo, ¿la costosa percepción original está encendida todo el tiempo o solo se usa bajo demanda en puntos clave?
Si está encendida todo el tiempo, el costo explota con la duración de la tarea.
La demo se ve bien, pero en uso real es insostenible.
Tercero, ¿esa capa de estructura es precisa en sí misma?
El talón de Aquiles de video-use está en la transcripción: si transcribe mal una palabra, todos los juicios de edición posteriores se basan en una base incorrecta.
El límite de un agente a menudo no depende de lo inteligente que sea el modelo, sino de cuánto se pierde o se equivoca al traducir el mundo a una estructura.
Estas tres preguntas no solo sirven para elegir herramientas, sino también para pensar en tu propio trabajo:
Si quieres que la IA se encargue de algo, el primer paso no es meterle los materiales brutos, sino pensar primero:
¿Existe una representación estructurada barata y precisa sobre la que el modelo pueda pensar?
Entender esto suele ser más efectivo que cambiar a un modelo más grande.
video-use es superficialmente una herramienta de edición.
Lo que muestra es la forma en que esta generación de agentes ve el mundo:
En lugar de abrir los ojos y mirar fijamente las imágenes originales, primero traduce el mundo a un idioma que pueda leer, y luego empieza a pensar.