nramosdev · Blog
Agentic video understanding con Gemini: Gemini decide qué mirar en el vídeo (88% menos tokens)
TL;DR
Agentic video understanding con Gemini: Gemini decide qué mirar en el vídeo (88% menos tokens)
Google convierte a Gemini en un agente que decide qué mirar en el vídeo. En lugar de procesar el vídeo a un ritmo fijo de un fotograma por segundo, el modelo navega la línea de tiempo y carga solo los momentos que necesita. El resultado: hasta un 88% menos de tokens y un 66% menos de coste, con hasta un 7% más de calidad. En este vídeo te lo explico todo: qué es la comprensión agéntica, cómo funciona el bucle agéntico, los tres modelos Flash que la soportan, el precio real, los cuatro casos de uso y por qué es una capacidad de la nube y no local.
Capítulos del vídeo
- 00:00 — Gemini decide qué mirar en el vídeo
- 00:06 — La comprensión agéntica de Gemini
- 00:20 — Dos modos: estático y agéntico
- 00:32 — Cómo funciona el bucle agéntico
- 00:45 — Tres modalidades a la vez
- 00:53 — Hasta 88% menos tokens
- 01:03 — Tres modelos Gemini Flash
- 01:20 — Sin coste extra por tokens
- 01:30 — Localiza el momento subsegundo
- 01:43 — La aguja en el heno
- 01:50 — Anomalías y contar objetos
- 02:03 — Es cloud, no local
El contexto
DATOS CLAVE
- Lanzamiento: 01-09-2026 (blog Google DeepMind).
- Comprensión agéntica: el modelo navega la línea de tiempo y carga solo lo que necesita (vs. estático a 1 FPS).
- Hasta -88% tokens, -66% coste y +7% calidad frente al modo estático (LongVideoBench).
- Modelos: Gemini 3.7 Flash (mejor), 3.6 Flash, 3.5 Flash-Lite; la doc ya lista también 3.8 Flash.
- Precio: sin recargo por la feature. 3.7 Flash $0.75 entrada / $3.75 salida por 1M tokens (hasta 31-12-2026).
- Casos: localización subsegundo, aguja en el heno en vídeos de horas, detección de anomalías, contar acciones y objetos.
- Es una capacidad cloud/API (Google AI Studio, Gemini Enterprise Agent Platform), no local.
- Próximamente en la app Gemini e impulsará “Ask YouTube”.
Análisis
El vídeo desgrana el tema con datos verificados, comparativas y conclusiones prácticas. Aquí tienes el contexto por escrito para profundizar.
Puntos clave
- Ver datos y cifras en el vídeo: https://www.youtube.com/watch?v=UVofJRX2PQc
- Investigación previa documentada en el pipeline de vídeo (research.md del proyecto)
- Fuentes primarias listadas a continuación
Fuentes
- Blog Google DeepMind — Introducing agentic video understanding with Gemini
- Doc API oficial — Video understanding (agentic)
- Doc API oficial — Pricing
- Gemini Enterprise Agent Platform — Video understanding
Conclusión
Un análisis más en el canal. Suscríbete para no perderte los próximos.
Artículo generado automáticamente desde el vídeo publicado en nramosdev. Cada número citado proviene de la investigación verificada del pipeline.