Claude Video: permite a Claude analizar videos con subtítulos, fotogramas y transcripción automática

Funcionamiento general
Claude Video es una habilidad que permite a Claude analizar videos pegando una URL o ruta local. Primero intenta obtener subtítulos gratuitos; si no hay, usa la API de Whisper (Groq preferido) para transcribir el audio. Extrae fotogramas según un modo de detalle configurable y los entrega junto con la transcripción a Claude, que responde basándose en lo que ha visto y oído.
Presupuesto de fotogramas y deduplicación
El costo en tokens está dominado por las imágenes, por lo que hay un presupuesto automático: ≤30s ~30 fotogramas, 30s-1min ~40, 1-3min ~60, 3-10min ~80, >10min 100 (con límite). Se recomienda usar --start y --end para enfocar secciones. La deduplicación elimina fotogramas casi idénticos (diferencia de brillo ≤2.0 en miniaturas 16×16) para gastar el presupuesto en contenido distinto.
Modos de detalle y costos
Hay 4 modos: transcript (solo subtítulos), efficient (fotogramas clave, máximo 50, extracción ~0.5s), balanced (detección de cambios de escena, máximo 100, ~20.9s en video de 49min) y token-burner (sin límite, ~21s). Ejemplo medido en un video 49:08 1280×720: efficient produjo 50 fotogramas cubriendo 0:00-49:04 (~9.8k tokens de imagen), balanced 100 fotogramas hasta 48:38 (~19.7k tokens), token-burner 116 (~22.8k tokens). Los fotogramas se escalan a 512px de ancho por defecto.
Instalación
En Claude Code: /plugin marketplace add bradautomates/claude-video y /plugin install watch@claude-video. Para Codex, Cursor, Copilot, Gemini CLI y más de 50 hosts: npx skills add bradautomates/claude-video -g. En claude.ai web se descarga watch.skill y se añade en Configuración. La primera ejecución instala dependencias (brew en macOS, comandos en Linux/Windows) y solicita claves API para Whisper.
Uso y ejemplos
Ejemplos típicos: analizar el gancho de un video viral, diagnosticar errores en grabaciones de pantalla, resumir videos largos o extraer lo esencial de lanzamientos. Se pueden usar --timestamps para capturar momentos específicos. Si no se dispone de clave Whisper, --no-whisper permite analizar solo con fotogramas.
Fuente: github.com · Visto en r/InteligenciArtificial