2S

Los videos enseñan a las personas. Ahora enseñan a tu IA.

Convierte cualquier tutorial en una habilidad que tu IA pueda usar de verdad.

100% gratis · código abierto

npx skills@latest add brenoepics/video-to-skill

Hay un tutorial para todo.

Tu IA nunca ha visto ninguno.

Apúntalo a cualquier video. Lo mira, aprende los pasos y se los enseña a tu IA.

Cómo editar tu primer video

  • Recortar los clips
  • Añadir música
  • Exportar en 4K

Aprendido

¿Un tutorial de dos minutos? Aprendido en segundos — más rápido de lo que tardarías en verlo.

  • Hojas de cálculo
  • Edición de video
  • Herramientas de diseño
  • Programación
  • Cualquier cosa en pantalla

Los subtítulos oyen mal. Esta herramienta lee la pantalla de verdad.

Los subtítulos oyeron “some”. La pantalla mostraba en realidad =SUM(B3:B10).

Esa es la diferencia entre oír hablar de algo y verlo hecho.

Antes de confiar en una lección, la prueba. Lo que funciona recibe una insignia. Lo que no se puede probar, lo dice.

Recortar los clips
Añadir música
Exportar en 4K
Un paso que no se pudo probar lo dice
Lo probó. Funciona.

Todo ocurre en tu computadora.

Tus videos nunca salen de ahí.

Enséñale algo nuevo a tu IA hoy.

100% gratis. Código abierto. Un solo comando.

npx skills@latest add brenoepics/video-to-skill

Copia esto en la terminal de tu IA — ella hace el resto.

¿Qué IA usas?

Documentación

video-to-skill en detalle

Esta es la referencia escrita que hay detrás de la película de arriba: qué es video-to-skill, cómo lee un video, cómo un paso se gana su insignia, cuánto tiempo cuesta y dónde deja de funcionar.

¿Qué es video-to-skill?

video-to-skill (V2S) es una herramienta gratuita y de código abierto que convierte cualquier video tutorial —una URL de YouTube o un archivo local— en una habilidad instalable y verificada por ejecución para agentes de IA de programación. Mira el video, lee el texto de la pantalla, prueba cada paso que anota y le entrega a tu agente una habilidad que realmente puede ejecutar.

Un solo comando lo instala:

npx skills@latest add brenoepics/video-to-skill

Desde la v0.2.3, la habilidad generada se instala para todos los agentes detectados en la máquina —Claude Code, Codex, Cursor, Gemini CLI, GitHub Copilot, OpenCode y Amp— como una copia real en ~/.agents/skills y un enlace simbólico relativo desde cada uno de los demás. Una sola fuente de verdad, así que una actualización posterior llega a todos.

Por qué la transcripción por sí sola no basta

video-to-skill lee el texto en pantalla directamente de los fotogramas, no solo la transcripción del audio, porque una transcripción pierde justo los detalles que hacen que un paso se pueda ejecutar. Tres errores de audición registrados en ejecuciones reales:

Lo que dijo la narración Lo que mostraba el fotograma
“some” =SUM(B3:B10)
“QBang” :q!
“the first extension called Vim” vscodevim.vim v1.18.9

El texto en pantalla tiene prioridad sobre la narración en todo el proceso: los comandos se leen de los píxeles, nunca se parafrasean. Cada paso lleva además la procedencia [t=MM:SS] y el fotograma del que se leyó, de modo que cualquier afirmación se puede contrastar con el segundo exacto del video del que salió.

Cómo funciona la verificación

La verificación en video-to-skill la hace un subagente nuevo, en un entorno aislado, que solo ve el paquete generado y nunca el video. Ejecuta cada paso contra los criterios de éxito de ese paso, y la insignia es la que la ejecución se haya ganado:

  • ✅ verificado: el paso se ejecutó y cumplió sus criterios de éxito.
  • 🟡 verificado parcialmente: algunos criterios se cumplieron y otros no se pudieron comprobar.
  • ⚠ sin verificar: el paso no se pudo ejecutar, y la habilidad lo dice.

Los pasos cuya ejecución sería insegura se omiten por política y se marcan como omitidos, nunca reciben un verde silencioso.

Una reparación de una ejecución real: el paso de pegar de un tutorial se compiló como "+P, que pega desde el registro interno de Vim y no desde el portapapeles del sistema. El entorno aislado lo ejecutó, el criterio falló, el bucle de reparación lo corrigió a "+p y la nueva ejecución verificó el pegado contra el portapapeles real de macOS.

Los pasos de los que el proceso no está seguro se publican marcados como de baja confianza en lugar de pasar en silencio, y un video que no contiene ningún procedimiento se rechaza con un informe de análisis en vez de convertirse en pasos inventados.

Cómo crece una habilidad con varios videos

Incorporar un segundo video de la misma tarea a una habilidad existente la refuerza en lugar de sobrescribirla: las coincidencias entre ambos videos ganan doble procedencia, las discrepancias se convierten en variantes citadas en vez de reemplazos silenciosos, y una sección de Fuentes registra el historial. Cada incorporación invalida la insignia: la verificación vuelve a ejecutarse antes de reinstalar.

Cómo se compara V2S

video-to-skill convive con dos familias de herramientas conocidas y hace un trabajo distinto al de ambas. Las herramientas de video a documento convierten un video en un texto para una persona; los grabadores de flujos de trabajo convierten una sesión que tú realizas en una guía para una persona. V2S convierte un video que no grabaste en pasos que un agente puede ejecutar.

Qué cambia video-to-skill Herramientas de video a documento Grabadores de flujos de trabajo
Para quién es el resultado Un agente de IA, como habilidad instalable Una persona, como documento Una persona, como guía paso a paso
De dónde sale la fuente Cualquier video ya existente: una URL de YouTube o un archivo local Un video que tú aportas Una sesión que tú realizas y grabas
Qué pasa con los pasos Un subagente aislado ejecuta cada uno; la insignia es ✅, 🟡 o ⚠ Se redactan tal como se describieron Se registran tal como se realizaron
Dónde ocurre el trabajo Íntegramente en tu máquina; el video nunca sale de ella Varía según el producto Varía según el producto

La distinción que importa: un documento le explica un procedimiento a una persona, mientras que una habilidad le entrega a un agente pasos que puede ejecutar, cada uno ya ejecutado una vez en un entorno aislado antes de publicarse.

Rendimiento

video-to-skill procesó un tutorial de 2 minutos en 720p de principio a fin en 3,3 segundos de tiempo real de ejecución —36,5 veces la duración del video— en un Apple M5 con aceleración Metal. El mismo clip tarda 67,5 segundos, es decir 1,8 veces, en un runner de macOS de GitHub con 3 núcleos y sin GPU. Solo la transcripción va a 8,0 veces en local y 1,3 en CI.

Ambas cifras se pueden reproducir en tu propio equipo, porque la misma batería imprime la misma tabla:

vts-extract bench

Las cifras de CI vienen de máquinas virtuales compartidas de 3 núcleos sin aceleración Metal, así que son el extremo lento del rango, no el caso típico.

Privacidad y seguridad

video-to-skill se ejecuta íntegramente en tu propia máquina. El video nunca sale de ella y solo los fotogramas que el agente decide inspeccionar llegan al contexto del modelo. No hay cuentas, ni claves de API, ni telemetría.

Un video es una entrada no confiable que avanza hacia pasos ejecutables, así que las fronteras son explícitas. Cada descarga está fijada por checksum y lleva un certificado de procedencia de compilación de GitHub que puedes comprobar tú mismo con gh attestation verify. El compilador rechaza cadenas con aspecto de secreto y scripts del tipo descargar-y-ejecutar, y el texto de un video que se dirige al agente se trata como sospecha de inyección de prompt en lugar de seguirse como instrucción.

Limitaciones

video-to-skill funciona mejor con grabaciones de pantalla, tutoriales de terminal y de interfaz gráfica, y charlas. Las demostraciones físicas rápidas pierden detalle de movimiento entre fotogramas clave. Las afirmaciones que solo se ven en la interfaz gráfica pueden no ser verificables por ejecución: se publican etiquetadas como tales, no escondidas detrás de la insignia. Los videos sin procedimiento se rechazan en vez de convertirse en pasos inventados, y los pasos de baja confianza se publican señalados.

Las plataformas compatibles son macOS, con aceleración Metal en Apple Silicon, y Linux.

Última actualización:

Preguntas frecuentes

¿Qué es video-to-skill?

video-to-skill es una herramienta gratuita y de código abierto que convierte cualquier video tutorial —una URL de YouTube o un archivo local— en una habilidad instalable y verificada por ejecución para agentes de IA de programación. Lee el texto de la pantalla, no solo la transcripción, y prueba cada paso antes de publicar la habilidad.

¿Cómo instalo video-to-skill?

Ejecuta npx skills@latest add brenoepics/video-to-skill. Esa es toda la configuración: un comando, sin cuenta y sin clave de API.

¿video-to-skill es gratis?

Sí. video-to-skill es gratuito y de código abierto bajo la licencia MIT, con todo el código en GitHub.

¿video-to-skill sube mi video a algún sitio?

No. Todo se ejecuta en tu propia máquina: el video nunca sale de ella y solo los fotogramas que el agente decide inspeccionar llegan al contexto del modelo. No hay telemetría.

¿Con qué agentes de IA funciona video-to-skill?

Claude Code, Codex, Cursor, Gemini CLI, GitHub Copilot, OpenCode y Amp. Desde la v0.2.3 la habilidad generada se instala para cada uno de ellos que se detecte en la máquina: una copia real en ~/.agents/skills y un enlace simbólico relativo desde cada uno de los demás.

¿En qué se diferencia video-to-skill de Loom AI, Scribe o los grabadores de flujos de trabajo?

video-to-skill produce una habilidad instalable y verificada por ejecución para un agente de IA, no un documento para que lo lea una persona. Las herramientas de video a documento y los grabadores de flujos de trabajo documentan un procedimiento; en el caso del grabador, uno que tú mismo realizaste y capturaste. V2S parte de un video que no tuviste que grabar y publica pasos que un agente puede ejecutar, cada uno probado antes en un entorno aislado.

¿Qué significa “verificado” en video-to-skill?

Verificado significa que un subagente nuevo en un entorno aislado —que solo ve el paquete generado y nunca el video— ejecutó el paso contra sus criterios de éxito y los cumplió. Las insignias son ✅ verificado, 🟡 verificado parcialmente y ⚠ sin verificar; los pasos cuya ejecución sería insegura se omiten y se etiquetan, nunca reciben un verde silencioso.

¿Qué sistemas operativos admite video-to-skill?

macOS y Linux. En Apple Silicon, la etapa de transcripción usa aceleración Metal.

¿Necesito una clave de API o una cuenta?

No. video-to-skill no necesita cuenta, ni clave de API, ni inicio de sesión, y no recoge telemetría.

¿Cuáles son las limitaciones de video-to-skill?

video-to-skill funciona mejor con grabaciones de pantalla, tutoriales de terminal y de interfaz gráfica, y charlas. Las demostraciones físicas rápidas pierden detalle de movimiento entre fotogramas clave, las afirmaciones que solo se ven en la interfaz gráfica pueden no ser verificables por ejecución y se publican etiquetadas como tales, y los videos sin procedimiento se rechazan en vez de convertirse en pasos inventados.

0:00 0:00 Espacio/K reproducir · ←/→ 5 s · J/L 10 s · 0–9 saltar