Les vidéos enseignent aux gens. Maintenant, elles enseignent à votre IA.
Transformez n'importe quel tutoriel en une compétence que votre IA sait vraiment utiliser.
100 % gratuit · open source
Il existe un tutoriel pour tout.
Votre IA n'en a jamais vu un seul.
Pointez-le vers n'importe quelle vidéo. Il la regarde, apprend les étapes et les enseigne à votre IA.
Comment monter votre première vidéo
- Couper les clips
- Ajouter la musique
- Exporter en 4K
Appris
Un tutoriel de deux minutes ? Appris en quelques secondes — plus vite que vous ne pourriez le regarder.
- Tableurs
- Montage vidéo
- Outils de design
- Programmation
- Tout ce qui s'affiche à l'écran
Les sous-titres entendent mal. Lui lit ce que montre l'écran.
Les sous-titres ont entendu « some ». L'écran affichait en réalité =SUM(B3:B10).
C'est toute la différence entre en entendre parler et le voir fait.
Avant de faire confiance à une leçon, il l'essaie. Ce qui marche reçoit un badge. Ce qui ne peut pas être testé le dit.
Tout se passe sur votre ordinateur.
Vos vidéos ne vont nulle part.
Apprenez quelque chose à votre IA dès aujourd'hui.
100 % gratuit. Open source. Une seule commande.
Copiez ceci dans le terminal de votre IA — elle s'occupe du reste.
Quelle IA utilisez-vous ?
Documentation
video-to-skill en détail
Voici la référence écrite qui accompagne le film ci-dessus : ce qu'est video-to-skill, comment il lit une vidéo, comment une étape gagne son badge, ce que cela coûte en temps et là où il cesse de fonctionner.
Qu'est-ce que video-to-skill ?
video-to-skill (V2S) est un outil libre et gratuit qui transforme n'importe quelle vidéo tutorielle — une URL YouTube ou un fichier local — en une compétence installable et vérifiée par exécution pour les agents IA de développement. Il regarde la vidéo, lit le texte affiché à l'écran, teste chaque étape qu'il consigne, et remet à votre agent une compétence qu'il peut réellement exécuter.
Une seule commande l'installe :
npx skills@latest add brenoepics/video-to-skill
Depuis la v0.2.3, la compétence produite s'installe pour tous les agents détectés sur la machine — Claude Code, Codex, Cursor, Gemini CLI, GitHub Copilot, OpenCode et Amp — sous la forme d'une seule copie réelle dans ~/.agents/skills, avec un lien symbolique relatif depuis chacun des autres. Une seule source de vérité, donc une mise à jour ultérieure les atteint tous.
Pourquoi la transcription seule ne suffit pas
video-to-skill lit le texte à l'écran directement dans les images, et pas seulement la transcription audio, parce qu'une transcription perd précisément les détails qui rendent une étape exécutable. Trois erreurs d'écoute relevées lors d'exécutions réelles :
| Ce que disait la narration | Ce que montrait l'image |
|---|---|
| “some” | =SUM(B3:B10) |
| “QBang” | :q! |
| “the first extension called Vim” | vscodevim.vim v1.18.9 |
Le texte à l'écran l'emporte sur la narration à chaque étape du traitement : les commandes sont lues sur les pixels, jamais paraphrasées. Chaque étape porte en outre la référence [t=MM:SS] et l'image dont elle a été tirée, si bien que n'importe quelle affirmation peut être vérifiée à la seconde près dans la vidéo d'origine.
Comment fonctionne la vérification
La vérification dans video-to-skill est confiée à un sous-agent neuf, exécuté en bac à sable, qui ne voit que le paquet produit et jamais la vidéo. Il exécute chaque étape face aux critères de réussite de cette étape, et le badge est celui que l'exécution a mérité :
- ✅ vérifiée — l'étape s'est exécutée et a satisfait ses critères de réussite.
- 🟡 partiellement vérifiée — certains critères sont satisfaits, d'autres n'ont pas pu être contrôlés.
- ⚠ non vérifiée — l'étape n'a pas pu être exécutée, et la compétence le dit.
Les étapes qu'il serait dangereux d'exécuter sont écartées par principe et signalées comme telles — jamais passées silencieusement au vert.
Une réparation issue d'une exécution réelle : l'étape de collage d'un tutoriel avait été compilée en
"+P, qui colle depuis le registre interne de Vim et non depuis le presse-papiers du système. Le bac à sable l'a exécutée, le critère a échoué, la boucle de réparation l'a corrigée en"+p, et la nouvelle exécution a vérifié le collage face au véritable presse-papiers de macOS.
Les étapes dont la chaîne n'est pas sûre sont publiées avec une mention de faible confiance plutôt que de passer en silence, et une vidéo qui ne contient aucune procédure est refusée avec un rapport d'analyse au lieu d'être transformée en étapes inventées.
Comment une compétence s'enrichit de plusieurs vidéos
Intégrer une seconde vidéo de la même tâche à une compétence existante la renforce au lieu de l'écraser : les points d'accord entre les deux vidéos gagnent une double référence, les désaccords deviennent des variantes citées plutôt que des remplacements silencieux, et une section Sources conserve l'historique. Chaque intégration invalide le badge : la vérification est relancée avant la réinstallation.
Ce qui distingue V2S
video-to-skill côtoie deux familles d'outils bien connues et fait un travail différent des deux. Les outils vidéo-vers-document transforment une vidéo en texte destiné à une personne ; les enregistreurs de procédures transforment une session que vous réalisez en guide destiné à une personne. V2S transforme une vidéo que vous n'avez pas tournée en étapes qu'un agent peut exécuter.
| Ce qui change | video-to-skill | Outils vidéo-vers-document | Enregistreurs de procédures |
|---|---|---|---|
| À qui s'adresse le résultat | À un agent IA, sous forme de compétence installable | À une personne, sous forme de document | À une personne, sous forme de guide pas à pas |
| D'où vient la source | N'importe quelle vidéo existante : une URL YouTube ou un fichier local | Une vidéo que vous fournissez | Une session que vous réalisez et enregistrez |
| Ce qui arrive aux étapes | Un sous-agent en bac à sable exécute chacune ; le badge est ✅, 🟡 ou ⚠ | Rédigées telles qu'elles ont été décrites | Enregistrées telles qu'elles ont été effectuées |
| Où le travail a lieu | Entièrement sur votre machine ; la vidéo n'en sort jamais | Variable selon le produit | Variable selon le produit |
La distinction qui compte : un document explique une procédure à une personne, tandis qu'une compétence remet à un agent des étapes qu'il peut exécuter — chacune ayant déjà tourné une fois en bac à sable avant d'être publiée.
Performances
video-to-skill a traité un tutoriel de 2 minutes en 720p de bout en bout en 3,3 secondes de temps réel — soit 36,5 fois la vitesse de lecture — sur un Apple M5 avec accélération Metal. Le même extrait demande 67,5 secondes, soit 1,8 fois, sur un runner macOS GitHub à 3 cœurs sans GPU. La transcription seule tourne à 8,0 fois en local et 1,3 fois en CI.
Les deux chiffres sont reproductibles sur votre propre matériel, car la même série de tests imprime le même tableau :
vts-extract bench
Les chiffres de CI proviennent de machines virtuelles partagées à 3 cœurs sans accélération Metal ; ils représentent donc le bas de la fourchette, pas le cas courant.
Confidentialité et sécurité
video-to-skill s'exécute entièrement sur votre propre machine. La vidéo n'en sort jamais, et seules les images que l'agent choisit d'examiner entrent dans le contexte du modèle. Ni compte, ni clé d'API, ni télémétrie.
Une vidéo est une entrée non fiable qui progresse vers des étapes exécutables : les frontières sont donc explicites. Chaque téléchargement est épinglé par somme de contrôle et accompagné d'une attestation de provenance de build GitHub, que vous pouvez contrôler vous-même avec gh attestation verify. Le compilateur rejette les chaînes qui ressemblent à des secrets et les scripts du type télécharger-puis-exécuter, et tout texte d'une vidéo qui s'adresse directement à l'agent est traité comme une injection de prompt présumée plutôt que suivi comme une instruction.
Limites
video-to-skill donne le meilleur sur les captures d'écran vidéo, les tutoriels en ligne de commande ou en interface graphique, et les conférences. Les démonstrations physiques rapides perdent le détail du mouvement entre deux images clés. Les affirmations propres à une interface graphique peuvent être invérifiables par exécution : elles sont publiées avec cette mention, jamais dissimulées derrière le badge. Les vidéos sans procédure sont refusées plutôt que transformées en étapes inventées, et les étapes peu sûres sont publiées avec un signalement.
Les plateformes prises en charge sont macOS, avec accélération Metal sur Apple Silicon, et Linux.
Dernière mise à jour:
Questions fréquentes
Qu'est-ce que video-to-skill ?
video-to-skill est un outil libre et gratuit qui transforme n'importe quelle vidéo tutorielle — une URL YouTube ou un fichier local — en une compétence installable et vérifiée par exécution pour les agents IA de développement. Il lit le texte affiché à l'écran, pas seulement la transcription, et teste chaque étape avant de publier la compétence.
Comment installer video-to-skill ?
Lancez npx skills@latest add brenoepics/video-to-skill. C'est toute l'installation : une commande, sans compte ni clé d'API.
video-to-skill est-il gratuit ?
Oui. video-to-skill est gratuit et open source sous licence MIT, tout le code étant disponible sur GitHub.
video-to-skill envoie-t-il ma vidéo quelque part ?
Non. Tout s'exécute sur votre propre machine : la vidéo n'en sort jamais et seules les images que l'agent choisit d'examiner entrent dans le contexte du modèle. Il n'y a aucune télémétrie.
Avec quels agents IA video-to-skill fonctionne-t-il ?
Claude Code, Codex, Cursor, Gemini CLI, GitHub Copilot, OpenCode et Amp. Depuis la v0.2.3, la compétence produite s'installe pour chacun d'eux détecté sur la machine : une seule copie réelle dans ~/.agents/skills, avec un lien symbolique relatif depuis chacun des autres.
En quoi video-to-skill est-il différent de Loom AI, Scribe ou des enregistreurs de procédures ?
video-to-skill produit une compétence installable et vérifiée par exécution destinée à un agent IA, et non un document destiné à la lecture humaine. Les outils vidéo-vers-document et les enregistreurs de procédures documentent une procédure — pour un enregistreur, une procédure que vous avez vous-même réalisée et capturée. V2S part d'une vidéo que vous n'avez pas eu à tourner et livre des étapes qu'un agent peut exécuter, chacune ayant d'abord tourné en bac à sable.
Que signifie « vérifiée » dans video-to-skill ?
Vérifiée signifie qu'un sous-agent neuf en bac à sable — qui ne voit que le paquet produit et jamais la vidéo — a exécuté l'étape face à ses critères de réussite et qu'elle a réussi. Les badges sont ✅ vérifiée, 🟡 partiellement vérifiée et ⚠ non vérifiée ; les étapes qu'il serait dangereux d'exécuter sont écartées et signalées, jamais passées silencieusement au vert.
Quels systèmes d'exploitation video-to-skill prend-il en charge ?
macOS et Linux. Sur Apple Silicon, l'étape de transcription bénéficie de l'accélération Metal.
Ai-je besoin d'une clé d'API ou d'un compte ?
Non. video-to-skill ne demande ni compte, ni clé d'API, ni connexion, et ne collecte aucune télémétrie.
Quelles sont les limites de video-to-skill ?
video-to-skill donne le meilleur sur les captures d'écran vidéo, les tutoriels en ligne de commande ou en interface graphique, et les conférences. Les démonstrations physiques rapides perdent le détail du mouvement entre deux images clés, les affirmations propres à une interface graphique peuvent être invérifiables par exécution et sont publiées avec cette mention, et les vidéos sans procédure sont refusées plutôt que transformées en étapes inventées.