视频教的是人。现在教的是你的 AI。
把任何教程变成你的 AI 真正会用的技能。
100% 免费 · 开源
什么都有教程。
你的 AI 却一个都没看过。
指向任何视频。它会观看、学会步骤,再教给你的 AI。
如何剪辑你的第一支视频
- 剪辑片段
- 添加音乐
- 导出 4K
已学会
一个两分钟的教程?几秒钟就学会了——比你看完还快。
- 电子表格
- 视频剪辑
- 设计工具
- 编程
- 屏幕上的一切
字幕会听错。它读的是屏幕上的真实内容。
字幕听到的是 “some”,屏幕上实际显示的是 =SUM(B3:B10)。
听别人说,和亲眼看到怎么做,差别就在这里。
在相信一课之前,它会先动手试。行得通的会盖上徽章。测不了的就照实说。
一切都在你自己的电脑上进行。
你的视频哪儿也不去。
今天就教你的 AI 点新东西。
100% 免费。开源。一条命令。
把它复制到你 AI 的终端里——剩下的它来搞定。
你在用哪个 AI?
文档
video-to-skill 详解
这是上面那部“影片”背后的文字说明:video-to-skill 是什么、它如何读懂一段视频、一个步骤怎样才能拿到徽章、耗时多少,以及它在什么情况下会失效。
video-to-skill 是什么?
video-to-skill(V2S)是一个免费开源的工具,能把任意教程视频——无论是 YouTube 链接还是本地文件——变成可安装、且经过实际执行验证的 AI 编程智能体技能。它会看完视频、读取屏幕上的文字、逐条测试自己记录下来的步骤,最后交给你的智能体一份真正能跑起来的技能。
一条命令即可安装:
npx skills@latest add brenoepics/video-to-skill
自 v0.2.3 起,生成的技能会为机器上检测到的每一个智能体安装——Claude Code、Codex、Cursor、Gemini CLI、GitHub Copilot、OpenCode 和 Amp——在 ~/.agents/skills 中保留唯一一份真实副本,其余各处以相对符号链接指向它。只有一个事实来源,因此日后的更新对所有智能体同时生效。
为什么只有字幕还不够
video-to-skill 从画面帧中读取屏幕文字,而不只依赖音频转写,因为转写恰恰会丢掉让一个步骤能够执行的那些细节。以下是真实运行中记录到的三次听错:
| 旁白说的是 | 画面显示的是 |
|---|---|
| “some” | =SUM(B3:B10) |
| “QBang” | :q! |
| “the first extension called Vim” | vscodevim.vim v1.18.9 |
在整条流水线中,屏幕文字的优先级高于旁白:命令一律从像素中读出,绝不转述。每个步骤还带有 [t=MM:SS] 出处以及它所依据的那一帧画面,因此任何结论都能回溯到视频中对应的那一秒去核对。
验证是怎么做的
video-to-skill 的验证由一个全新的沙箱子智能体完成,它只看得到生成的技能包,从头到尾看不到视频。它按照每个步骤自身的成功标准去实际执行,徽章就是这次执行挣来的结果:
- ✅ 已验证——步骤成功执行,并满足其成功标准。
- 🟡 部分验证——部分标准通过,其余无法核实。
- ⚠ 未验证——步骤无法执行,技能里会如实写明。
执行起来不安全的步骤按策略跳过,并明确标注为已跳过——绝不会悄悄标成绿色。
一次来自真实运行的修复:某个教程的粘贴步骤被编译成了
"+P,而它粘贴的是 Vim 的内部寄存器,而不是系统剪贴板。沙箱执行后标准未通过,修复循环把它改成"+p,重跑后对照 macOS 真实剪贴板完成了验证。
流水线拿不准的步骤会被标记为低置信度后再发布,而不是悄无声息地混过去;完全没有操作流程的视频会连同一份分析报告一起被拒绝,而不会被编造成步骤。
技能如何在多个视频之间成长
把同一任务的第二个视频并入已有技能,只会让它更扎实,而不会覆盖它:两个视频一致的地方获得双重出处,冲突之处变成带引用的变体而非默默替换,并由一个「来源」小节记录合并历史。每次合并都会让徽章失效——重新安装之前会再跑一遍验证。
V2S 与同类工具的区别
video-to-skill 与两类常见工具相邻,但做的是完全不同的事。视频转文档类工具把视频变成给人看的文档;操作录制类工具把你亲自演示的一次操作变成给人看的指南。V2S 则把一段你并没有录制的视频,变成智能体可以执行的步骤。
| 差别所在 | video-to-skill | 视频转文档工具 | 操作录制工具 |
|---|---|---|---|
| 产出给谁用 | 给 AI 编程智能体,形式是可安装的技能 | 给人,形式是一份文档 | 给人,形式是分步指南 |
| 素材从哪来 | 任何已存在的视频:YouTube 链接或本地文件 | 你提供的一段视频 | 你亲自操作并录下的一次会话 |
| 步骤会被怎样处理 | 沙箱子智能体逐条执行;徽章为 ✅、🟡 或 ⚠ | 按叙述内容整理成文 | 按操作过程原样记录 |
| 工作在哪里完成 | 全部在你的机器上;视频从不外传 | 因产品而异 | 因产品而异 |
真正的分野在于:文档是把流程讲给人听,而技能是把步骤交给智能体去执行——每一步在发布之前都已经在沙箱里真跑过一次。
性能
在配备 Metal 加速的 Apple M5 上,video-to-skill 端到端处理一段 2 分钟 720p 教程仅用 3.3 秒实际耗时,相当于 36.5 倍速。同一段视频在 GitHub 的 3 核纯 CPU macOS 运行器上需要 67.5 秒,即 1.8 倍速。仅转写一项,本地为 8.0 倍速,CI 为 1.3 倍速。
这两个数字都可以在你自己的硬件上复现,同一套基准会打印同一张表:
vts-extract bench
CI 的数字来自共享的 3 核虚拟机,且没有 Metal 加速,因此代表的是区间里偏慢的一端,而不是典型水平。
隐私与安全
video-to-skill 完全在你自己的机器上运行。视频从不离开本机,只有智能体主动选择查看的那些画面帧才会进入模型上下文。没有账号、没有 API 密钥、没有遥测。
视频属于会一路流向可执行步骤的不可信输入,所以边界被明确划定。每一次下载都用校验和固定,并附带 GitHub 构建来源证明,你可以用 gh attestation verify 亲自核验。编译器会拒绝形似密钥的字符串以及「下载即执行」类脚本;视频中直接向智能体喊话的文字,一律按疑似提示词注入处理,绝不当作指令执行。
局限
video-to-skill 最擅长处理屏幕录制、命令行与图形界面教程以及演讲。快速的实物演示会在关键帧之间丢失动作细节。只在图形界面上出现的结论可能无法通过执行来验证——这类内容会带着标注发布,而不会藏在徽章后面。没有操作流程的视频会被拒绝,而不会被编造成步骤;置信度低的步骤会带标记发布。
支持的平台为 macOS(在 Apple Silicon 上启用 Metal 加速)与 Linux。
最后更新:
常见问题
video-to-skill 是什么?
video-to-skill 是一个免费开源的工具,能把任意教程视频——YouTube 链接或本地文件——变成可安装、且经过实际执行验证的 AI 编程智能体技能。它读取的是屏幕上的文字,而不只是字幕,并且在技能发布前逐条测试每个步骤。
怎样安装 video-to-skill?
运行 npx skills@latest add brenoepics/video-to-skill。这就是全部配置:一条命令,不需要账号,也不需要 API 密钥。
video-to-skill 免费吗?
免费。video-to-skill 基于 MIT 许可证免费开源,完整源码都在 GitHub 上。
video-to-skill 会把我的视频上传到别处吗?
不会。一切都在你自己的机器上运行:视频从不离开本机,只有智能体主动选择查看的画面帧才会进入模型上下文。没有任何遥测。
video-to-skill 支持哪些 AI 智能体?
Claude Code、Codex、Cursor、Gemini CLI、GitHub Copilot、OpenCode 和 Amp。自 v0.2.3 起,生成的技能会为机器上检测到的每一个智能体安装:在 ~/.agents/skills 中保留唯一一份真实副本,其余各处以相对符号链接指向它。
video-to-skill 与 Loom AI、Scribe 或操作录制工具有什么不同?
video-to-skill 产出的是给 AI 智能体用的、可安装且经过执行验证的技能,而不是给人阅读的文档。视频转文档工具和操作录制工具记录的是流程——对录制工具而言,还得是你自己演示并录下的那一次。V2S 从一段你无需亲自录制的视频出发,产出智能体可以执行的步骤,而且每一步都先在沙箱里跑过。
video-to-skill 里的「已验证」是什么意思?
已验证意味着:一个全新的沙箱子智能体——它只看得到生成的技能包,看不到视频——按该步骤的成功标准实际执行过,并且通过了。徽章分为 ✅ 已验证、🟡 部分验证和 ⚠ 未验证;执行起来不安全的步骤会被跳过并标注,绝不会悄悄标成绿色。
video-to-skill 支持哪些操作系统?
macOS 和 Linux。在 Apple Silicon 上,转写阶段使用 Metal 加速。
需要 API 密钥或账号吗?
不需要。video-to-skill 不需要账号、API 密钥或登录,也不收集任何遥测数据。
video-to-skill 有哪些局限?
video-to-skill 最擅长处理屏幕录制、命令行与图形界面教程以及演讲。快速的实物演示会在关键帧之间丢失动作细节;只在图形界面上出现的结论可能无法通过执行验证,会带着标注发布;没有操作流程的视频会被拒绝,而不会被编造成步骤。