2S

视频教的是人。现在教的是你的 AI。

把任何教程变成你的 AI 真正会用的技能。

100% 免费 · 开源

npx skills@latest add brenoepics/video-to-skill

什么都有教程。

你的 AI 却一个都没看过。

指向任何视频。它会观看、学会步骤,再教给你的 AI。

如何剪辑你的第一支视频

  • 剪辑片段
  • 添加音乐
  • 导出 4K

已学会

一个两分钟的教程?几秒钟就学会了——比你看完还快。

  • 电子表格
  • 视频剪辑
  • 设计工具
  • 编程
  • 屏幕上的一切

字幕会听错。它读的是屏幕上的真实内容。

字幕听到的是 “some”,屏幕上实际显示的是 =SUM(B3:B10)。

听别人说,和亲眼看到怎么做,差别就在这里。

在相信一课之前,它会先动手试。行得通的会盖上徽章。测不了的就照实说。

剪辑片段
添加音乐
导出 4K
有一步没法测试 它照实说
试过了。行得通。

一切都在你自己的电脑上进行。

你的视频哪儿也不去。

今天就教你的 AI 点新东西。

100% 免费。开源。一条命令。

npx skills@latest add brenoepics/video-to-skill

把它复制到你 AI 的终端里——剩下的它来搞定。

你在用哪个 AI?

文档

video-to-skill 详解

这是上面那部“影片”背后的文字说明:video-to-skill 是什么、它如何读懂一段视频、一个步骤怎样才能拿到徽章、耗时多少,以及它在什么情况下会失效。

video-to-skill 是什么?

video-to-skill(V2S)是一个免费开源的工具,能把任意教程视频——无论是 YouTube 链接还是本地文件——变成可安装、且经过实际执行验证的 AI 编程智能体技能。它会看完视频、读取屏幕上的文字、逐条测试自己记录下来的步骤,最后交给你的智能体一份真正能跑起来的技能。

一条命令即可安装:

npx skills@latest add brenoepics/video-to-skill

自 v0.2.3 起,生成的技能会为机器上检测到的每一个智能体安装——Claude Code、Codex、Cursor、Gemini CLI、GitHub Copilot、OpenCode 和 Amp——在 ~/.agents/skills 中保留唯一一份真实副本,其余各处以相对符号链接指向它。只有一个事实来源,因此日后的更新对所有智能体同时生效。

为什么只有字幕还不够

video-to-skill 从画面帧中读取屏幕文字,而不只依赖音频转写,因为转写恰恰会丢掉让一个步骤能够执行的那些细节。以下是真实运行中记录到的三次听错:

旁白说的是 画面显示的是
“some” =SUM(B3:B10)
“QBang” :q!
“the first extension called Vim” vscodevim.vim v1.18.9

在整条流水线中,屏幕文字的优先级高于旁白:命令一律从像素中读出,绝不转述。每个步骤还带有 [t=MM:SS] 出处以及它所依据的那一帧画面,因此任何结论都能回溯到视频中对应的那一秒去核对。

验证是怎么做的

video-to-skill 的验证由一个全新的沙箱子智能体完成,它只看得到生成的技能包,从头到尾看不到视频。它按照每个步骤自身的成功标准去实际执行,徽章就是这次执行挣来的结果:

  • ✅ 已验证——步骤成功执行,并满足其成功标准。
  • 🟡 部分验证——部分标准通过,其余无法核实。
  • ⚠ 未验证——步骤无法执行,技能里会如实写明。

执行起来不安全的步骤按策略跳过,并明确标注为已跳过——绝不会悄悄标成绿色。

一次来自真实运行的修复:某个教程的粘贴步骤被编译成了 "+P,而它粘贴的是 Vim 的内部寄存器,而不是系统剪贴板。沙箱执行后标准未通过,修复循环把它改成 "+p,重跑后对照 macOS 真实剪贴板完成了验证。

流水线拿不准的步骤会被标记为低置信度后再发布,而不是悄无声息地混过去;完全没有操作流程的视频会连同一份分析报告一起被拒绝,而不会被编造成步骤。

技能如何在多个视频之间成长

把同一任务的第二个视频并入已有技能,只会让它更扎实,而不会覆盖它:两个视频一致的地方获得双重出处,冲突之处变成带引用的变体而非默默替换,并由一个「来源」小节记录合并历史。每次合并都会让徽章失效——重新安装之前会再跑一遍验证。

V2S 与同类工具的区别

video-to-skill 与两类常见工具相邻,但做的是完全不同的事。视频转文档类工具把视频变成给人看的文档;操作录制类工具把你亲自演示的一次操作变成给人看的指南。V2S 则把一段你并没有录制的视频,变成智能体可以执行的步骤。

差别所在 video-to-skill 视频转文档工具 操作录制工具
产出给谁用 给 AI 编程智能体,形式是可安装的技能 给人,形式是一份文档 给人,形式是分步指南
素材从哪来 任何已存在的视频:YouTube 链接或本地文件 你提供的一段视频 你亲自操作并录下的一次会话
步骤会被怎样处理 沙箱子智能体逐条执行;徽章为 ✅、🟡 或 ⚠ 按叙述内容整理成文 按操作过程原样记录
工作在哪里完成 全部在你的机器上;视频从不外传 因产品而异 因产品而异

真正的分野在于:文档是把流程讲给人听,而技能是把步骤交给智能体去执行——每一步在发布之前都已经在沙箱里真跑过一次。

性能

在配备 Metal 加速的 Apple M5 上,video-to-skill 端到端处理一段 2 分钟 720p 教程仅用 3.3 秒实际耗时,相当于 36.5 倍速。同一段视频在 GitHub 的 3 核纯 CPU macOS 运行器上需要 67.5 秒,即 1.8 倍速。仅转写一项,本地为 8.0 倍速,CI 为 1.3 倍速。

这两个数字都可以在你自己的硬件上复现,同一套基准会打印同一张表:

vts-extract bench

CI 的数字来自共享的 3 核虚拟机,且没有 Metal 加速,因此代表的是区间里偏慢的一端,而不是典型水平。

隐私与安全

video-to-skill 完全在你自己的机器上运行。视频从不离开本机,只有智能体主动选择查看的那些画面帧才会进入模型上下文。没有账号、没有 API 密钥、没有遥测。

视频属于会一路流向可执行步骤的不可信输入,所以边界被明确划定。每一次下载都用校验和固定,并附带 GitHub 构建来源证明,你可以用 gh attestation verify 亲自核验。编译器会拒绝形似密钥的字符串以及「下载即执行」类脚本;视频中直接向智能体喊话的文字,一律按疑似提示词注入处理,绝不当作指令执行。

局限

video-to-skill 最擅长处理屏幕录制、命令行与图形界面教程以及演讲。快速的实物演示会在关键帧之间丢失动作细节。只在图形界面上出现的结论可能无法通过执行来验证——这类内容会带着标注发布,而不会藏在徽章后面。没有操作流程的视频会被拒绝,而不会被编造成步骤;置信度低的步骤会带标记发布。

支持的平台为 macOS(在 Apple Silicon 上启用 Metal 加速)与 Linux。

最后更新:

常见问题

video-to-skill 是什么?

video-to-skill 是一个免费开源的工具,能把任意教程视频——YouTube 链接或本地文件——变成可安装、且经过实际执行验证的 AI 编程智能体技能。它读取的是屏幕上的文字,而不只是字幕,并且在技能发布前逐条测试每个步骤。

怎样安装 video-to-skill?

运行 npx skills@latest add brenoepics/video-to-skill。这就是全部配置:一条命令,不需要账号,也不需要 API 密钥。

video-to-skill 免费吗?

免费。video-to-skill 基于 MIT 许可证免费开源,完整源码都在 GitHub 上。

video-to-skill 会把我的视频上传到别处吗?

不会。一切都在你自己的机器上运行:视频从不离开本机,只有智能体主动选择查看的画面帧才会进入模型上下文。没有任何遥测。

video-to-skill 支持哪些 AI 智能体?

Claude Code、Codex、Cursor、Gemini CLI、GitHub Copilot、OpenCode 和 Amp。自 v0.2.3 起,生成的技能会为机器上检测到的每一个智能体安装:在 ~/.agents/skills 中保留唯一一份真实副本,其余各处以相对符号链接指向它。

video-to-skill 与 Loom AI、Scribe 或操作录制工具有什么不同?

video-to-skill 产出的是给 AI 智能体用的、可安装且经过执行验证的技能,而不是给人阅读的文档。视频转文档工具和操作录制工具记录的是流程——对录制工具而言,还得是你自己演示并录下的那一次。V2S 从一段你无需亲自录制的视频出发,产出智能体可以执行的步骤,而且每一步都先在沙箱里跑过。

video-to-skill 里的「已验证」是什么意思?

已验证意味着:一个全新的沙箱子智能体——它只看得到生成的技能包,看不到视频——按该步骤的成功标准实际执行过,并且通过了。徽章分为 ✅ 已验证、🟡 部分验证和 ⚠ 未验证;执行起来不安全的步骤会被跳过并标注,绝不会悄悄标成绿色。

video-to-skill 支持哪些操作系统?

macOS 和 Linux。在 Apple Silicon 上,转写阶段使用 Metal 加速。

需要 API 密钥或账号吗?

不需要。video-to-skill 不需要账号、API 密钥或登录,也不收集任何遥测数据。

video-to-skill 有哪些局限?

video-to-skill 最擅长处理屏幕录制、命令行与图形界面教程以及演讲。快速的实物演示会在关键帧之间丢失动作细节;只在图形界面上出现的结论可能无法通过执行验证,会带着标注发布;没有操作流程的视频会被拒绝,而不会被编造成步骤。

0:00 0:00 空格/K 播放 · ←/→ 5 秒 · J/L 10 秒 · 0–9 跳转