Velorn 是一个开源的 AI 原生视频工作站,定位为“AI 视频编辑器”,专为使用 ComfyUI 的创作者设计。它将项目规划、素材生成、资产管理、时间线编辑、字幕、特效和导出整合到一个基于项目的桌面应用中。
核心理念
Velorn 的口号是“一个提示词,AI 智能体生成素材、搭建时间线、混音——通过 MCP 实时完成”。它并不是要取代 ComfyUI,而是作为 ComfyUI 之上的“生产层”:在 Velorn 中规划工作、向 ComfyUI 发送生成任务、收集输出结果,最后完成剪辑。
技术核心
Velorn 用 Electron、React、Zustand 管理项目和时间线状态,用 FFmpeg 处理和导出媒体,用本地 Whisper 转录,用 ComfyUI 的 API 生成内容,用本地 MCP 服务器提供结构化的编辑操作。
主要功能
- 生成(Generate):支持运行内置的本地工作流、云端/合作伙伴工作流,以及用户自定义的 ComfyUI 工作流。涵盖本地图像、视频、音频生成,以及 Nano Banana 2、GPT Image 2、Seedance、Kling 等云端工作流。
- 时间线编辑:提供完整的多轨道视频/音频时间线,支持剪辑、转场、特效、字幕、代理/缓存工具和导出。
- 项目化管理:生成的素材、提示词、工作流输出和时间线都在项目内统一组织。
- Velorn Bridge 支持:兼容的 ComfyUI 工作流可以直接从 ComfyUI 发送回 Velorn 的对应面板。
- 工作流管理:提供工作流设置检查(缺失节点、模型、凭证等),以及内置/收藏/模板工作流浏览器。
适用场景
- 根据歌词、节奏、角色、关键帧等制作音乐视频
- 制作 UGC 风格的创作者广告和小型企业广告
- 在一个生成工作区中运行精选的本地和云端图像/视频工作流
- 在应用内运行自定义的 ComfyUI 图像、视频、关键帧和音乐视频工作流
给 AI agent 一把剪刀,它剪出来的东西你敢直接导出吗?
四百多个 GitHub 星标,一个独立视觉特效艺术家用 Electron 堆出来的桌面视频工作站,宣称能让 Claude Code 和 Codex 这类编程 agent 直接操作视频时间线。听起来像是视频剪辑的终极自动化——告诉 AI“做个酷炫的动态图形视频”,然后喝杯咖啡回来收工。
但事情没那么简单。
一个让视频剪辑师后背发凉的问题
视频时间线不是代码仓库。
代码改错了可以看 diff,可以回滚提交。视频工程的代价分散在时间线、磁盘文件、GPU 队列和外部服务额度里。一句“把节奏慢的镜头删掉并导出竖版”,AI agent 可能把“慢”理解成错误的片段,可能忽略一个被禁用但仍需保留的镜头,可能因为删除片段而搞乱整个转场和音频同步。调用生成工作流还依赖本地 ComfyUI、模型和节点,消耗显卡时间或云端额度。导出、导入媒体、创建项目与生成资产会写入文件,并不都进入普通的撤销栈。
这就怪了。
一个宣称“让 agent 控制编辑器”的项目,首先面对的拷问是:agent 控制编辑器,到底是解放生产力,还是制造灾难的捷径?
Velorn 的答案:给 agent 一把带锁的剪刀
Velorn 的做法不是在时间线旁边塞一个聊天机器人。它在桌面应用内部跑了一个本地 HTTP MCP 服务,暴露超过一百个工具。
关键不在于“能做什么”,而在于“怎么做的”。
MCP 服务限定在 127.0.0.1:19790。这不是云 API,不是可以暴露到局域网或公网的东西。只要桌面应用运行,本机能连接此端口的进程就能请求 MCP。这个默认边界本身就传递了一个信号:agent 的权限被物理性地锁在了本地。
连接命令长这样:
plaintext
codex mcp add velorn --url http://127.0.0.1:19790/mcp
claude mcp add --transport http velorn http://127.0.0.1:19790/mcp
连接成功不代表 agent 已经“看懂”工程。Velorn 的文档推荐的首轮指令是:调用 get_mcp_recipes、get_project 和 get_timeline,只总结当前项目、活跃时间线、可用审查步骤和风险,不进行任何修改。
先确认三件事:当前是否真的打开了目标项目、时间线快照是否可用、后续工具是否需要项目上下文。
这套逻辑的核心是什么?
先预览,后执行——反直觉的 agent 设计
Velorn 给高成本、不可轻易回滚的视频操作加上了可检查的阶段边界。
这不是让 agent“直接剪片”,而是让 agent“先读项目、返回修改预览、经人工批准再执行”。生成和导出另作确认。
开发者 Jaime 做了一个演示:用 Codex,几乎没给任何创作指导,只说“你现在在 YouTube 上直播,用 Velorn 做一个超酷的动态图形视频。随便做点什么就行”。视频长约三分半钟,快进了 agent 思考的部分,但交互和最终结果都展示了出来。
agent 确实做了东西出来。
但这里藏着一个更大的问题。
生成不是编辑,编辑才是真正的生产层
Velorn 的定位非常清晰:它不是 ComfyUI 的替代品。它是 ComfyUI 之上的生产层——规划工作、发送任务给 ComfyUI、收集输出、完成剪辑。
AI 生成的素材只是原材料。真正的创作在于后续环节:素材选择、时间轴调整、声音处理、节奏把控、特效制作、字幕添加、叙事结构构建。
编辑、添加字幕、MCP、项目管理或导出都不需要 ComfyUI。Velorn 目前的所有生成操作都通过同一台机器上本地运行的 ComfyUI 实例完成。对于本地模型,工作由自己的 GPU 完成,Velorn 不收取积分。部分 ComfyUI 工作流还可以使用付费的合作伙伴节点或 API 服务,需要 Comfy.org 的凭证和积分,但工作流仍然通过用户本地的 ComfyUI 提交。
Velorn 目前没有独立的云端生成后端。
这意味着什么?
下载 Velorn 可以把它当作 MCP 编辑器使用,无需配置 ComfyUI。只有在使用生成功能时才需要 ComfyUI。
这个架构选择把“编辑”和“生成”拆成了两层。编辑层是稳定的、本地的、不需要额外算力的。生成层是可选的、依赖外部服务的、消耗资源的。
但问题是——如果 agent 只能做结构化的编辑操作(检查项目、查看媒体和帧、提出并执行编辑建议、处理字幕和特效、整理素材、准备导出和生成任务),那它本质上还是一个高级的宏命令执行器。
技术栈揭示的真相
Velorn 用 Electron、React、Zustand 管理项目和时间线状态,用 FFmpeg 处理和导出媒体,用本地 Whisper 转录,用 ComfyUI 的 API 生成内容,用本地 MCP 服务器提供结构化的编辑操作。
选择 Electron 是因为它提供了一个跨平台的编辑器实现,同时允许与文件系统、FFmpeg、本地进程、ComfyUI 和 MCP 集成。
这套技术栈透露了一个事实:Velorn 本质上是一个包装得极其精致的 Electron 应用,把一堆开源工具(FFmpeg、Whisper、ComfyUI)和一套 MCP 协议粘在一起。它的创新不在底层技术,而在“把生成和编辑放进同一个项目-based 应用”这个产品决策上。
但“放进同一个应用”和“让 agent 真正理解视频创作”是两码事。
四百颗星背后的未解之谜
Velorn 目前获得了四百多个 GitHub 星标。作为一个独立开发者项目,这个数字不算小。
但星标不等于实际使用。开发者本人也承认,特别想听听实际编辑视频或正在尝试使用智能 agent 的人的意见。
Velorn 是免费开源的。任何人都可以下载、试用、反馈。
但有一个细节值得注意:在演示中,开发者让 Codex“随便做点什么”。agent 确实做出了东西,但“做出来”和“做得好”之间隔着整个视频创作的鸿沟。agent 能识别哪些镜头该保留、哪些该删掉吗?agent 能判断节奏快慢、情绪高低、叙事连贯性吗?agent 能理解“这个转场太生硬”这种主观评价吗?
答案大概率是否定的。
Velorn 给 agent 提供的是“操作编辑器”的能力,不是“理解视频”的能力。一百多个 MCP 工具可以让 agent 精确地移动片段、添加特效、调整音量。但工具再多,也不等于 agent 知道什么时候该用哪个工具、为什么用、用了之后会产生什么艺术效果。
这就回到了开头那个问题:给 AI agent 一把剪刀,它剪出来的东西你敢直接导出吗?
Velorn 的“先预览、后执行”机制是一种妥协——承认 agent 可能犯错,所以让人类在关键节点踩一脚刹车。但这种妥协本身也说明了一个事实:至少在目前,agent 是副驾驶,不是驾驶员。
Velorn 的 MCP 服务暴露了超过一百个工具,但每个工具调用之前,都需要人类确认项目状态、时间线快照是否可用。这种“人机协同”的模式确实比“让 agent 全权接管”更安全,但它也意味着效率的提升是有上限的——人类的审批速度就是瓶颈。
四百颗星背后的真实问题是:当 agent 可以执行一千个精确的编辑指令时,谁来告诉 agent 这一千个指令应该是什么?
Velorn 把生成和编辑塞进了同一个界面,但它没有解决“agent 不懂创作”这个根本矛盾。它只是让“不懂创作”的代价变得更低——预览之后再执行,错了可以不改。
但预览本身需要人类去看。看完了还要判断。判断完了还要决定批准还是拒绝。
这跟直接手动剪辑相比,到底省了多少时间?
Velorn 的官方文档没有给出答案。开发者的演示视频也没有对比手动剪辑和 agent 辅助剪辑的效率差异。四百多个星标的人里面,有多少人真的用 Velorn 完成过一个完整的视频项目?
不知道。
Velorn 是一个有趣的项目,它把“AI agent 控制视频编辑器”从一个抽象概念变成了一个可以下载、安装、运行的桌面应用。但它也把一个问题赤裸裸地摆在了桌面上:当 agent 的操作权限被精确地定义、限制、审查之后,它到底还是不是“智能”agent?
或者换个问法:一个需要人类在每一步都盯着看的 agent,跟一个高级的键盘宏有什么区别?
Velorn 的存在本身就是一个实验——实验的结论还没有出来。四百颗星只是实验的开始,不是答案。
后记
项目作者自爆有20年以上视觉特效经验:
为了观察更长的 MCP 交互过程而不快进智能体的思考过程,我还录制了两个未剪辑的示例:
https://www.youtube.com/watch?v=_r4jf7ZDT2o
https://www.youtube.com/watch?v=AT9usQS3m48
这是我和 Velorn 仅用两天时间制作的音乐视频,已经引起了一些关注:
https://www.youtube.com/watch?v=iX-YdjVMDhg