← 个人探索

我扒完了 GitHub 上 55 个 AI 成片产线,得出一个结论

看了 55 个开源项目,整理它们怎样串起剧本、分镜和成片,以及哪些做法值得借鉴。

AI 视频 · 28 min · 2026-08-25

KK 3D 小剧场:手持指挥棒统筹调度剧本分解、分镜卡片与胶卷轨道全景

In one sentence / 核心立论

这个赛道真正的战场,早就不在“画布”或“剪辑器”,而在“让 Agent 当导演”的成片产线本身。下一轮竞争大概率不是比谁的模型强,而是比谁能把产线做成 Agent 随手可用的 Skill。

AI 成片产线Agent 导演Claude Code Skills短剧自动化GitHub 研报ComfyUI MCP影视工业化
01 /

单镜头 5 秒惊艳,剪在一起 30 秒崩盘:抽卡时代彻底终结了

AI 导演多智能体协同流水线——剧本分解、分镜节点与自动化剪辑轨道全景拓扑

如果回顾过去两年的 AI 视频演进史,你会发现一个极其鲜明的代际分水岭:2023 年至 2024 年底,全行业的聚光灯都在疯狂追逐单点底层大模型——从 Pika、Runway Gen-2 到 Sora、Kling 1.5、Runway Gen-3 Alpha 以及 MiniMax。大家沉浸在单次生成 5 秒或 10 秒高清画面的震撼中,乐此不疲地在网页输入框里敲入提示词,试图撞大运抽出一张惊艳全网的动态壁纸。

然而,一旦进入 2025 年下半年乃至当下的 2026 年,所有真正试图用 AI 视频跑通商业化闭环的团队,几乎全部遭遇了一堵冷酷的现实高墙:【单镜头 5 秒惊艳,剪在一起 30 秒崩盘】。角色长相在前一秒是冷艳女特工、后一秒变成路人甲;前一镜头是夕阳暖光侧逆光、后一镜头突然变成冷调阴天;摄影机推拉摇移毫无章法,前后镜头的视线、动势完全无法衔接。

“抽卡式创作”的工业化天花板已经清晰可见。真正的影视工业,从来不是单张漂亮画面的罗列,而是一整套涵盖“剧本解构 → 视听语言转译 → 角色与场景资产锁定 → 分镜头状态机调度 → 跨模型协同推理 → 自动剪辑合成与声画缝合”的庞大确定性工程。

正因如此,最近在做基于 Skill 与 Agent 驱动的成片产线时,我把 GitHub 上的同赛道开源项目从头到尾扒了个底朝天。为了剔除那些早已经停更的死项目或只写了个 Readme 的概念玩具,我设定了极其严苛的筛选口径:【必须是“让 Agent 当导演的成片流水线(剧本→分镜→调模型→合成)”,且最近一个月内依然有真实的活跃 Commit】。最终,全网精准命中了 55 个正在激烈厮杀的活跃开源仓库。

把这 55 个项目摆在同一张解剖台上横向透视,一个颠覆很多行业直觉的结论赫然浮现:很多创业公司还在投入大量人财物死磕前台的“无限画布”或“仿剪映网页编辑器”,但开源社区最敏锐的一线极客与架构师们,早就不在这些表面形态上浪费时间了。真正的决胜局,全面转向了【编排层(Orchestration)】与【Agent Skill 化】。

赛道正在极速收敛

大厂已经全面正规军下场(阿里开源 lumenx、小红书开源 FireRed-OpenStoryline),顶尖学界也已深度入局(港大 ViMax)。这不再是个人极客的玩具,而是工业级内容生产线范式转移的前哨战。

KEY POINTS / 核心要点

  • 筛选口径:完整贯穿“剧本→分镜→调模型→合成”全流程,且近 30 天内持续提交 Commit。
  • 样本总量:全网精准命中 55 个活跃仓库,呈现出极度清晰的三大技术流派分化。
  • 核心趋势:28 个项目选择“装进 Coding Agent 的 Skill”,27 个项目聚焦“一站式短剧平台”,仅有 3 个项目坚持做“独立导演画布”。
02 /

最聪明的极客,早就不浪费时间写网页前端了

终端里的 AI 导演——Coding Agent 自动化执行镜头拆解、摄影机追踪与 ComfyUI 流程

在 55 个活跃仓库中,数量占比最高、同时也是近期增长最迅猛的一个类别(28/55,占比达 51%),是直接做成装给 Claude Code、Codex 或 Cursor 的视频生产 Skill。

这一派的打法极其反传统:他们根本不去写 React 前端界面,不搞任何登录注册、不买云端服务器、不做多租户权限系统,而是直接把整套视频生产能力打包成标准化的 Skill 规范,装进开发者与创作者每天都在用的 Coding Agent 终端里。

为什么这种看似极客的做法会成为绝对主流?立足第一性原理剖析,答案极其震撼:【因为通用 Coding Agent(如 Claude Code / Codex)本身,就是现阶段世界上最优秀的“总导演 Agent”】。它们具备天然的多轮长上下文推理能力、具备强悍的代码与配置生成能力、具备操作系统级的文件读写与 CLI 终端调度权限,更具备在遇到 Bug 时自动看报错日志、自我修复的推理自愈能力。

Skill 化的降维优势

独立 App 必须处理登录鉴权、复杂 UI 交互、账单体系与云端渲染队列;而装进 Coding Agent 的 Skill 仅需定义清楚 I/O 规范,借助 Agent 自身的推理自愈能力,几秒钟内就能跑通一次完整剪辑。

KEY POINTS / 核心要点

  • 解耦设计:把视听知识库封装成规则文件(Markdown/YAML),模型即插即用。
  • 生态共生:直接复用 Coding Agent 强大的工具生态(Git、Bash、Python、FFMPEG、Curl)。
  • 零前端包袱:创作者在命令行中打一行命令,自动在后台产出成片与剪辑工程。
03 /

把 Claude Code 变成电影总导演:一个命令行拉起工业级分镜

KK 3D 终端剧场:手持发光 Skill 模块插入 Claude Code 终端控制器

在这一阵营中,领跑的标杆项目展现了极高的工业水准:

1. **video-shotcraft(6.2k⭐)**:专注电影感产品宣传片。它把影视视听语言提炼成了 152 张标准镜头卡和 209 个动效样片。当你在 Claude Code 里输入一段产品文案,它会自动匹配景别与运镜轨迹,直接在 X 上拿下了 17.7 万的高额浏览。

2. **Generative-Media-Skills(4.1k⭐)**:多模态全能力封装库,将图像生图(Midjourney/FLUX)、视频推理(Kling/Runway)与音频生成(ElevenLabs/Suno)统一定义为标准 Skill 接口,供 Agent 自由组合调用。

3. **chengfeng-videocut-skills(2.9k⭐)**:专攻剪辑领域的 Agent。它让 Agent 学会了根据时间戳与分镜意图,直接编写 FFMPEG 命令完成无损粗剪、画幅裁切与转场拼接。

4. **shuohao-skills(2.0k⭐)& drama-skills(1.0k⭐)**:短剧垂直 Skill 集。将一部短剧拆分为角色设定 Agent、大纲拆解 Agent、场景道具 Agent、剧本台词 Agent 与分镜生成 Agent,甚至加入了独立的“剧本审查与合规校验环节”。

5. **h3lite(309⭐)与 super-video-maker-skill(233⭐)**:这两个虽然星数不算庞大,但技术栈选型极其硬核,代表了未来的终极收敛方向:h3lite 实现了本地 MiniMax-H3 的硬件感知调度,能根据本地 GPU 显存自动优化推理流水线;而 super-video-maker-skill 则把 HeyGen 数字人生成、Seedance B-roll 素材插入、Remotion 代码级动画与 HyperFrames 视频渲染串联成了一条自动化闭环。

【可直接复制】CLAUDE CODE 视频总导演 AGENT 系统提示词 (SYSTEM PROMPT)
你是一位好莱坞工业级电影导演兼 AIGC 分镜架构师。
你的职责是将用户输入的粗糙剧本、网文小说或产品文案,严格解构为专业电影摄影视听语言分镜,并输出可直接交付给 Kling 1.5 / Runway Gen-3 的镜头提示词。

【执行工作流】:
1. 剧情节拍解构 (Beats):将输入文本切分为 3-5 秒戏剧动作,提取人物生理特征、情绪动机、道具与环境光源。
2. 镜头语言转译 (Cinematography Translation):
   - 严禁使用“唯美、悲伤、震撼”等主观形容词!
   - 必须使用【焦段 + 景别 + 运镜动向 + 主体动作 + 光比】标准五段式公式。
   - 景别标定:ECU (极特写), MCU (中近景), WS (全景), OTS (过肩反打)。
   - 运镜标定:Slow Dolly In, Lateral Tracking, Pedestal Up, Static Locked-off。
   - 光学质感:35mm anamorphic lens, shallow DOF, Rembrandt lighting, 2.39:1 aspect ratio。
3. 双关键帧锚定 (First-to-Last Frame):
   - 为每一个连续镜头输出起止状态描述:
     - Starting Frame: 角色构图基准与动作起点
     - Ending Frame: 5 秒后的空间落幅与光影位移
4. 音频 Foley 规划:
   - 为每个镜头标注环境底噪 (Ambient)、物理动作拟音 (Foley SFX)、情绪配乐 (BGM)。

【输出格式要求】:
严格按 Markdown 表格与结构化文本输出,确保每一段提示词创作者可直接单键复制!
04 /

短剧是商业化绞肉机,也是目前唯一的现金流活路

KK 3D 短剧工场:手持放大镜对流水线上的角色立牌一致性逐一核验,直出剪映草稿盒

如果说 Coding Agent Skill 是技术极客与独立开发者的最爱,那么另外占据半壁江山的 27 个一站式成片平台,则是纯粹的“商业化绞肉机”。在这 27 个项目中,短剧、漫剧的密度高得令人咋舌。

为什么几乎所有做商业化成片平台的团队,第一站都扎堆做短剧?答案只有两个字:【闭环】。电影长片有极高的剧情连贯性要求,容错率几乎为零;而短剧的节奏通常是“3 秒一个钩子、5 秒一个反转、每集 1-2 分钟、全靠台词与情绪爆发推进”。这种场景对偶尔的背景漂移容忍度极高,同时海外短剧与国内短剧出海又拥有极其凶猛的现金流买单意愿。

短剧流水线最核心的命脉,在于【角色跨镜头不崩率】与【剪映草稿导出完整度】。谁能在流水线上把角色 360 度转面表与服装锁定做到极致,谁就能把每集制作成本压缩至百元级。

短剧产线的技术护城河

短剧产线比拼的根本不是网页做得有多好看,而是两个核心指标:【角色跨镜头不崩率】与【剪映草稿导出完整度】。谁能让创作者拿到草稿后改动少于 10%,谁就能在商业化上碾压对手。

05 /

直出剪映草稿:打通 AI 视频商业化最后一公里的秘密武器

一站式 AI 短剧工业化流水线纯 UI 模拟界面:小说解析、角色定妆表、分镜矩阵与剪映多轨时间轴

深入剖析这 27 个平台,星数量级呈现出断层式的繁荣:

1. **MoneyPrinterTurbo(115.6k⭐)**:这不仅是一个项目,更是整个赛道的鼻祖。虽然早期它更多依靠文案生成配合关键词在免费素材库(Pexels/Pixabay)中抓取剪辑,但它验证了“一句话脚本自动吐出短视频成品”的巨大市场需求。

2. **OpenMontage(49.9k⭐)**:开源界当之无愧的“航空母舰”。整个系统构建了 12 条不同题材的视频流水线、集成了 100 多个原子工具,内置了 700 多个细分 Agent 动作,代表了平台型架构的复杂度巅峰。

3. **ViMax(12.1k⭐)**:香港大学出品的学术界里程碑项目。它提出了真正的“Multi-Agent 剧组协同架构”——不再是由一个 LLM 从头写到尾,而是分别实例化了编剧 Agent、导演 Agent、制片人 Agent。编剧负责剧情张力,导演负责挑刺视听语言,制片人负责平衡算力预算与镜头时长,三者通过对抗推演生成最终分镜。

4. **ArcReel(4.1k⭐)**:非常贴近中国创作者工作流的实战典范。它能够直接导入几十万字的长篇网文小说,自动切章提取角色/场景/道具/分镜,调度生图与视频模型,并直接打包导出【剪映(JianYing)草稿工程文件】。创作者只需在剪映里点开草稿做最后的微调即可直接发布,甚至内置了多供应商 API 调用的毫秒级计费追踪。

5. **大厂正规军入局**:阿里巴巴开源的 **lumenx(1.1k⭐)** 主攻小说到短漫剧全链路;而小红书开源的 **FireRed-OpenStoryline(3.3k⭐)** 则探索了“意图驱动的剪辑 Agent”,大厂的下场意味着这一赛道的基础设施正在迅速成熟。

【可直接复制】短剧角色锁定与起止帧插值 PROMPT 公式
【1. 角色 360 度定妆表 (Midjourney / FLUX Prompt)】:
A 3D stylized realistic character turnaround sheet of [Lin Chen, 28-year-old detective], spiky messy dark hair, sharp jawline, intense focused eyes, wearing a weathered black wool trench coat with antique brass buttons, dark charcoal turtleneck sweater, neutral white studio background, 4-view model sheet: front view, 3/4 profile, side view, back view, 8k resolution, cinematic lighting, photorealistic texture --ar 16:9 --v 6.1

【2. 起始帧第一秒构图 (Starting Keyframe Prompt)】:
Cinematic wide shot, 24mm lens. Lin Chen stands motionless under the dripping neon awning of a ramen shop in a rain-slicked Tokyo alley at midnight. Neon cyan and magenta lights reflecting on wet asphalt puddles. Rain drops slicing through the cold air. Lin Chen holds an unlit cigarette in mouth, hand reaching into trench coat pocket. Atmospheric rim light, 35mm film grain --ar 16:9

【3. 结束帧第五秒落幅 (Ending Keyframe Prompt)】:
Cinematic tight medium close-up, 85mm anamorphic lens, shallow DOF. Lin Chen strikes a heavy brass zippo lighter, warm amber flame suddenly flares up illuminating his weathered facial features and cigarette tip, rising blue wisps of smoke, intense eyes shifting sharply toward camera left. Background rain softened into gorgeous oval bokeh --ar 16:9

【4. Kling / Runway 运动插值控制 (Motion Interpolation Prompt)】:
Smooth cinematic camera push in from wide to medium close-up, character fluidly flicks open lighter and ignites flame, golden light illuminates face, realistic rain physics, steady head turn, no morphing, no distortion --motion 5

KEY POINTS / 核心要点

  • 商业逻辑闭环:短剧制作周期从传统实拍的 7 天缩短至 AI 产线的 3 小时。
  • 成本断崖下降:单集制作成本从上万元降至百元级的 GPU 算力费用。
  • 剪映草稿集成:直接交付剪映工程(包含画轨、音轨、字幕轨),彻底打破 AI 工具与专业 NLE 剪辑软件之间的壁垒。
06 /

为什么全网 55 个开源团队,只有 3 个人敢碰“无限导演画布”?

KK 3D 小剧场:手持光缆将摄影机空间轨迹与 ComfyUI-MCP 节点相连

在这 55 个活跃仓库中,数量最稀少的一类,是纯粹的“分镜 / 导演无限画布”(仅命中 3 个):open-ai-canvas(653⭐)、open-storyboard-canvas(299⭐)以及 aimangastudio(1.4k⭐)。

为什么做画布的人这么少?因为在影视创作领域,无限画布的技术复杂度高得异乎寻常:它既要有 2D 平面的空间节点拖拽(剧本节点连线到角色资产,再连线到分镜卡片),又要在时间轴维度上精确到帧(第几秒转场、机位在三维空间中如何运动)。这相当于要同时把 Figma、Blender 摄像机调度器与 Premiere 剪辑轨道无缝缝合在一个网页里。

然而,真正让这 55 个产线项目得以蓬勃生长的,是潜藏在它们底层的一批极其关键的【基础设施底座】:

1. **comfyui-mcp(663⭐)**:这是今年最关键的技术跃迁。传统的 ComfyUI 是给人手动连连看的;而 comfyui-mcp 通过标准 Model Context Protocol(MCP),把原本复杂的 ComfyUI 流程暴露为 Agent 能够直接调用的标准化 Tool。Agent 可以直接向本地 ComfyUI 传参、监听渲染队列、自动获取生成结果,真正成为了连接 LLM 与底层扩散模型的黄金桥梁。

2. **hyperframes(42.4k⭐)**:由知名商业独角兽 HeyGen 官方开源的高性能多轨音视频合成引擎。它解决了过去纯靠 FFMPEG 拼接视频时经常出现的音画不同步、跨平台编解码性能差以及转场动效生硬的难题,是目前生产级自动化成片的底层基石。

3. **vargHQ/sdk(334⭐)**:提出了一种极具前瞻性的“JSX 写视频”范式。开发者可以用类似编写 React UI 组件的方式,声明式地定义视频的时间轴、图层叠加与文本动画。

4. **watch-skill(310⭐)**:让 Agent 拥有“审片眼睛”的多模态自检组件。Agent 生成完视频片段后,会通过 Vision 多模态模型自动抽取关键帧进行质检,一旦发现人物肢体畸变、画面突变或黑屏,直接在后台触发重抽,实现了真正无人值守的闭环。

底层基础设施的“黄金三角”已经成型

【ComfyUI】负责底层算力与模型推理,【MCP 协议】负责多智能体调度与状态传递,【HyperFrames / Remotion】负责代码级确定性合成。这三者的合龙,标志着 AI 视频从手工作坊真正走向了现代化工业流水线。

【可直接复制】好莱坞机位运动与光学质感 PROMPT 核心词典
【电影感基础光学插槽公式】:
[机位运镜轨迹] + [画框景别标定] + [主体物理动作] + [光学焦段与光圈] + [环境光位与大气感]

1. 缓慢推进 (Slow Dolly In · 心理聚焦与悬疑沉浸):
"Slow steady dolly in on subject along optical axis, 85mm anamorphic lens, shallow depth of field, f/1.8, cinematic Rembrandt lighting, subject remains centered in frame, intense eye reflection."

2. 平行横移跟踪 (Lateral Tracking Shot · 行动节奏与动态视差):
"Smooth lateral tracking shot following the character running through narrow rainy alleyway from left to right, camera tracks at identical speed on dolly rails, 35mm lens, dynamic background neon motion blur, subject razor sharp."

3. 垂直升降揭示 (Pedestal Up / Crane Down · 宏大空间与尺度对比):
"Cinematic crane shot smoothly descending from high rooftop down to wet street level, 24mm ultra-wide angle, revealing massive cyberpunk architecture overhead and lone figure below, volumetric fog."

4. 焦点转移 (Rack Focus / Pull Focus · 视线引导与信息传递):
"Cinematic rack focus: begin with ultra-shallow focus on brass zippo lighter flame in foreground, smoothly shift focus across 2.5 seconds to shadowy silhouette stepping out of darkness in background, anamorphic oval bokeh."

5. 极特写局部 (Extreme Close-Up · 情绪微动与细节冲击):
"Extreme close-up macro shot on subject dark brown eyes, 100mm macro lens, macro reflection of neon sign in iris, subtle eye twitch, condensation on eyelashes, high-contrast cinematic lighting."

KEY POINTS / 核心要点

  • 无限画布难点:空间拓扑与时间轴双重映射,前端工程复杂度极高。
  • MCP 标准化:Model Context Protocol 彻底统一了 Agent 与生成工具的连接规范。
  • 合成引擎进化:HyperFrames 让代码像排版 HTML 一样高精度排版音视频。
  • 闭环自检机制:引入 Vision 多模态模型做质检,剔除 90% 的人工看片返工。
07 /

别再让模型瞎猜:文学情感如何精确转译为好莱坞机位公式

AI 影视导演无限节点画布纯 UI 模拟界面:剧本输入、多模态推理、3D 机位弧线、ComfyUI 渲染与 4K 输出视口

无限画布让导演彻底摆脱线性叙事的束缚。通过将剧本拆解为独立的情节节点,连线驱动多模态 Reasoning Agent,并在三维视口中实时调整摄影机抛物线运镜轨迹与焦段,导演可以直接监看 4K 实时渲染画面。

这一工作台代表了影视工业未来 5 年的终极形态:它不再要求人类掌握复杂的 3D 软件,而是通过 Agent 自动将运镜意图编译为确定性的机位路径。

【可直接复制】好莱坞机位运动与光学质感 PROMPT 核心词典
【电影感基础光学插槽公式】:
[机位运镜轨迹] + [画框景别标定] + [主体物理动作] + [光学焦段与光圈] + [环境光位与大气感]

1. 缓慢推进 (Slow Dolly In · 心理聚焦与悬疑沉浸):
"Slow steady dolly in on subject along optical axis, 85mm anamorphic lens, shallow depth of field, f/1.8, cinematic Rembrandt lighting, subject remains centered in frame, intense eye reflection."

2. 平行横移跟踪 (Lateral Tracking Shot · 行动节奏与动态视差):
"Smooth lateral tracking shot following the character running through narrow rainy alleyway from left to right, camera tracks at identical speed on dolly rails, 35mm lens, dynamic background neon motion blur, subject razor sharp."

3. 垂直升降揭示 (Pedestal Up / Crane Down · 宏大空间与尺度对比):
"Cinematic crane shot smoothly descending from high rooftop down to wet street level, 24mm ultra-wide angle, revealing massive cyberpunk architecture overhead and lone figure below, volumetric fog."

4. 焦点转移 (Rack Focus / Pull Focus · 视线引导与信息传递):
"Cinematic rack focus: begin with ultra-shallow focus on brass zippo lighter flame in foreground, smoothly shift focus across 2.5 seconds to shadowy silhouette stepping out of darkness in background, anamorphic oval bokeh."

5. 极特写局部 (Extreme Close-Up · 情绪微动与细节冲击):
"Extreme close-up macro shot on subject dark brown eyes, 100mm macro lens, macro reflection of neon sign in iris, subtle eye twitch, condensation on eyelashes, high-contrast cinematic lighting."

KEY POINTS / 核心要点

  • 无限画布难点:空间拓扑与时间轴双重映射,前端工程复杂度极高。
  • MCP 标准化:Model Context Protocol 彻底统一了 Agent 与生成工具的连接规范。
  • 合成引擎进化:HyperFrames 让代码像排版 HTML 一样高精度排版音视频。
  • 闭环自检机制:引入 Vision 多模态模型做质检,剔除 90% 的人工看片返工。
08 /

交付前的防穿帮自检:用 Vision 多模态抓出画面的“六指幽灵”

影视级视听语言转译与 3D 摄像机运镜空间轨迹工作台

在源码与提交记录中,我们能够清晰地看到无数开发者在真实业务场景下撞得头破血流的痕迹。要把一个玩具级的 Demo 升级为可商业交付的成片产线,必须正面啃下以下四大核心工程难点:

【难点一:角色与资产的一致性锁定(Consistency)】

这是目前所有 AI 影视创作者的头号梦魇。市面上常见的解法有四种:

1. **LoRA 快速微调**:效果最好,但缺点是极重。为每个角色单独训练 LoRA,在批量化、敏捷化的短剧生产中根本无法规模化运作。

2. **IP-Adapter / FaceID**:零训练,但面部表情僵硬,且容易出现与画面风格割裂的“换脸面具感”。

3. **Midjourney --cref**:在 2D 静态层面极其好用,但无法直接跨模态传递给视频生成模型。

4. **起止帧插值(First-to-Last Frame Interpolation)**:目前被公认最优秀的工业级工程解法!先在 2D 静态模型(FLUX/MJ)中用固定 Seed 生成同一角色的起始构图与终止构图,然后把两张图同时喂给 Kling 1.5 或 Runway Gen-3,让视频模型只充当“两点之间的物理动力学插值器”。这种方法把角色的形态一致性直接拉到了 90% 以上。

【难点二:自然语言到视听摄影语法的精确转译(Cinematography Mapping)】

编剧写出的一句剧本往往是:“李飞心中一阵剧痛,难以置信地退后了两步”。如果直接把这句话塞进模型,模型只会随机瞎猜。成熟产线的解法是:通过微调的镜头拆解 Agent,将其结构化翻译为:“MCU on 85mm anamorphic lens, eye-level, rapid tracking shot moving backward, shallow DOF, character gasping, cool rim light, rain droplets falling”。把文学情感翻译为摄影机物理指令,是消除画面不确定性的唯一路径。

【难点三:影视级剪辑语法与视听连贯(Editorial Continuity)】

业余视频是拼贴,专业电影是蒙太奇。AI 成片产线必须内置经典电影剪辑法则:比如【180 度轴线规则(180-Degree Rule)】——同一个对话场景中,摄影机绝对不能随意翻转跨过两人的轴线,否则观众会瞬间失去空间方向感;又如【视线匹配(Eyeline Match)】——如果前一个镜头主角眼神望向画面右上角,后一个反打镜头必须精准对准右上角被注视的物体。在成熟产线中,这通过状态机在分镜阶段预先校验。

【难点四:交付前多模态自检查穿帮(QA & Self-Healing)】

必须像印刷厂出厂质检一样,制定明确的【交付前检查清单】。成片生成完成后,调度 Vision 多模态模型对抽取出来的关键帧逐条核验:检查五官是否漂移、手部是否多指、背景是否出现果冻变形、镜头切点是否有跳帧,不合格镜头自动打回重新推理。

第一性原理:确定性来自约束

AI 生成本身是不确定的,但电影工业追求的是极致的确定性。工业级产线的本质,就是用资产圣经、机位语法、轴线状态机与多轨音频规范,给不可控的大模型层层套上高精度的“物理夹具”。

【可直接复制】多模态视觉审片与自动找穿帮 PROMPT (GPT-4O / CLAUDE)
你是一位好莱坞资深影视剪辑指导兼 AIGC 视觉质检专家 (QA Supervisor)。
请仔细审查输入的多段 AI 生成视频抽取的关键帧图像序列(按 0s, 1s, 2s, 3s, 4s, 5s 顺序输入),按照严格的工业标准执行自动排查:

【质检排查维度】:
1. 角色一致性与面部漂移:
   - 检查人物五官在 5 秒时间内是否发生形变、多余毛发或瞳孔溶蚀?
2. 肢体物理学与多肢畸变:
   - 手部指头数量是否恒定为 5 根?动作时是否出现手指融合、反关节弯曲或身体穿模?
3. 背景几何稳定性:
   - 建筑物、街道招牌、门窗等硬表面是否出现果冻般扭曲流动或凭空消失?
4. 摄影机轴线与跳帧:
   - 是否存在帧率暴跌引起的剧烈卡顿或前后画幅不连贯的跳帧现象?

【输出格式要求 (JSON)】:
{
  "qa_status": "PASS" | "FAIL_RETRY",
  "overall_score": 88,
  "defects_found": [
    {
      "timestamp": "3.2s",
      "issue_category": "Hand Anatomy",
      "severity": "HIGH",
      "description": "Right hand temporarily morphed into 6 fingers during cigarette pickup"
    }
  ],
  "prompt_correction_guidance": "在负向提示词增加 'malformed hands, extra fingers, mutated digits',并将 Motion 强度下调至 4"
}

KEY POINTS / 核心要点

  • 起止帧插值是当下最平衡的解决方案:成本低、无需微调、一致性高达 90%。
  • 视听语言转译:消除自然语言歧义,把情感转译为光学与机械机位参数。
  • 轴线与视线校验:通过算法状态机在分镜阶段拦截违背电影工业规律的低级穿帮。
  • 声音是最好的遮羞布:精准的拟音(Foley)能让观众大脑自动脑补并包容画面细节的微小瑕疵。
09 /

倒在黎明前的先烈们:为什么那些万星明星项目纷纷停更?

在普查这 55 个开源项目的生命周期时,我还顺手扒了一批非常耐人寻味的“前浪项目”——它们在几个月前曾红极一时,但在近 30 天内却悄无声息地停更了:

比如 **browser-use/video-use**(拿到惊人的 21.3k⭐,在 X 上拥有超过 11.5 万浏览,但在 7 月初戛然而止);又如 **NarratoAI**(拿到 10.8k⭐,最后一次提交停在 7 月 23 日,仅仅差一天就能迈进我们的活跃月度窗口);还有曾经大名鼎鼎的 **story-flicks/ShortGPT** 以及 **Pluviobyte/video-production-skills**(621⭐)。

解剖这些明星项目的停更原因,其教训价值甚至远大于成功的项目:

1. **死因一:重度强耦合特定商业前台 UI,维护成本指数级爆炸**。许多项目试图自己写一套完整的在线视频剪辑器,当底层模型 API 每次发生 Breaking Change 时,前端交互层与状态管理全面崩溃,小团队被拖死在无休止的 UI 修补泥潭中。

2. **死因二:强绑定某一家专属闭源模型**。部分项目过度依赖某一特定模型的特有参数,当模型升级、接口下线或价格调整时,整个产线瞬间瘫痪。

3. **死因三:纯靠技术热情发电,缺乏真实商业造血闭环**。一个视频生成产线跑一次测试可能就要消耗几十美元的 API Token 或 GPU 算力。如果没有真实的创作者或商业客户持续付费,开源作者很快会被算力账单劝退。

然而,这些项目的沉寂,绝对不代表真实市场需求的消失——恰恰相反!X 上的实际流量数据证明,整个内容工业对“确定性自动化成片”的渴求正在呈指数级爆发:AYi 发布的“6 个插件替代剪映 SVIP”斩获 20.7 万浏览,video-shotcraft 拿下 17.7 万浏览,HyperFrames 开源推文获得 15.8 万浏览,video-use 也有 11.5 万浏览。

旧的项目停更了,而需求在暴涨——【这正是属于下一代架构师与独立开发者的巨大战略窗口】!

独立开发者与创业团队的生存法则

永远不要再做通用型 Web 剪辑器!将成片能力做成适配 Coding Agent(如 Claude Code)的垂类 Skill,或者能够直接打出剪映/Premiere 工程草稿的连接器,才是目前团队投入产出比最高、护城河最深的破局路线。

KEY POINTS / 核心要点

  • 避免重资产模式:不要自建算力云与重度 Web 前台,让用户使用自己的本地算力或 API Key。
  • 拥抱开放协议:底层基于 MCP(Model Context Protocol)与 ComfyUI,保证随时能平替最新涌现的模型。
  • 死磕高价值垂直场景:紧跟短剧出海、跨境电商商品图动态化、知识播客自动可视化等拥有强劲现金流的刚需场景。
10 /

附录:全网 55 个活跃成片产线全景速查清单

为了方便所有正在探索 AI 视频与 Agent 产线的同行能够顺藤摸瓜、按图索骥,我将本次深度调研排查出的完整 55 个开源项目整理成清单,分为三大阵营与基础设施底座:

KEY POINTS / 核心要点

  • 【阵营一:装给 Claude Code / Codex 的视频 Skill(28 个)】
  • • video-shotcraft (6.2k⭐) | 08-22 | 电影感产品片,152 镜头卡 + 209 动效样片
  • • Generative-Media-Skills (4.1k⭐) | 08-20 | 图/视频/音频全模态生成 Skill 合集
  • • chengfeng-videocut-skills (2.9k⭐) | 08-21 | Claude Code 剪辑 Agent
  • • srt-whiteboard-animation (2.2k⭐) | 07-27 | SRT 字幕文件自动生成手绘白板动画
  • • claude-code-video-toolkit (2.0k⭐) | 08-13 | Claude Code 视频生产工具箱
  • • shuohao-skills (2.0k⭐) | 08-22 | 短剧 Skill 集:拆角色/大纲/场景道具/剧本/分镜
  • • video-podcast-maker (1.6k⭐) | 08-01 | 题目输入直接生成 4K 深度解说片
  • • drama-skills (1.0k⭐) | 08-23 | 短剧/漫剧全链路生产,包含独立合规审查环节
  • • lanshu-create-ai-presenter-video (723⭐) | 08-20 | 人像 + 讲稿一键生成口播片
  • • make-prompt-seedance2 (634⭐) | 08-16 | Seedance2 结构化提示词生成器
  • • buttercut (589⭐) | 08-15 | 用 Claude Code 命令行自然语言剪辑视频
  • • Orkas-VideoStudio (523⭐) | 08-12 | Agent 编写时间轴代码并渲染出片
  • • chatgpt-video-editing-skills (496⭐) | 07-26 | 八步自动化剪辑 Skill
  • • video-recap-skills (470⭐) | 08-24 | 任意长视频转中文影视解说,支持导出剪映草稿
  • • Nomi (433⭐) | 08-24 | AI 视频工作台,本地 ComfyUI + MCP 深度桥接
  • • higgsfield-ai-prompt-skill (391⭐) | 08-23 | 32 个子技能构成的电影提示词体系
  • • ai-shortfilm-prompts (372⭐) | 08-18 | 创意想法一键转 Sora/Kling/Veo 专业提示词
  • • h3lite (309⭐) | 08-23 | 本地 MiniMax-H3 出片(具备硬件感知 + ComfyUI 编排)
  • • super-video-maker-skill (233⭐) | 08-09 | HeyGen 数字人 + Seedance B-roll + Remotion + HyperFrames
  • • erduo-broll-loop-engineering (124⭐) | 08-18 | SRT 字幕驱动 B-roll 自动路由与无缝混剪
  • 【阵营二:一站式成片平台(27 个)】
  • • MoneyPrinterTurbo (115.6k⭐) | 08-24 | 关键词→短视频鼻祖项目
  • • OpenMontage (49.9k⭐) | 08-22 | 12 条产线、100+ 专属工具、700+ Agent Skill
  • • Toonflow (14.4k⭐) | 08-23 | 小说文本直接生成动画短剧,三层 Agent 架构
  • • huobao-drama (14.1k⭐) | 08-18 | 火宝短剧,一句话脚本生成成片
  • • ViMax (12.1k⭐) | 07-29 | 港大出品:编剧 + 导演 + 制片三位一体对抗架构
  • • seedance-2.0 (6.9k⭐) | 08-06 | 四模态电影级制作产线
  • • Jellyfish (6.2k⭐) | 07-30 | 剧本→结构化分镜→跨镜头一致性→成片
  • • short-video-factory (5.2k⭐) | 08-20 | 营销短视频批量生产桌面端
  • • ArcReel (4.1k⭐) | 08-24 | 小说→角色/场景/道具/分镜/视频/剪映草稿,支持多模型计费追踪
  • • FireRed-OpenStoryline (3.3k⭐) | 07-31 | 小红书官方开源:意图驱动的剪辑 Agent
  • • lumenx (1.1k⭐) | 08-11 | 阿里巴巴官方开源:长篇小说到短漫剧全链路
  • 【阵营三:分镜/导演画布(3 个)与关键配套底座】
  • • open-ai-canvas (653⭐) | 08-24 | AI 影视无限画布,打通分镜与 Agent 工作流
  • • open-storyboard-canvas (299⭐) | 08-15 | 导演台画布,聚焦摄影机空间轨迹控制
  • • aimangastudio (1.4k⭐) | 08-23 | 漫剧与动画分镜专业画布
  • • comfyui-mcp (663⭐) | Agent 原生操纵 ComfyUI 的标准 MCP 控制面
  • • hyperframes (42.4k⭐) | HeyGen 官方开源的高性能视频渲染合成引擎
  • • vargHQ/sdk (334⭐) | 用声明式 JSX 语法编写视频多轨道时间轴
  • • watch-skill (310⭐) | Agent 多模态视觉审片与自动质检纠错闭环

Takeaways

总结:这一轮 AI 视频的底层认知

  1. 战场转移已成定局:不要浪费生命再造一套 Web 视频剪辑器,核心竞争力在于多智能体编排与镜头状态机。
  2. Skill 正在吞噬 App:把成片能力包装为 Coding Agent(如 Claude Code)随手可用的 Skill 是当下的最优工程解法。
  3. 确定性高于一切:通过 2D 资产圣经、起止帧插值、轴线校验与分层 Foley 拟音,才能跨越“玩具”到“工业级交付”的鸿沟。
  4. 窗口期真实存在:先烈停更留下的巨大需求真空,正是专注垂直场景(短剧、跨境带货)的最佳破局时机。

Next note / 下一篇笔记

AI 漫剧 / 漫画平台的内容生成链路