Multi-model AI Creative Production System
AI Video Director Agent
把 Brand Brief 到成片之间的创意决策,组织成可审阅、可继续执行的 AI 工作流。
AI Video Director Agent 通过产品分析、三条创意路线、人工选择、专业模型协作与受控执行,把创意探索连接到关键视觉和最终视频资产。
它不是 Prompt 生成器,也不是自主创意团队,而是一套由 AI 扩展探索、系统组织执行、人负责创意判断的多模型内容生产系统。
- 4
- 完整 V3 跨品类案例1 个主案例与 3 个验证案例
- 3
- 每次策略阶段的创意路线人工选择后才继续生产
- 5
- Planner 最大步骤固定上限,不允许无限循环
一个工作区连接产品理解、人工选线、执行状态与最终资产。
01 · 问题与机会
不是缺少生成工具,而是缺少一条连续的创意决策链。
品牌短视频从 Brief 到成片,需要产品理解、创意讨论、脚本、分镜与生产协作。团队的问题不是缺少生成工具,而是创意决策分散在多次交接里,产品事实、选择理由与最终资产难以保持一致。
核心用户
品牌与内容运营
AIGC 内容团队
短视频策划与创意负责人
需要快速比较创意方向的执行团队
我在 V1 的结构化方案中发现,直接输出更多 Prompt 仍然没有解决选择问题。真正需要被产品化的是 Brief 与成片之间的创意判断:先理解产品、提出可比较方向、让人选择,再把被选中的决策连续传递到生产。
把多次交接,改造成保留选择理由的决策链。
Brand Brief 先被人工解释,再分别进入创意讨论、脚本、分镜、图像和视频工具。每次交接都需要重建上下文,团队通常只能深入少量方向。
多次交接,创意上下文不断丢失
- Brand Brief
- 产品理解
- 创意讨论
- 脚本
- 分镜
- 图像与视频生产
让策略、选择与资产保持同一条决策链
- 结构化 Brief
- Product Analysis
- 3 条 Creative Routes
- 人工选择
- Production Plan
- 关键视觉与最终视频
质量问题出现在上下文、选择和执行的断点。
- 01
创意探索受限于个人经验与时间
团队通常只能深入少量方向;更多创意并不等于更多随机 Prompt,而需要可比较的策略假设、Hook 和视觉语言。
- 02
产品理解与内容生产脱节
卖点、受众与限制常在交接中被压缩,后续镜头虽然完整,却未必服务最重要的品牌目标。
- 03
从 Brief 到资产存在多次上下文重建
创意、分镜、图像和视频分别在不同工具中推进,选中方向与最终资产之间缺少可追踪关系。
- 04
生成结果不能替代创意判断
多个方向可能都成立,但品牌风险、审美、场景与利益相关者偏好仍需要人做最终选择。
02 · 关键决策
先确定人机责任,再决定 Agent 自动执行到哪里。
因此我没有追求“全自动广告生成”,而是建立一条有明确责任、人工检查点和执行上限的工作流。AI 负责扩展和发展创意,系统负责保持状态与调用边界,人负责品牌适配和最终批准。
为什么先结构化 Brand Brief,而不是让用户自由输入 Prompt?
- 背景
- 松散输入会让产品事实、平台目标与品牌限制在后续阶段不断漂移。
- 决策
- 先定义品牌、产品、受众、卖点、平台、语气与限制,再进入产品分析。
- 取舍
- 输入准备更明确,降低了随手尝试的即时感。
- 结果
- 不同模型围绕同一组业务事实工作,后续结果更容易复核。
为什么固定生成三条路线并暂停?
- 背景
- 创意路线可能同时有效,但服务不同品牌目标;AI 无法客观判定唯一最优答案。
- 决策
- 生成三条差异化路线,在高成本资产生产前要求人工选择并记录理由。
- 取舍
- 流程不会一键到底,必须保留决策等待状态。
- 结果
- AI 扩展探索空间,人继续控制审美、品牌风险与生产方向。
为什么 Agent 必须有界?
- 背景
- 无限工具循环会让成本、时间、责任与失败位置不可预测。
- 决策
- 仅支持一个明确目标和固定五步 Planner,拒绝超出范围的任务。
- 取舍
- 它不是通用自主 Agent,也不能动态规划任意创意任务。
- 结果
- 执行成本与状态可预期,每个失败都能归因到具体工具。
查看 2 项支撑决策
为什么是专业角色协作,而不是一个模型完成所有步骤?
- 背景
- 产品理解、创意路线、图像与视频生产需要不同能力,单一回答难以定位质量来源。
- 决策
- 让 DeepSeek、Grok、GPT Image 2 与 Grok Video 分别承担分析、创意、视觉与视频角色。
- 取舍
- 多 Provider 增加了状态、成本与失败处理复杂度。
- 结果
- 每一阶段职责可解释,弱点可以被定位并单独重试。
为什么图像与视频是两条生产分支?
- 背景
- 关键视觉用于确认画面语言,视频生成使用独立组装的生产 Prompt;当前实现没有把 GPT Image 输出直接传给 Grok Video。
- 决策
- 在同一选中方向下分别生成关键视觉和最终视频,并明确两者的证据关系。
- 取舍
- 视觉连续性仍需人工复核,不能声称首帧自动驱动成片。
- 结果
- 产品如实展示模型协作,不制造并不存在的串行依赖。
03 · 产品演进
从结构化创意方案,到有界的 AI Video Director Agent。
每个版本都在解决上一阶段暴露出的工作流缺口,而不是为了增加一个更大的版本号。
- V1–V1.7
先把创意结构化,再拆分模型责任
- 真实问题
- 创意拆解重复且输出松散,单一 Provider 失败还会阻断整条流程。
- 产品决策
- 先验证结构化创意方案,再把文本、视觉与视频能力分层。
- 新能力
- Creative Direction、Shot List、Prompt 链路与多 Provider 状态。
- 结果
- 策略结果可以被保留,生成失败不再要求从头重做。
- V2.0–V2.1
统一业务输入,建立专业角色协作
- 真实问题
- 松散 Brief 与单模型回答让产品事实漂移,也难定位质量问题。
- 产品决策
- 结构化品牌、受众、卖点与限制,并让不同模型承担明确角色。
- 新能力
- Structured Brand Brief 与 Multi-model Creative Pipeline。
- 结果
- 不同模型围绕同一组业务事实工作,问题可以定位到具体阶段。
- V2.2–V2.3
把人工创意选择接入真实生产
- 真实问题
- AI 能扩展方向,但不能替代品牌判断;只有方案也无法证明能完成交付。
- 产品决策
- 固定生成三条路线,在关键视觉与视频生产前暂停等待人工选择。
- 新能力
- 路线对比、Human Selection、Storyboard、关键视觉与异步视频生成。
- 结果
- 选中方向可以继续发展成可审阅、可播放的完整资产证据。
- V3.0
升级为有界 AI Video Director Agent
- 真实问题
- 固定工作流已经完整,但工具责任、执行状态与恢复路径仍需统一组织。
- 产品决策
- 用固定五步 Planner 编排既有工具,并保留人工决策检查点。
- 新能力
- 有界规划、工具选择、状态记录、暂停与恢复。
- 结果
- 形成可检查、可归因、可恢复的 Agent MVP,而不是无限自治。
查看 V1 结构化创意方案证据
04 · Agent 工作流
Agent 化不是放开自主循环,而是统一目标、工具、状态和恢复路径。
V3 只支持 create_short_video_campaign,并把执行限制在五个可检查步骤内。明确上限让成本、失败位置和责任边界保持可预测。
- 01User Goal
接收 create_short_video_campaign 这一明确目标。
- 02Director Agent
统一组织策略、选择与生产阶段。
- 03Bounded Planner
用固定五步计划限制成本、循环与责任边界。
- 04Specialist Tools
按阶段调用产品分析、创意、图像与视频工具。
- 05Execution State
记录步骤状态、输入摘要、输出摘要与失败原因。
- 06Human Selection
在昂贵资产生产前暂停,由人选择创意路线。
- 07Resume Execution
携带选择结果继续生成计划、关键视觉与视频。
- 08Final Asset
输出可审阅的关键视觉与可播放成片。
为什么必须有界
固定五步 Planner,不允许无限推理或工具循环。
昂贵的图像与视频生成发生在人工选择之后。
每一步记录工具、理由、状态、输入摘要、输出摘要与错误。
当前状态随 API 响应和客户端 payload 传递,尚未持久化到数据库。
价值来自责任编排,而不是模型数量。
不同模型承担分析、创意、视觉与视频生产责任,并通过结构化输出交接。
- 01
Product Analyst · DeepSeek
先澄清产品定位、受众动机、卖点优先级、痛点、内容角度与限制,为创意提供业务基础。
- 02
Creative Director · Grok
生成三条差异化创意路线,并把人工选中的方向发展为 Plan A / B、分镜、运镜与生产 Prompt。
- 03
Visual Producer · GPT Image 2
围绕选中方向生成一张关键视觉参考,用于确认画面语言;它不是批量品牌资产生成能力。
- 04
Video Producer · Grok Video
根据独立组装的视频 Prompt 异步生成最终成片,并通过状态轮询和同源代理交付。
查看端到端生产管线
让选中的方向继续连接到分镜、关键视觉与成片。
- 01Brand Brief
统一品牌事实、目标、受众、卖点、平台与限制。
- 02Product Analysis
把 Brief 转译为定位、动机、痛点和内容机会。
- 03Creative Routes
生成三条可比较的概念、Hook 与视觉方向。
- 04Human Selection
由人选择最符合品牌目标的方向并记录理由。
- 05Storyboard
将选中方向发展为 Plan A / B、镜头、运镜与 Prompt。
- 06Two Production Branches
图像关键视觉与视频成片分别生成,互不伪装为串行依赖。
两条独立生产分支
GPT Image 2 生成 Key Visual Reference,用于确认画面语言。
Grok Video 接收独立组装的视频 Prompt,异步生成 Final Video Asset。
当前实现没有把 GPT Image 输出直接传给 Grok Video。
05 · 人机协作
AI 生成三条路线,人做创意选择,Agent 再继续生产。
这不是为了给自动化增加一次点击,而是把品牌适配、审美和风险判断放在成本最高的生产阶段之前。
创意路线没有统一的客观最优解。系统扩大探索空间并保持上下文,人负责品牌适配、审美判断和最终批准。
扩展与发展创意可能
- 产品分析
- 三条创意路线
- Plan A / B 与分镜
- 关键视觉与视频候选
组织受控执行
- 固定五步计划
- 结构化状态
- 阶段级错误与恢复
- 模型责任与资产交付
保留创意与品牌判断
- 选择创意路线
- 确认生产方向
- 审核图像与视频
- 批准最终资产
06 · 案例与证据
一个完整主案例,三个跨品类验证案例。
四个案例都经过同一套 V3 工作流。它们证明流程可以适配不同品类,但不代表系统已经具备普适的创意表现或商业化规模。
完整主案例
AI 护肤设备 · 肌肤的晨昏对话把 AI 个性化护肤从功能说明转化为可感知的晨昏护理仪式,完整展示从 Brand Brief、创意选择到 15 秒有声成片的受控生产过程。
- 业务问题
- AI 护肤设备容易被表达成参数、界面和临床功能的堆叠,难以同时建立高端美容科技的可信度、亲和力与日常使用想象。
- 产品决策
- 先用产品分析明确受众动机、护理场景和视觉边界,再生成三条可比较路线。人工选择“肌肤的晨昏对话”,让光线、材质和节奏围绕日常护理仪式继续发展,而不是直接从功能列表跳到视频生成。
- 交付证据
- 肌肤的晨昏对话:用晨间分析、晚间护理、珠光材质与克制镜头,把设备从冷硬功能工具转译为个人护理仪式。 主案例保留完整 Brief、产品分析、三条 Creative Routes、人工选择、分镜与关键视觉,并交付 15.04 秒、480 × 848 的竖屏有声成片。
Grok Imagine Video
AI 护肤设备 · 肌肤的晨昏对话
用日常仪式、珠光质感和克制镜头语言呈现个性化护肤体验。
视觉摘要(非逐字稿)
- 晨间分析与晚间护理形成短时叙事弧线。
- 画面重点验证高端美容品类的光线、材质与节奏控制。
无需播放音频即可理解当前样片的验证重点。
查看 3 个跨品类验证案例
跨品类验证
辅助案例只证明同一条受控工作流可以适配不同创意任务,不抢占主案例的阅读权重。
- 01NOCTURNE 城市光影艺术夜
从活动 Brief 生成三条空间叙事路线,经人工选择后形成关键视觉与 15 秒有声竖屏成片,验证文化体验 Campaign 的节奏与氛围编排。
- 02国际山地旅游
验证非实体产品的目的地叙事、第一人称沉浸感与由微观到宏观的镜头推进。
- 03AI SaaS 会议助手
把无形的软件价值转译为决策、责任人与行动,减少对后台界面堆叠的依赖。
Grok Imagine Video
NOCTURNE · 暗夜觉醒之旅
用钴蓝引导光、反射空间和琥珀色高潮,将一场城市光影艺术夜转译为完整的感官旅程。
视觉摘要(非逐字稿)
- 镜头从纯黑与钴蓝光迹进入琥珀色最终装置,形成清晰的情绪递进。
- 成片包含环境电子声音轨,无文字、Logo、人物特写或可见生成畸变。
无需播放音频即可理解当前样片的验证重点。
查看完整 V3 Agent 界面证据(6 张)
V3 证据来自当前本地实现与四个完整案例。NOCTURNE 的六张界面截图由真实运行自动捕获;关键视觉与 15 秒有声成片来自同一次案例生成。当前未验证生产部署或商业指标。
07 · 价值与边界
减少策略与生产之间的断裂,但不替代人的创意判断。
当前证据证明的是一条跨四个行业可运行的创意决策链,而不是商业化规模或量化提效。它减少了策略与生产之间的断裂,让每个资产都能追溯到 Brief、产品分析与人工选择。
直接从 Brief 跳到单条 Prompt 或单个生成结果
先形成产品分析与三条可比较的创意路线
模型自行沿一个方向继续生产
人工选择后,Agent 才恢复执行并发展分镜与资产
生成失败迫使整个流程重来
记录阶段状态,保留已完成策略并支持阶段级重试
将产品定位、受众、卖点和限制转化为可复用的创意上下文。
用三条结构化路线扩大探索空间,同时保留人工创意选择。
让选中方向持续连接分镜、关键视觉与最终视频,降低生产交接中的语义损失。
用四个跨行业完整案例验证同一工作流的适应性,不把它包装成普适创意表现证明。
技术与可靠性深入阅读
验证、重试、状态记录与阶段级恢复。
- 01
Product Analysis 超时
交互产品允许带 warning 继续;作品集验收要求完整多模型链,因此缺失分析的结果会被拒绝并重试。
- 02
图像 Provider 额度失败
生产计划保留可用;配置恢复后只重跑关键视觉阶段,不推翻前序策略与选择。
- 03
视频任务超时与 404
保留 request ID 与前序资产,只重启视频生成,并通过轮询确认新的任务完成。
- 04
状态持久化仍有限
证据生产过程已实践阶段级恢复,但产品内还没有通用的持久化执行数据库。
技术结构服务于产品边界。
体验层
把结构化输入、路线选择、执行状态与最终资产放在同一工作区,减少上下文切换。
Next.js 15
React 19
TypeScript
Typed Brand Brief
Director Agent
固定五步 Planner 约束目标、成本和责任;它编排工具,但不做无限自主规划。
create_short_video_campaign
strategy / selected_route_plan / generate_video
Max 5 steps
Inspectable execution state
专业工具层
专业角色通过结构化输出交接,让产品分析、创意与生产问题可以分别定位。
DeepSeek Product Analyst
Grok Creative Director
GPT Image 2 Visual Producer
Grok Video Producer
状态与资产交付
异步视频任务需要轮询与 Range 代理;当前状态随响应和客户端 payload 传递,尚未进入持久化数据库。
Async video polling
Authenticated same-origin proxy
Response-level state
Local evidence assets
当前限制
当前是 V3.0 本地工作原型,尚未公开部署或验证商业化使用。
Planner 仅支持一个目标和固定五步路径,不是通用自主 Agent。
产品内没有持久化工作流数据库;状态通过响应和客户端 payload 传递。
创意质量、品牌安全、事实声明和最终资产仍需要人工审核。
图像与视频质量受 Provider 输出影响,关键视觉不会自动作为视频输入。
现有 Git 仅含 V1 初始提交;V1.7 至 V3.0 由工作树、文档与资产证据校准。