Multi-model AI Creative Production System
AI Video Director Agent
把 Brand Brief 到成片之间的创意决策,组织成可审阅、可继续执行的 AI 工作流。
AI Video Director Agent 通过产品分析、三条创意路线、人工选择、专业模型协作与受控执行,把创意探索连接到关键视觉和最终视频资产。
它不是 Prompt 生成器,也不是自主创意团队,而是一套由 AI 扩展探索、系统组织执行、人负责创意判断的多模型内容生产系统。
- 4
- 完整 V3 跨品类案例1 个主案例与 3 个验证案例
- 3
- 每次策略阶段的创意路线人工选择后才继续生产
- 5
- Planner 最大步骤固定上限,不允许无限循环
为什么要做这个产品
问题不是如何生成一段视频,而是如何组织生产前的创意决策。
品牌短视频从 Brief 到成片,需要产品理解、创意讨论、脚本、分镜与生产协作。团队的问题不是缺少生成工具,而是创意决策分散在多次交接里,产品事实、选择理由与最终资产难以保持一致。
核心用户
品牌与内容运营
AIGC 内容团队
短视频策划与创意负责人
需要快速比较创意方向的执行团队
我在 V1 的结构化方案中发现,直接输出更多 Prompt 仍然没有解决选择问题。真正需要被产品化的是 Brief 与成片之间的创意判断:先理解产品、提出可比较方向、让人选择,再把被选中的决策连续传递到生产。
原始工作流
把多次交接,改造成一条保留选择理由的决策链。
Brand Brief 先被人工解释,再分别进入创意讨论、脚本、分镜、图像和视频工具。每次交接都需要重建上下文,团队通常只能深入少量方向。
多次交接,创意上下文不断丢失
- Brand Brief
- 产品理解
- 创意讨论
- 脚本
- 分镜
- 图像与视频生产
让策略、选择与资产保持同一条决策链
- 结构化 Brief
- Product Analysis
- 3 条 Creative Routes
- 人工选择
- Production Plan
- 关键视觉与最终视频
问题发现
创意质量取决于上下文、选择与执行是否连续,而不只取决于模型能力。
- 01
创意探索受限于个人经验与时间
团队通常只能深入少量方向;更多创意并不等于更多随机 Prompt,而需要可比较的策略假设、Hook 和视觉语言。
- 02
产品理解与内容生产脱节
卖点、受众与限制常在交接中被压缩,后续镜头虽然完整,却未必服务最重要的品牌目标。
- 03
从 Brief 到资产存在多次上下文重建
创意、分镜、图像和视频分别在不同工具中推进,选中方向与最终资产之间缺少可追踪关系。
- 04
生成结果不能替代创意判断
多个方向可能都成立,但品牌风险、审美、场景与利益相关者偏好仍需要人做最终选择。
核心产品决策
先定义责任与检查点,再决定 Agent 可以自动执行到哪里。
因此我没有追求“全自动广告生成”,而是建立一条有明确责任、人工检查点和执行上限的工作流。AI 负责扩展和发展创意,系统负责保持状态与调用边界,人负责品牌适配和最终批准。
为什么先结构化 Brand Brief,而不是让用户自由输入 Prompt?
- 背景
- 松散输入会让产品事实、平台目标与品牌限制在后续阶段不断漂移。
- 决策
- 先定义品牌、产品、受众、卖点、平台、语气与限制,再进入产品分析。
- 取舍
- 输入准备更明确,降低了随手尝试的即时感。
- 结果
- 不同模型围绕同一组业务事实工作,后续结果更容易复核。
为什么是专业角色协作,而不是一个模型完成所有步骤?
- 背景
- 产品理解、创意路线、图像与视频生产需要不同能力,单一回答难以定位质量来源。
- 决策
- 让 DeepSeek、Grok、GPT Image 2 与 Grok Video 分别承担分析、创意、视觉与视频角色。
- 取舍
- 多 Provider 增加了状态、成本与失败处理复杂度。
- 结果
- 每一阶段职责可解释,弱点可以被定位并单独重试。
为什么固定生成三条路线并暂停?
- 背景
- 创意路线可能同时有效,但服务不同品牌目标;AI 无法客观判定唯一最优答案。
- 决策
- 生成三条差异化路线,在高成本资产生产前要求人工选择并记录理由。
- 取舍
- 流程不会一键到底,必须保留决策等待状态。
- 结果
- AI 扩展探索空间,人继续控制审美、品牌风险与生产方向。
为什么 Agent 必须有界?
- 背景
- 无限工具循环会让成本、时间、责任与失败位置不可预测。
- 决策
- 仅支持一个明确目标和固定五步 Planner,拒绝超出范围的任务。
- 取舍
- 它不是通用自主 Agent,也不能动态规划任意创意任务。
- 结果
- 执行成本与状态可预期,每个失败都能归因到具体工具。
为什么图像与视频是两条生产分支?
- 背景
- 关键视觉用于确认画面语言,视频生成使用独立组装的生产 Prompt;当前实现没有把 GPT Image 输出直接传给 Grok Video。
- 决策
- 在同一选中方向下分别生成关键视觉和最终视频,并明确两者的证据关系。
- 取舍
- 视觉连续性仍需人工复核,不能声称首帧自动驱动成片。
- 结果
- 产品如实展示模型协作,不制造并不存在的串行依赖。
产品演进
从结构化创意方案,到有界的 AI Video Director Agent。
每个版本都在解决上一阶段暴露出的工作流缺口,而不是为了增加一个更大的版本号。
- V1
AI Creative Generator
- 真实问题
- 从产品信息到短视频方案的拆解重复、输出松散。
- 产品决策
- 先验证结构化创意方案,而不是直接生成成片。
- 新能力
- Creative Direction、Shot List 与 Prompt 基础链路。
- 结果
- 证明 AI 可以辅助组织创意材料,但单一输出仍难支持决策。
- V1.7
Multi-provider Architecture
- 真实问题
- 文本、图像和视频依赖不同能力,单一 Provider 容易阻断流程。
- 产品决策
- 拆分 Provider 责任与失败状态。
- 新能力
- 文本、视觉与生成能力分层,可保留已完成结果。
- 结果
- 某个生成阶段失败时,前序策略和方案不必全部丢失。
- V2.0
Structured Brand Brief
- 真实问题
- 松散输入让产品理解和后续创意缺少稳定约束。
- 产品决策
- 把品牌、受众、卖点、平台、语气与限制定义为结构化 Brief。
- 新能力
- 可验证的 Brand Brief 输入。
- 结果
- 后续模型围绕同一组业务事实工作。
- V2.1
Multi-model Creative Pipeline
- 真实问题
- 让一个模型承担分析、创意与生产,责任不清且难定位质量问题。
- 产品决策
- 让不同模型承担专业角色,并交换结构化输出。
- 新能力
- Product Analyst、Creative Director、Visual Producer、Video Producer。
- 结果
- 弱点可以定位到产品理解、创意路线或资产生成的具体阶段。
- V2.2
Human Creative Selection
- 真实问题
- AI 可以扩展方向,但无法独立判断品牌最应选择哪一条路线。
- 产品决策
- 固定生成三条路线,并在高成本生产前暂停等待人工选择。
- 新能力
- 路线对比、选择理由与继续执行状态。
- 结果
- 创意判断保留在人手中,后续资产保持与选中方向一致。
- V2.3
End-to-End Video Production
- 真实问题
- 只有策略和分镜,仍无法证明方案能进入真实生产。
- 产品决策
- 补齐关键视觉与异步视频生成。
- 新能力
- GPT Image 2 关键视觉、Grok Video 成片与状态轮询。
- 结果
- 形成从 Brief 到可播放视频的完整证据链。
- V3.0
AI Video Director Agent
- 真实问题
- 固定页面流程已完整,但执行状态、工具责任与恢复路径仍需统一组织。
- 产品决策
- 用受限五步 Planner 编排既有工具,并保留人工决策检查点。
- 新能力
- 有界规划、工具选择、执行状态、暂停与恢复。
- 结果
- 工作流升级为可检查、可归因、可恢复的 Agent MVP,而非无限自治。
From Workflow to Agent
Agent 化不是放开自主循环,而是统一目标、工具、状态和恢复路径。
V3 只支持 create_short_video_campaign,并把执行限制在五个可检查步骤内。明确上限让成本、失败位置和责任边界保持可预测。
- 01User Goal
接收 create_short_video_campaign 这一明确目标。
- 02Director Agent
统一组织策略、选择与生产阶段。
- 03Bounded Planner
用固定五步计划限制成本、循环与责任边界。
- 04Specialist Tools
按阶段调用产品分析、创意、图像与视频工具。
- 05Execution State
记录步骤状态、输入摘要、输出摘要与失败原因。
- 06Human Selection
在昂贵资产生产前暂停,由人选择创意路线。
- 07Resume Execution
携带选择结果继续生成计划、关键视觉与视频。
- 08Final Asset
输出可审阅的关键视觉与可播放成片。
为什么必须有界
固定五步 Planner,不允许无限推理或工具循环。
昂贵的图像与视频生成发生在人工选择之后。
每一步记录工具、理由、状态、输入摘要、输出摘要与错误。
当前状态随 API 响应和客户端 payload 传递,尚未持久化到数据库。
AI Creative Team
价值来自角色编排,而不是模型数量。
每个模型承担不同的创意生产责任,并通过结构化输出交接;这样才能区分产品理解、创意路线与生成质量分别出了什么问题。
- 01
Product Analyst · DeepSeek
先澄清产品定位、受众动机、卖点优先级、痛点、内容角度与限制,为创意提供业务基础。
- 02
Creative Director · Grok
生成三条差异化创意路线,并把人工选中的方向发展为 Plan A / B、分镜、运镜与生产 Prompt。
- 03
Visual Producer · GPT Image 2
围绕选中方向生成一张关键视觉参考,用于确认画面语言;它不是批量品牌资产生成能力。
- 04
Video Producer · Grok Video
根据独立组装的视频 Prompt 异步生成最终成片,并通过状态轮询和同源代理交付。
Human Creative Selection
AI 生成三条路线,人做创意选择,Agent 再继续生产。
这不是为了给自动化增加一次点击,而是把品牌适配、审美和风险判断放在成本最高的生产阶段之前。
创意路线没有统一的客观最优解。系统扩大探索空间并保持上下文,人负责品牌适配、审美判断和最终批准。
扩展与发展创意可能
- 产品分析
- 三条创意路线
- Plan A / B 与分镜
- 关键视觉与视频候选
组织受控执行
- 固定五步计划
- 结构化状态
- 阶段级错误与恢复
- 模型责任与资产交付
保留创意与品牌判断
- 选择创意路线
- 确认生产方向
- 审核图像与视频
- 批准最终资产
End-to-End Production Pipeline
让选中的创意方向持续连接到分镜、关键视觉与最终成片。
- 01Brand Brief
统一品牌事实、目标、受众、卖点、平台与限制。
- 02Product Analysis
把 Brief 转译为定位、动机、痛点和内容机会。
- 03Creative Routes
生成三条可比较的概念、Hook 与视觉方向。
- 04Human Selection
由人选择最符合品牌目标的方向并记录理由。
- 05Storyboard
将选中方向发展为 Plan A / B、镜头、运镜与 Prompt。
- 06Two Production Branches
图像关键视觉与视频成片分别生成,互不伪装为串行依赖。
两条独立生产分支
Branch A:GPT Image 2 生成一张 Key Visual Reference,用于确认画面语言。
Branch B:Grok Video 接收独立组装的视频 Prompt,异步生成 Final Video Asset。
当前实现没有把 GPT Image 输出直接传给 Grok Video;两者共同服务于同一个人工选中方向。
V3 Agent 界面证据
真实运行状态证明:理解、路线、选择与完成状态处于同一工作区。
V3 证据来自当前本地实现与四个完整案例。NOCTURNE 的六张界面截图由真实运行自动捕获;关键视觉与 15 秒有声成片来自同一次案例生成。当前未验证生产部署或商业指标。
Portfolio Demo Cases
一个完整主案例,三个跨品类验证案例。
四个案例都经过同一套 V3 工作流。它们证明流程可以适配不同品类,但不代表系统已经具备普适的创意表现或商业化规模。
完整主案例
AI 护肤设备 · 肌肤的晨昏对话把 AI 个性化护肤从功能说明转化为可感知的晨昏护理仪式,完整展示从 Brand Brief、创意选择到 15 秒有声成片的受控生产过程。
- 业务问题
- AI 护肤设备容易被表达成参数、界面和临床功能的堆叠,难以同时建立高端美容科技的可信度、亲和力与日常使用想象。
- 产品决策
- 先用产品分析明确受众动机、护理场景和视觉边界,再生成三条可比较路线。人工选择“肌肤的晨昏对话”,让光线、材质和节奏围绕日常护理仪式继续发展,而不是直接从功能列表跳到视频生成。
- Agent Workflow
- Brand Brief → Agent Planning → DeepSeek Product Analysis → Grok Creative Strategy → Human Creative Selection → GPT Image 2 Key Visual → Grok Video Generation
- 创意方向
- 肌肤的晨昏对话:用晨间分析、晚间护理、珠光材质与克制镜头,把设备从冷硬功能工具转译为个人护理仪式。
- 证据
- 主案例保留完整 Brief、产品分析、三条 Creative Routes、人工选择、分镜与关键视觉,并交付 15.04 秒、480 × 848 的竖屏有声成片。
跨品类验证
辅助案例只证明同一条受控工作流可以适配不同创意任务,不抢占主案例的阅读权重。
- 01NOCTURNE 城市光影艺术夜
从活动 Brief 生成三条空间叙事路线,经人工选择后形成关键视觉与 15 秒有声竖屏成片,验证文化体验 Campaign 的节奏与氛围编排。
- 02国际山地旅游
验证非实体产品的目的地叙事、第一人称沉浸感与由微观到宏观的镜头推进。
- 03AI SaaS 会议助手
把无形的软件价值转译为决策、责任人与行动,减少对后台界面堆叠的依赖。
Grok Imagine Video
AI 护肤设备 · 肌肤的晨昏对话
用日常仪式、珠光质感和克制镜头语言呈现个性化护肤体验。
视觉摘要(非逐字稿)
- 晨间分析与晚间护理形成短时叙事弧线。
- 画面重点验证高端美容品类的光线、材质与节奏控制。
无需播放音频即可理解当前样片的验证重点。
Reliability & Agent Engineering
可靠 AI 产品需要验证、重试、状态记录与阶段级恢复。
错误不应被包装成产品亮点,但必须决定:什么结果可以降级交付,什么证据必须重试,以及如何避免从头执行。
- 01
Product Analysis 超时
交互产品允许带 warning 继续;作品集验收要求完整多模型链,因此缺失分析的结果会被拒绝并重试。
- 02
图像 Provider 额度失败
生产计划保留可用;配置恢复后只重跑关键视觉阶段,不推翻前序策略与选择。
- 03
视频任务超时与 404
保留 request ID 与前序资产,只重启视频生成,并通过轮询确认新的任务完成。
- 04
状态持久化仍有限
证据生产过程已实践阶段级恢复,但产品内还没有通用的持久化执行数据库。
技术架构
技术结构在创意决策之后出现,并服务于产品边界。
体验层
把结构化输入、路线选择、执行状态与最终资产放在同一工作区,减少上下文切换。
Next.js 15
React 19
TypeScript
Typed Brand Brief
Director Agent
固定五步 Planner 约束目标、成本和责任;它编排工具,但不做无限自主规划。
create_short_video_campaign
strategy / selected_route_plan / generate_video
Max 5 steps
Inspectable execution state
专业工具层
专业角色通过结构化输出交接,让产品分析、创意与生产问题可以分别定位。
DeepSeek Product Analyst
Grok Creative Director
GPT Image 2 Visual Producer
Grok Video Producer
状态与资产交付
异步视频任务需要轮询与 Range 代理;当前状态随响应和客户端 payload 传递,尚未进入持久化数据库。
Async video polling
Authenticated same-origin proxy
Response-level state
Local evidence assets
产品价值
减少的不是一次 Prompt 输入,而是策略与生产之间的断裂。
当前证据证明的是一条跨四个行业可运行的创意决策链,而不是商业化规模或量化提效。它减少了策略与生产之间的断裂,让每个资产都能追溯到 Brief、产品分析与人工选择。
直接从 Brief 跳到单条 Prompt 或单个生成结果
先形成产品分析与三条可比较的创意路线
模型自行沿一个方向继续生产
人工选择后,Agent 才恢复执行并发展分镜与资产
生成失败迫使整个流程重来
记录阶段状态,保留已完成策略并支持阶段级重试
将产品定位、受众、卖点和限制转化为可复用的创意上下文。
用三条结构化路线扩大探索空间,同时保留人工创意选择。
让选中方向持续连接分镜、关键视觉与最终视频,降低生产交接中的语义损失。
用四个跨行业完整案例验证同一工作流的适应性,不把它包装成普适创意表现证明。
限制与反思
不把有界工作流包装成自主创意团队。
当前限制
当前是 V3.0 本地工作原型,尚未公开部署或验证商业化使用。
Planner 仅支持一个目标和固定五步路径,不是通用自主 Agent。
产品内没有持久化工作流数据库;状态通过响应和客户端 payload 传递。
创意质量、品牌安全、事实声明和最终资产仍需要人工审核。
图像与视频质量受 Provider 输出影响,关键视觉不会自动作为视频输入。
现有 Git 仅含 V1 初始提交;V1.7 至 V3.0 由工作树、文档与资产证据校准。