Multi-model AI Creative Production System

AI Video Director Agent

把 Brand Brief 到成片之间的创意决策,组织成可审阅、可继续执行的 AI 工作流。

AI Video Director Agent 通过产品分析、三条创意路线、人工选择、专业模型协作与受控执行,把创意探索连接到关键视觉和最终视频资产。

当前版本
V3.0 Agent MVP
我的角色
AI 产品设计 / Agent 工作流 / 全栈原型实现
产品边界
本地工作原型 · 未部署
产品定位

它不是 Prompt 生成器,也不是自主创意团队,而是一套由 AI 扩展探索、系统组织执行、人负责创意判断的多模型内容生产系统。

4
完整 V3 跨品类案例1 个主案例与 3 个验证案例
3
每次策略阶段的创意路线人工选择后才继续生产
5
Planner 最大步骤固定上限,不允许无限循环
Agent execution evidence

一个工作区连接产品理解、人工选线、执行状态与最终资产。

Grok Video · Production Completion五步执行状态全部完成,最终竖屏视频在同一工作区交付,形成从 Brief、策略、人工选择到资产的完整证据链。V3.0 Agent MVP · 当前版本

01 · 问题与机会

不是缺少生成工具,而是缺少一条连续的创意决策链。

品牌短视频从 Brief 到成片,需要产品理解、创意讨论、脚本、分镜与生产协作。团队的问题不是缺少生成工具,而是创意决策分散在多次交接里,产品事实、选择理由与最终资产难以保持一致。

核心用户

品牌与内容运营

AIGC 内容团队

短视频策划与创意负责人

需要快速比较创意方向的执行团队

产品机会

我在 V1 的结构化方案中发现,直接输出更多 Prompt 仍然没有解决选择问题。真正需要被产品化的是 Brief 与成片之间的创意判断:先理解产品、提出可比较方向、让人选择,再把被选中的决策连续传递到生产。

原始流程 → 当前方法

把多次交接,改造成保留选择理由的决策链。

Brand Brief 先被人工解释,再分别进入创意讨论、脚本、分镜、图像和视频工具。每次交接都需要重建上下文,团队通常只能深入少量方向。

Before

多次交接,创意上下文不断丢失

  1. Brand Brief
  2. 产品理解
  3. 创意讨论
  4. 脚本
  5. 分镜
  6. 图像与视频生产
After

让策略、选择与资产保持同一条决策链

  1. 结构化 Brief
  2. Product Analysis
  3. 3 条 Creative Routes
  4. 人工选择
  5. Production Plan
  6. 关键视觉与最终视频
四个根因

质量问题出现在上下文、选择和执行的断点。

  1. 01

    创意探索受限于个人经验与时间

    团队通常只能深入少量方向;更多创意并不等于更多随机 Prompt,而需要可比较的策略假设、Hook 和视觉语言。

  2. 02

    产品理解与内容生产脱节

    卖点、受众与限制常在交接中被压缩,后续镜头虽然完整,却未必服务最重要的品牌目标。

  3. 03

    从 Brief 到资产存在多次上下文重建

    创意、分镜、图像和视频分别在不同工具中推进,选中方向与最终资产之间缺少可追踪关系。

  4. 04

    生成结果不能替代创意判断

    多个方向可能都成立,但品牌风险、审美、场景与利益相关者偏好仍需要人做最终选择。

02 · 关键决策

先确定人机责任,再决定 Agent 自动执行到哪里。

因此我没有追求“全自动广告生成”,而是建立一条有明确责任、人工检查点和执行上限的工作流。AI 负责扩展和发展创意,系统负责保持状态与调用边界,人负责品牌适配和最终批准。

01

为什么先结构化 Brand Brief,而不是让用户自由输入 Prompt?

背景
松散输入会让产品事实、平台目标与品牌限制在后续阶段不断漂移。
决策
先定义品牌、产品、受众、卖点、平台、语气与限制,再进入产品分析。
取舍
输入准备更明确,降低了随手尝试的即时感。
结果
不同模型围绕同一组业务事实工作,后续结果更容易复核。
03

为什么固定生成三条路线并暂停?

背景
创意路线可能同时有效,但服务不同品牌目标;AI 无法客观判定唯一最优答案。
决策
生成三条差异化路线,在高成本资产生产前要求人工选择并记录理由。
取舍
流程不会一键到底,必须保留决策等待状态。
结果
AI 扩展探索空间,人继续控制审美、品牌风险与生产方向。
04

为什么 Agent 必须有界?

背景
无限工具循环会让成本、时间、责任与失败位置不可预测。
决策
仅支持一个明确目标和固定五步 Planner,拒绝超出范围的任务。
取舍
它不是通用自主 Agent,也不能动态规划任意创意任务。
结果
执行成本与状态可预期,每个失败都能归因到具体工具。
查看 2 项支撑决策
02

为什么是专业角色协作,而不是一个模型完成所有步骤?

背景
产品理解、创意路线、图像与视频生产需要不同能力,单一回答难以定位质量来源。
决策
让 DeepSeek、Grok、GPT Image 2 与 Grok Video 分别承担分析、创意、视觉与视频角色。
取舍
多 Provider 增加了状态、成本与失败处理复杂度。
结果
每一阶段职责可解释,弱点可以被定位并单独重试。
05

为什么图像与视频是两条生产分支?

背景
关键视觉用于确认画面语言,视频生成使用独立组装的生产 Prompt;当前实现没有把 GPT Image 输出直接传给 Grok Video。
决策
在同一选中方向下分别生成关键视觉和最终视频,并明确两者的证据关系。
取舍
视觉连续性仍需人工复核,不能声称首帧自动驱动成片。
结果
产品如实展示模型协作,不制造并不存在的串行依赖。

03 · 产品演进

从结构化创意方案,到有界的 AI Video Director Agent。

每个版本都在解决上一阶段暴露出的工作流缺口,而不是为了增加一个更大的版本号。

  1. V1–V1.7

    先把创意结构化,再拆分模型责任

    真实问题
    创意拆解重复且输出松散,单一 Provider 失败还会阻断整条流程。
    产品决策
    先验证结构化创意方案,再把文本、视觉与视频能力分层。
    新能力
    Creative Direction、Shot List、Prompt 链路与多 Provider 状态。
    结果
    策略结果可以被保留,生成失败不再要求从头重做。
  2. V2.0–V2.1

    统一业务输入,建立专业角色协作

    真实问题
    松散 Brief 与单模型回答让产品事实漂移,也难定位质量问题。
    产品决策
    结构化品牌、受众、卖点与限制,并让不同模型承担明确角色。
    新能力
    Structured Brand Brief 与 Multi-model Creative Pipeline。
    结果
    不同模型围绕同一组业务事实工作,问题可以定位到具体阶段。
  3. V2.2–V2.3

    把人工创意选择接入真实生产

    真实问题
    AI 能扩展方向,但不能替代品牌判断;只有方案也无法证明能完成交付。
    产品决策
    固定生成三条路线,在关键视觉与视频生产前暂停等待人工选择。
    新能力
    路线对比、Human Selection、Storyboard、关键视觉与异步视频生成。
    结果
    选中方向可以继续发展成可审阅、可播放的完整资产证据。
  4. V3.0

    升级为有界 AI Video Director Agent

    真实问题
    固定工作流已经完整,但工具责任、执行状态与恢复路径仍需统一组织。
    产品决策
    用固定五步 Planner 编排既有工具,并保留人工决策检查点。
    新能力
    有界规划、工具选择、状态记录、暂停与恢复。
    结果
    形成可检查、可归因、可恢复的 Agent MVP,而不是无限自治。
查看 V1 结构化创意方案证据
V1 结构化导演方案较早版本先验证 Creative Direction、Shot List 与 Prompt 的结构化输出;它作为 V3 演进起点,而不是当前主证据。V1 evolution evidence · 较早已验证版本

04 · Agent 工作流

Agent 化不是放开自主循环,而是统一目标、工具、状态和恢复路径。

V3 只支持 create_short_video_campaign,并把执行限制在五个可检查步骤内。明确上限让成本、失败位置和责任边界保持可预测。

  1. 01
    User Goal

    接收 create_short_video_campaign 这一明确目标。

  2. 02
    Director Agent

    统一组织策略、选择与生产阶段。

  3. 03
    Bounded Planner

    用固定五步计划限制成本、循环与责任边界。

  4. 04
    Specialist Tools

    按阶段调用产品分析、创意、图像与视频工具。

  5. 05
    Execution State

    记录步骤状态、输入摘要、输出摘要与失败原因。

  6. 06
    Human Selection

    在昂贵资产生产前暂停,由人选择创意路线。

  7. 07
    Resume Execution

    携带选择结果继续生成计划、关键视觉与视频。

  8. 08
    Final Asset

    输出可审阅的关键视觉与可播放成片。

为什么必须有界

固定五步 Planner,不允许无限推理或工具循环。

昂贵的图像与视频生成发生在人工选择之后。

每一步记录工具、理由、状态、输入摘要、输出摘要与错误。

当前状态随 API 响应和客户端 payload 传递,尚未持久化到数据库。

专业角色协作

价值来自责任编排,而不是模型数量。

不同模型承担分析、创意、视觉与视频生产责任,并通过结构化输出交接。

  1. 01

    Product Analyst · DeepSeek

    先澄清产品定位、受众动机、卖点优先级、痛点、内容角度与限制,为创意提供业务基础。

  2. 02

    Creative Director · Grok

    生成三条差异化创意路线,并把人工选中的方向发展为 Plan A / B、分镜、运镜与生产 Prompt。

  3. 03

    Visual Producer · GPT Image 2

    围绕选中方向生成一张关键视觉参考,用于确认画面语言;它不是批量品牌资产生成能力。

  4. 04

    Video Producer · Grok Video

    根据独立组装的视频 Prompt 异步生成最终成片,并通过状态轮询和同源代理交付。

查看端到端生产管线
End-to-End Pipeline

让选中的方向继续连接到分镜、关键视觉与成片。

  1. 01
    Brand Brief

    统一品牌事实、目标、受众、卖点、平台与限制。

  2. 02
    Product Analysis

    把 Brief 转译为定位、动机、痛点和内容机会。

  3. 03
    Creative Routes

    生成三条可比较的概念、Hook 与视觉方向。

  4. 04
    Human Selection

    由人选择最符合品牌目标的方向并记录理由。

  5. 05
    Storyboard

    将选中方向发展为 Plan A / B、镜头、运镜与 Prompt。

  6. 06
    Two Production Branches

    图像关键视觉与视频成片分别生成,互不伪装为串行依赖。

两条独立生产分支

GPT Image 2 生成 Key Visual Reference,用于确认画面语言。

Grok Video 接收独立组装的视频 Prompt,异步生成 Final Video Asset。

当前实现没有把 GPT Image 输出直接传给 Grok Video。

05 · 人机协作

AI 生成三条路线,人做创意选择,Agent 再继续生产。

这不是为了给自动化增加一次点击,而是把品牌适配、审美和风险判断放在成本最高的生产阶段之前。

AI expands. System orchestrates. Human selects.

创意路线没有统一的客观最优解。系统扩大探索空间并保持上下文,人负责品牌适配、审美判断和最终批准。

AI

扩展与发展创意可能

  • 产品分析
  • 三条创意路线
  • Plan A / B 与分镜
  • 关键视觉与视频候选
System

组织受控执行

  • 固定五步计划
  • 结构化状态
  • 阶段级错误与恢复
  • 模型责任与资产交付
Human

保留创意与品牌判断

  • 选择创意路线
  • 确认生产方向
  • 审核图像与视频
  • 批准最终资产
Human Creative Selection人工选择“暗夜觉醒之旅”后,Agent 才继续发展分镜与资产;创意判断没有交给模型自动决定。V3.0 Agent MVP · 当前版本

06 · 案例与证据

一个完整主案例,三个跨品类验证案例。

四个案例都经过同一套 V3 工作流。它们证明流程可以适配不同品类,但不代表系统已经具备普适的创意表现或商业化规模。

完整主案例

AI 护肤设备 · 肌肤的晨昏对话

把 AI 个性化护肤从功能说明转化为可感知的晨昏护理仪式,完整展示从 Brand Brief、创意选择到 15 秒有声成片的受控生产过程。

业务问题
AI 护肤设备容易被表达成参数、界面和临床功能的堆叠,难以同时建立高端美容科技的可信度、亲和力与日常使用想象。
产品决策
先用产品分析明确受众动机、护理场景和视觉边界,再生成三条可比较路线。人工选择“肌肤的晨昏对话”,让光线、材质和节奏围绕日常护理仪式继续发展,而不是直接从功能列表跳到视频生成。
交付证据
肌肤的晨昏对话:用晨间分析、晚间护理、珠光材质与克制镜头,把设备从冷硬功能工具转译为个人护理仪式。 主案例保留完整 Brief、产品分析、三条 Creative Routes、人工选择、分镜与关键视觉,并交付 15.04 秒、480 × 848 的竖屏有声成片。
AI 护肤设备 · Key Visual用晨昏护肤仪式、克制光线与微距语言表达高端美容科技,而不是把产品拍成临床设备。V3.0 portfolio case · 当前版本

Grok Imagine Video

AI 护肤设备 · 肌肤的晨昏对话

用日常仪式、珠光质感和克制镜头语言呈现个性化护肤体验。

视觉摘要(非逐字稿)

  • 晨间分析与晚间护理形成短时叙事弧线。
  • 画面重点验证高端美容品类的光线、材质与节奏控制。

无需播放音频即可理解当前样片的验证重点。

查看 3 个跨品类验证案例

跨品类验证

辅助案例只证明同一条受控工作流可以适配不同创意任务,不抢占主案例的阅读权重。

  1. 01NOCTURNE 城市光影艺术夜

    从活动 Brief 生成三条空间叙事路线,经人工选择后形成关键视觉与 15 秒有声竖屏成片,验证文化体验 Campaign 的节奏与氛围编排。

  2. 02国际山地旅游

    验证非实体产品的目的地叙事、第一人称沉浸感与由微观到宏观的镜头推进。

  3. 03AI SaaS 会议助手

    把无形的软件价值转译为决策、责任人与行动,减少对后台界面堆叠的依赖。

NOCTURNE · Key Visual以深黑空间、钴蓝引导光与反射地面确认“暗夜觉醒之旅”的空间叙事方向。V3.0 portfolio case · 当前版本
国际山地旅游 · Key Visual从触觉化路径细节进入山地揭示,验证系统可以指导目的地体验,而不只服务实体产品。V3.0 portfolio case · 当前版本
AI SaaS 会议助手 · Key Visual把会议助手的无形价值转译为决策、责任人与行动结果,减少对后台界面和功能列表的依赖。V3.0 portfolio case · 当前版本

Grok Imagine Video

NOCTURNE · 暗夜觉醒之旅

用钴蓝引导光、反射空间和琥珀色高潮,将一场城市光影艺术夜转译为完整的感官旅程。

视觉摘要(非逐字稿)

  • 镜头从纯黑与钴蓝光迹进入琥珀色最终装置,形成清晰的情绪递进。
  • 成片包含环境电子声音轨,无文字、Logo、人物特写或可见生成畸变。

无需播放音频即可理解当前样片的验证重点。

查看完整 V3 Agent 界面证据(6 张)

V3 证据来自当前本地实现与四个完整案例。NOCTURNE 的六张界面截图由真实运行自动捕获;关键视觉与 15 秒有声成片来自同一次案例生成。当前未验证生产部署或商业指标。

NOCTURNE · Brand Brief结构化输入统一活动目标、受众、平台、声音方向与视觉边界,让模型围绕同一组 Campaign 事实工作。V3.0 Agent MVP · 当前版本
Director Agent Planning真实运行中的五步有界计划:产品分析与创意策略先执行,路线发展、关键视觉和视频生产保持排队状态。V3.0 Agent MVP · 当前版本
Human Creative Selection人工选择“暗夜觉醒之旅”后,Agent 才继续发展分镜与资产;创意判断没有交给模型自动决定。V3.0 Agent MVP · 当前版本
GPT Image 2 · Key Visual State关键视觉先确认深黑建筑空间、钴蓝引导光与反射地面,再进入高成本视频生成。V3.0 Agent MVP · 当前版本
Grok Video · Production Completion五步执行状态全部完成,最终竖屏视频在同一工作区交付,形成从 Brief、策略、人工选择到资产的完整证据链。V3.0 Agent MVP · 当前版本

07 · 价值与边界

减少策略与生产之间的断裂,但不替代人的创意判断。

当前证据证明的是一条跨四个行业可运行的创意决策链,而不是商业化规模或量化提效。它减少了策略与生产之间的断裂,让每个资产都能追溯到 Brief、产品分析与人工选择。

Before

直接从 Brief 跳到单条 Prompt 或单个生成结果

After

先形成产品分析与三条可比较的创意路线

Before

模型自行沿一个方向继续生产

After

人工选择后,Agent 才恢复执行并发展分镜与资产

Before

生成失败迫使整个流程重来

After

记录阶段状态,保留已完成策略并支持阶段级重试

将产品定位、受众、卖点和限制转化为可复用的创意上下文。

用三条结构化路线扩大探索空间,同时保留人工创意选择。

让选中方向持续连接分镜、关键视觉与最终视频,降低生产交接中的语义损失。

用四个跨行业完整案例验证同一工作流的适应性,不把它包装成普适创意表现证明。

技术与可靠性深入阅读
Reliability & Agent Engineering

验证、重试、状态记录与阶段级恢复。

  1. 01

    Product Analysis 超时

    交互产品允许带 warning 继续;作品集验收要求完整多模型链,因此缺失分析的结果会被拒绝并重试。

  2. 02

    图像 Provider 额度失败

    生产计划保留可用;配置恢复后只重跑关键视觉阶段,不推翻前序策略与选择。

  3. 03

    视频任务超时与 404

    保留 request ID 与前序资产,只重启视频生成,并通过轮询确认新的任务完成。

  4. 04

    状态持久化仍有限

    证据生产过程已实践阶段级恢复,但产品内还没有通用的持久化执行数据库。

技术架构

技术结构服务于产品边界。

体验层

把结构化输入、路线选择、执行状态与最终资产放在同一工作区,减少上下文切换。

Next.js 15

React 19

TypeScript

Typed Brand Brief

Director Agent

固定五步 Planner 约束目标、成本和责任;它编排工具,但不做无限自主规划。

create_short_video_campaign

strategy / selected_route_plan / generate_video

Max 5 steps

Inspectable execution state

专业工具层

专业角色通过结构化输出交接,让产品分析、创意与生产问题可以分别定位。

DeepSeek Product Analyst

Grok Creative Director

GPT Image 2 Visual Producer

Grok Video Producer

状态与资产交付

异步视频任务需要轮询与 Range 代理;当前状态随响应和客户端 payload 传递,尚未进入持久化数据库。

Async video polling

Authenticated same-origin proxy

Response-level state

Local evidence assets

Next.js 15React 19TypeScriptDeepSeekGrokGPT Image 2Grok Imagine VideoBounded PlannerPlaywright

当前限制

当前是 V3.0 本地工作原型,尚未公开部署或验证商业化使用。

Planner 仅支持一个目标和固定五步路径,不是通用自主 Agent。

产品内没有持久化工作流数据库;状态通过响应和客户端 payload 传递。

创意质量、品牌安全、事实声明和最终资产仍需要人工审核。

图像与视频质量受 Provider 输出影响,关键视觉不会自动作为视频输入。

现有 Git 仅含 V1 初始提交;V1.7 至 V3.0 由工作树、文档与资产证据校准。

反思:Agent 的价值不是增加自主性,而是把责任、状态和恢复路径组织清楚。

反思:生成更多方向只解决探索广度,真正的产品价值来自可比较结构与人工决策检查点。

反思:多模型协作不是模型数量竞赛;只有明确角色、结构化交接和失败隔离时才有意义。

下一步:把执行状态持久化到数据库,支持跨会话恢复与资产版本管理。

下一步:建立 Brand Knowledge Base 与已批准/拒绝创意方向的可检索记忆。

下一步:增加品牌声明、文化风险与法务检查点,但继续保留人工批准。