Multi-model AI Creative Production System

AI Video Director Agent

把 Brand Brief 到成片之间的创意决策,组织成可审阅、可继续执行的 AI 工作流。

AI Video Director Agent 通过产品分析、三条创意路线、人工选择、专业模型协作与受控执行,把创意探索连接到关键视觉和最终视频资产。

当前版本
V3.0 Agent MVP
状态
本地工作原型
我的角色
AI 产品设计 / Agent 工作流 / 全栈原型实现
公开状态
未部署
最后验证
2026.07.26
产品定位

它不是 Prompt 生成器,也不是自主创意团队,而是一套由 AI 扩展探索、系统组织执行、人负责创意判断的多模型内容生产系统。

4
完整 V3 跨品类案例1 个主案例与 3 个验证案例
3
每次策略阶段的创意路线人工选择后才继续生产
5
Planner 最大步骤固定上限,不允许无限循环

为什么要做这个产品

问题不是如何生成一段视频,而是如何组织生产前的创意决策。

品牌短视频从 Brief 到成片,需要产品理解、创意讨论、脚本、分镜与生产协作。团队的问题不是缺少生成工具,而是创意决策分散在多次交接里,产品事实、选择理由与最终资产难以保持一致。

核心用户

品牌与内容运营

AIGC 内容团队

短视频策划与创意负责人

需要快速比较创意方向的执行团队

产品机会

我在 V1 的结构化方案中发现,直接输出更多 Prompt 仍然没有解决选择问题。真正需要被产品化的是 Brief 与成片之间的创意判断:先理解产品、提出可比较方向、让人选择,再把被选中的决策连续传递到生产。

原始工作流

把多次交接,改造成一条保留选择理由的决策链。

Brand Brief 先被人工解释,再分别进入创意讨论、脚本、分镜、图像和视频工具。每次交接都需要重建上下文,团队通常只能深入少量方向。

Before

多次交接,创意上下文不断丢失

  1. Brand Brief
  2. 产品理解
  3. 创意讨论
  4. 脚本
  5. 分镜
  6. 图像与视频生产
After

让策略、选择与资产保持同一条决策链

  1. 结构化 Brief
  2. Product Analysis
  3. 3 条 Creative Routes
  4. 人工选择
  5. Production Plan
  6. 关键视觉与最终视频

问题发现

创意质量取决于上下文、选择与执行是否连续,而不只取决于模型能力。

  1. 01

    创意探索受限于个人经验与时间

    团队通常只能深入少量方向;更多创意并不等于更多随机 Prompt,而需要可比较的策略假设、Hook 和视觉语言。

  2. 02

    产品理解与内容生产脱节

    卖点、受众与限制常在交接中被压缩,后续镜头虽然完整,却未必服务最重要的品牌目标。

  3. 03

    从 Brief 到资产存在多次上下文重建

    创意、分镜、图像和视频分别在不同工具中推进,选中方向与最终资产之间缺少可追踪关系。

  4. 04

    生成结果不能替代创意判断

    多个方向可能都成立,但品牌风险、审美、场景与利益相关者偏好仍需要人做最终选择。

核心产品决策

先定义责任与检查点,再决定 Agent 可以自动执行到哪里。

因此我没有追求“全自动广告生成”,而是建立一条有明确责任、人工检查点和执行上限的工作流。AI 负责扩展和发展创意,系统负责保持状态与调用边界,人负责品牌适配和最终批准。

01

为什么先结构化 Brand Brief,而不是让用户自由输入 Prompt?

背景
松散输入会让产品事实、平台目标与品牌限制在后续阶段不断漂移。
决策
先定义品牌、产品、受众、卖点、平台、语气与限制,再进入产品分析。
取舍
输入准备更明确,降低了随手尝试的即时感。
结果
不同模型围绕同一组业务事实工作,后续结果更容易复核。
02

为什么是专业角色协作,而不是一个模型完成所有步骤?

背景
产品理解、创意路线、图像与视频生产需要不同能力,单一回答难以定位质量来源。
决策
让 DeepSeek、Grok、GPT Image 2 与 Grok Video 分别承担分析、创意、视觉与视频角色。
取舍
多 Provider 增加了状态、成本与失败处理复杂度。
结果
每一阶段职责可解释,弱点可以被定位并单独重试。
03

为什么固定生成三条路线并暂停?

背景
创意路线可能同时有效,但服务不同品牌目标;AI 无法客观判定唯一最优答案。
决策
生成三条差异化路线,在高成本资产生产前要求人工选择并记录理由。
取舍
流程不会一键到底,必须保留决策等待状态。
结果
AI 扩展探索空间,人继续控制审美、品牌风险与生产方向。
04

为什么 Agent 必须有界?

背景
无限工具循环会让成本、时间、责任与失败位置不可预测。
决策
仅支持一个明确目标和固定五步 Planner,拒绝超出范围的任务。
取舍
它不是通用自主 Agent,也不能动态规划任意创意任务。
结果
执行成本与状态可预期,每个失败都能归因到具体工具。
05

为什么图像与视频是两条生产分支?

背景
关键视觉用于确认画面语言,视频生成使用独立组装的生产 Prompt;当前实现没有把 GPT Image 输出直接传给 Grok Video。
决策
在同一选中方向下分别生成关键视觉和最终视频,并明确两者的证据关系。
取舍
视觉连续性仍需人工复核,不能声称首帧自动驱动成片。
结果
产品如实展示模型协作,不制造并不存在的串行依赖。

产品演进

从结构化创意方案,到有界的 AI Video Director Agent。

每个版本都在解决上一阶段暴露出的工作流缺口,而不是为了增加一个更大的版本号。

  1. V1

    AI Creative Generator

    真实问题
    从产品信息到短视频方案的拆解重复、输出松散。
    产品决策
    先验证结构化创意方案,而不是直接生成成片。
    新能力
    Creative Direction、Shot List 与 Prompt 基础链路。
    结果
    证明 AI 可以辅助组织创意材料,但单一输出仍难支持决策。
  2. V1.7

    Multi-provider Architecture

    真实问题
    文本、图像和视频依赖不同能力,单一 Provider 容易阻断流程。
    产品决策
    拆分 Provider 责任与失败状态。
    新能力
    文本、视觉与生成能力分层,可保留已完成结果。
    结果
    某个生成阶段失败时,前序策略和方案不必全部丢失。
  3. V2.0

    Structured Brand Brief

    真实问题
    松散输入让产品理解和后续创意缺少稳定约束。
    产品决策
    把品牌、受众、卖点、平台、语气与限制定义为结构化 Brief。
    新能力
    可验证的 Brand Brief 输入。
    结果
    后续模型围绕同一组业务事实工作。
  4. V2.1

    Multi-model Creative Pipeline

    真实问题
    让一个模型承担分析、创意与生产,责任不清且难定位质量问题。
    产品决策
    让不同模型承担专业角色,并交换结构化输出。
    新能力
    Product Analyst、Creative Director、Visual Producer、Video Producer。
    结果
    弱点可以定位到产品理解、创意路线或资产生成的具体阶段。
  5. V2.2

    Human Creative Selection

    真实问题
    AI 可以扩展方向,但无法独立判断品牌最应选择哪一条路线。
    产品决策
    固定生成三条路线,并在高成本生产前暂停等待人工选择。
    新能力
    路线对比、选择理由与继续执行状态。
    结果
    创意判断保留在人手中,后续资产保持与选中方向一致。
  6. V2.3

    End-to-End Video Production

    真实问题
    只有策略和分镜,仍无法证明方案能进入真实生产。
    产品决策
    补齐关键视觉与异步视频生成。
    新能力
    GPT Image 2 关键视觉、Grok Video 成片与状态轮询。
    结果
    形成从 Brief 到可播放视频的完整证据链。
  7. V3.0

    AI Video Director Agent

    真实问题
    固定页面流程已完整,但执行状态、工具责任与恢复路径仍需统一组织。
    产品决策
    用受限五步 Planner 编排既有工具,并保留人工决策检查点。
    新能力
    有界规划、工具选择、执行状态、暂停与恢复。
    结果
    工作流升级为可检查、可归因、可恢复的 Agent MVP,而非无限自治。
V1 结构化导演方案较早版本先验证 Creative Direction、Shot List 与 Prompt 的结构化输出;它作为 V3 演进起点,而不是当前主证据。V1 evolution evidence · 较早已验证版本

From Workflow to Agent

Agent 化不是放开自主循环,而是统一目标、工具、状态和恢复路径。

V3 只支持 create_short_video_campaign,并把执行限制在五个可检查步骤内。明确上限让成本、失败位置和责任边界保持可预测。

  1. 01
    User Goal

    接收 create_short_video_campaign 这一明确目标。

  2. 02
    Director Agent

    统一组织策略、选择与生产阶段。

  3. 03
    Bounded Planner

    用固定五步计划限制成本、循环与责任边界。

  4. 04
    Specialist Tools

    按阶段调用产品分析、创意、图像与视频工具。

  5. 05
    Execution State

    记录步骤状态、输入摘要、输出摘要与失败原因。

  6. 06
    Human Selection

    在昂贵资产生产前暂停,由人选择创意路线。

  7. 07
    Resume Execution

    携带选择结果继续生成计划、关键视觉与视频。

  8. 08
    Final Asset

    输出可审阅的关键视觉与可播放成片。

为什么必须有界

固定五步 Planner,不允许无限推理或工具循环。

昂贵的图像与视频生成发生在人工选择之后。

每一步记录工具、理由、状态、输入摘要、输出摘要与错误。

当前状态随 API 响应和客户端 payload 传递,尚未持久化到数据库。

AI Creative Team

价值来自角色编排,而不是模型数量。

每个模型承担不同的创意生产责任,并通过结构化输出交接;这样才能区分产品理解、创意路线与生成质量分别出了什么问题。

  1. 01

    Product Analyst · DeepSeek

    先澄清产品定位、受众动机、卖点优先级、痛点、内容角度与限制,为创意提供业务基础。

  2. 02

    Creative Director · Grok

    生成三条差异化创意路线,并把人工选中的方向发展为 Plan A / B、分镜、运镜与生产 Prompt。

  3. 03

    Visual Producer · GPT Image 2

    围绕选中方向生成一张关键视觉参考,用于确认画面语言;它不是批量品牌资产生成能力。

  4. 04

    Video Producer · Grok Video

    根据独立组装的视频 Prompt 异步生成最终成片,并通过状态轮询和同源代理交付。

Human Creative Selection

AI 生成三条路线,人做创意选择,Agent 再继续生产。

这不是为了给自动化增加一次点击,而是把品牌适配、审美和风险判断放在成本最高的生产阶段之前。

AI expands. System orchestrates. Human selects.

创意路线没有统一的客观最优解。系统扩大探索空间并保持上下文,人负责品牌适配、审美判断和最终批准。

AI

扩展与发展创意可能

  • 产品分析
  • 三条创意路线
  • Plan A / B 与分镜
  • 关键视觉与视频候选
System

组织受控执行

  • 固定五步计划
  • 结构化状态
  • 阶段级错误与恢复
  • 模型责任与资产交付
Human

保留创意与品牌判断

  • 选择创意路线
  • 确认生产方向
  • 审核图像与视频
  • 批准最终资产
Human Creative Selection人工选择“暗夜觉醒之旅”后,Agent 才继续发展分镜与资产;创意判断没有交给模型自动决定。V3.0 Agent MVP · 当前版本

End-to-End Production Pipeline

让选中的创意方向持续连接到分镜、关键视觉与最终成片。

  1. 01
    Brand Brief

    统一品牌事实、目标、受众、卖点、平台与限制。

  2. 02
    Product Analysis

    把 Brief 转译为定位、动机、痛点和内容机会。

  3. 03
    Creative Routes

    生成三条可比较的概念、Hook 与视觉方向。

  4. 04
    Human Selection

    由人选择最符合品牌目标的方向并记录理由。

  5. 05
    Storyboard

    将选中方向发展为 Plan A / B、镜头、运镜与 Prompt。

  6. 06
    Two Production Branches

    图像关键视觉与视频成片分别生成,互不伪装为串行依赖。

两条独立生产分支

Branch A:GPT Image 2 生成一张 Key Visual Reference,用于确认画面语言。

Branch B:Grok Video 接收独立组装的视频 Prompt,异步生成 Final Video Asset。

当前实现没有把 GPT Image 输出直接传给 Grok Video;两者共同服务于同一个人工选中方向。

V3 Agent 界面证据

真实运行状态证明:理解、路线、选择与完成状态处于同一工作区。

V3 证据来自当前本地实现与四个完整案例。NOCTURNE 的六张界面截图由真实运行自动捕获;关键视觉与 15 秒有声成片来自同一次案例生成。当前未验证生产部署或商业指标。

NOCTURNE · Brand Brief结构化输入统一活动目标、受众、平台、声音方向与视觉边界,让模型围绕同一组 Campaign 事实工作。V3.0 Agent MVP · 当前版本
Director Agent Planning真实运行中的五步有界计划:产品分析与创意策略先执行,路线发展、关键视觉和视频生产保持排队状态。V3.0 Agent MVP · 当前版本
Human Creative Selection人工选择“暗夜觉醒之旅”后,Agent 才继续发展分镜与资产;创意判断没有交给模型自动决定。V3.0 Agent MVP · 当前版本
GPT Image 2 · Key Visual State关键视觉先确认深黑建筑空间、钴蓝引导光与反射地面,再进入高成本视频生成。V3.0 Agent MVP · 当前版本
Grok Video · Production Completion五步执行状态全部完成,最终竖屏视频在同一工作区交付,形成从 Brief、策略、人工选择到资产的完整证据链。V3.0 Agent MVP · 当前版本

Portfolio Demo Cases

一个完整主案例,三个跨品类验证案例。

四个案例都经过同一套 V3 工作流。它们证明流程可以适配不同品类,但不代表系统已经具备普适的创意表现或商业化规模。

完整主案例

AI 护肤设备 · 肌肤的晨昏对话

把 AI 个性化护肤从功能说明转化为可感知的晨昏护理仪式,完整展示从 Brand Brief、创意选择到 15 秒有声成片的受控生产过程。

业务问题
AI 护肤设备容易被表达成参数、界面和临床功能的堆叠,难以同时建立高端美容科技的可信度、亲和力与日常使用想象。
产品决策
先用产品分析明确受众动机、护理场景和视觉边界,再生成三条可比较路线。人工选择“肌肤的晨昏对话”,让光线、材质和节奏围绕日常护理仪式继续发展,而不是直接从功能列表跳到视频生成。
Agent Workflow
Brand Brief → Agent Planning → DeepSeek Product Analysis → Grok Creative Strategy → Human Creative Selection → GPT Image 2 Key Visual → Grok Video Generation
创意方向
肌肤的晨昏对话:用晨间分析、晚间护理、珠光材质与克制镜头,把设备从冷硬功能工具转译为个人护理仪式。
证据
主案例保留完整 Brief、产品分析、三条 Creative Routes、人工选择、分镜与关键视觉,并交付 15.04 秒、480 × 848 的竖屏有声成片。
AI 护肤设备 · Key Visual用晨昏护肤仪式、克制光线与微距语言表达高端美容科技,而不是把产品拍成临床设备。V3.0 portfolio case · 当前版本

跨品类验证

辅助案例只证明同一条受控工作流可以适配不同创意任务,不抢占主案例的阅读权重。

  1. 01NOCTURNE 城市光影艺术夜

    从活动 Brief 生成三条空间叙事路线,经人工选择后形成关键视觉与 15 秒有声竖屏成片,验证文化体验 Campaign 的节奏与氛围编排。

  2. 02国际山地旅游

    验证非实体产品的目的地叙事、第一人称沉浸感与由微观到宏观的镜头推进。

  3. 03AI SaaS 会议助手

    把无形的软件价值转译为决策、责任人与行动,减少对后台界面堆叠的依赖。

NOCTURNE · Key Visual以深黑空间、钴蓝引导光与反射地面确认“暗夜觉醒之旅”的空间叙事方向。V3.0 portfolio case · 当前版本
国际山地旅游 · Key Visual从触觉化路径细节进入山地揭示,验证系统可以指导目的地体验,而不只服务实体产品。V3.0 portfolio case · 当前版本
AI SaaS 会议助手 · Key Visual把会议助手的无形价值转译为决策、责任人与行动结果,减少对后台界面和功能列表的依赖。V3.0 portfolio case · 当前版本

Grok Imagine Video

AI 护肤设备 · 肌肤的晨昏对话

用日常仪式、珠光质感和克制镜头语言呈现个性化护肤体验。

视觉摘要(非逐字稿)

  • 晨间分析与晚间护理形成短时叙事弧线。
  • 画面重点验证高端美容品类的光线、材质与节奏控制。

无需播放音频即可理解当前样片的验证重点。

Reliability & Agent Engineering

可靠 AI 产品需要验证、重试、状态记录与阶段级恢复。

错误不应被包装成产品亮点,但必须决定:什么结果可以降级交付,什么证据必须重试,以及如何避免从头执行。

  1. 01

    Product Analysis 超时

    交互产品允许带 warning 继续;作品集验收要求完整多模型链,因此缺失分析的结果会被拒绝并重试。

  2. 02

    图像 Provider 额度失败

    生产计划保留可用;配置恢复后只重跑关键视觉阶段,不推翻前序策略与选择。

  3. 03

    视频任务超时与 404

    保留 request ID 与前序资产,只重启视频生成,并通过轮询确认新的任务完成。

  4. 04

    状态持久化仍有限

    证据生产过程已实践阶段级恢复,但产品内还没有通用的持久化执行数据库。

技术架构

技术结构在创意决策之后出现,并服务于产品边界。

体验层

把结构化输入、路线选择、执行状态与最终资产放在同一工作区,减少上下文切换。

Next.js 15

React 19

TypeScript

Typed Brand Brief

Director Agent

固定五步 Planner 约束目标、成本和责任;它编排工具,但不做无限自主规划。

create_short_video_campaign

strategy / selected_route_plan / generate_video

Max 5 steps

Inspectable execution state

专业工具层

专业角色通过结构化输出交接,让产品分析、创意与生产问题可以分别定位。

DeepSeek Product Analyst

Grok Creative Director

GPT Image 2 Visual Producer

Grok Video Producer

状态与资产交付

异步视频任务需要轮询与 Range 代理;当前状态随响应和客户端 payload 传递,尚未进入持久化数据库。

Async video polling

Authenticated same-origin proxy

Response-level state

Local evidence assets

Next.js 15React 19TypeScriptDeepSeekGrokGPT Image 2Grok Imagine VideoBounded PlannerPlaywright

产品价值

减少的不是一次 Prompt 输入,而是策略与生产之间的断裂。

当前证据证明的是一条跨四个行业可运行的创意决策链,而不是商业化规模或量化提效。它减少了策略与生产之间的断裂,让每个资产都能追溯到 Brief、产品分析与人工选择。

Before

直接从 Brief 跳到单条 Prompt 或单个生成结果

After

先形成产品分析与三条可比较的创意路线

Before

模型自行沿一个方向继续生产

After

人工选择后,Agent 才恢复执行并发展分镜与资产

Before

生成失败迫使整个流程重来

After

记录阶段状态,保留已完成策略并支持阶段级重试

将产品定位、受众、卖点和限制转化为可复用的创意上下文。

用三条结构化路线扩大探索空间,同时保留人工创意选择。

让选中方向持续连接分镜、关键视觉与最终视频,降低生产交接中的语义损失。

用四个跨行业完整案例验证同一工作流的适应性,不把它包装成普适创意表现证明。

限制与反思

不把有界工作流包装成自主创意团队。

当前限制

当前是 V3.0 本地工作原型,尚未公开部署或验证商业化使用。

Planner 仅支持一个目标和固定五步路径,不是通用自主 Agent。

产品内没有持久化工作流数据库;状态通过响应和客户端 payload 传递。

创意质量、品牌安全、事实声明和最终资产仍需要人工审核。

图像与视频质量受 Provider 输出影响,关键视觉不会自动作为视频输入。

现有 Git 仅含 V1 初始提交;V1.7 至 V3.0 由工作树、文档与资产证据校准。

反思:Agent 的价值不是增加自主性,而是把责任、状态和恢复路径组织清楚。

反思:生成更多方向只解决探索广度,真正的产品价值来自可比较结构与人工决策检查点。

反思:多模型协作不是模型数量竞赛;只有明确角色、结构化交接和失败隔离时才有意义。

下一步:把执行状态持久化到数据库,支持跨会话恢复与资产版本管理。

下一步:建立 Brand Knowledge Base 与已批准/拒绝创意方向的可检索记忆。

下一步:增加品牌声明、文化风险与法务检查点,但继续保留人工批准。