输入文字,产出视频——谁都能做。
这是 AI 时代的技术平权,像一台自动贩卖机:写剧本、拆分镜、生图、生视频,被压成流水线一样的工序。既然成片已经变成一种廉价能力,设计要解决的问题到底是什么?
妙创的答案不是再加一个「一键成片」按钮。市面上大多数 Agent 都能做到。难的是另一件事:用户脑海里的导演视角,和成片之间始终存在差距——画面、风格、基调,要在每个环节对齐;出了问题,不能只能重来。
我们把这件事归结为四个字:用户内容表达权。
妙创是什么
妙创是 AI 数字片场,面向影视与媒体内容工作者。
在没有拍摄、剪辑技能门槛的前提下,让用户基于脚本得到符合构想的视频,有效节省创作时间。整个过程可编排、可修正、可验收——不是黑盒生成器,而是一场可以导、可以喊 Cut 的数字片场。
三个功能支点:
- 让 Agent 速通影视工作流:剧本分析、空间想象、演员调度交给系统,人专注验收
- 灵感画布 × 时间轴:在空间上发散想象,在时间上验证节奏
- 风格特征、资产锚点:项目级的「滤镜」,用摄影思维突破 AI 画面的平均值
一句话:让 Agent 在已锚定的角色、空间、拍摄风格下持续改戏,不推翻重来,做出连贯的故事。
项目 11 月立项,4 月正式进入代码仓设计开发。中间做了大量实验——从 Agent V0 的导演基调设定,到 V1 的剧本解析与分镜验收,再到画布内嵌时间轴。下文是这些探索里沉淀下来的设计判断。
成片变便宜之后,设计在争什么
和研发一起梳理过一条影视创作流程:从脚本输入,到关键场景、角色演绎、镜头生产,再到后期剪辑。生成式 AI 的扩散黑盒,在体验层表现为——用户脑中的画面,和系统吐出的结果,总隔着一层雾。
左边是「一键成片」能力:快,但画面跟预期有差距。右边是设计真正要守住的:用户内容表达权——在链路的任意节点,人都能看见、判断、介入。
流程图里反复出现「用户确认」菱形节点,不是形式主义,而是产品立场:自动化和用户控制不是 slider 两端,而是同一条链路上的两种时刻。
让画面成为创作的起点
用户真正要完成什么
表面看,用户来妙创是要「做一条视频」「做一部漫剧」。停在这里,设计很容易滑成功能清单:上传剧本、设定角色、生成分镜、一键成片。
更深一层,用户真正想完成的是:把脑海中想象的视觉故事,转化成可交付的成片——表达符合预期、风格连续、节奏成立。
用一张冰山图来说:表层任务是「做视频」;水面下是「可交付的视觉叙事」,靠三件事撑住:表达对齐、风格连续、节奏成立。
一句话完成任务,卡在哪里
今年年初,我们和混元合作快速上线了 Agent V0,跑通从文案到视频的基础流程。「一句话完成任务」降低了门槛——这点和很多 AI 产品一样。
但影视创作的摩擦,不在于流程有多长,而在于 人机信息对齐太贵。即使前期对齐了意图,画面仍会跑偏;出了问题,只能重来。
我把这个摩擦拆成三个维度:
| 维度 | 人的倾向 | 系统的需要 | 设计回应 |
|---|---|---|---|
| 前馈 | 少说、模糊 | 结构化执行 | 视觉优先 |
| 过程 | 发散、编排 | 线性、确定性 | 时间轴 |
| 输出 | 风格统一 | 默认趋同 | 锚定 |
还有一个更底层的矛盾:输入越少,结果越难控制;输入一旦增多,感知理解负担又加重。 三条设计线,都围绕这个核心张力展开——既要自动化,也要轻松对齐表达。
V1 做了一轮优化:从剧本分析、角色资产图,到拆分镜提示词,每个环节都提供人工验收和调整入口。同一链路上,大多数时候让 Agent 速通,在关键处让人像导演一样喊「Cut」。还引入了共创模式,让用户预先规范自定义输出。
控制权增加了,校验工作也增加了。尤其是文本和提示词——检查 AI 智能解析出的提示词,堪比读一篇学术论文。
画面 ↔ 文字:认知翻译成本
究其原因:我们对文字天然陌生,很多创作想法最初并不是以文字形式出现的。
创作者要把脑内画面转成文字,AI 再把文字理解成画面。每经过一次转译,原本清晰的东西就被稀释一点。想跟 AI 沟通一个场景,需要两方各自理解构图、景别、动作、光线、情绪、节奏;生成结果不满意,还要继续解释哪里不对。
视频创作还涉及镜头之间的关系:上一镜如何接下一镜,情绪如何递进,节奏如何收束。单张图可以靠提示词慢慢磨,一段故事需要连续性——镜头衔接、情绪递进、节奏收束,都很难在每一步用文字准确说清楚。
在研究导演分镜教程后,我开始想:如果 AI 是一位好导演,它最好能提供可视化的镜头语言,让用户像读漫画一样参与共创。AI 先把剧本转成一组图文并茂的故事板;创作者看到的不是等待解释的文本,而是一组可视化的镜头卡片。
这个变化看起来很小,但它改变了人和 AI 的沟通语言。既然文字存在摩擦,就最小化这个摩擦。这更接近导演的工作方式:把镜头摊开,调整顺序,观察节奏,再决定哪些地方需要重拍或补充。
三条设计原则
1. 画面优先
AI 创作工具应该更早提供画面反馈。前期用低成本的线稿、草图或分镜宫格,把故事结构可视化,帮助用户尽早发现理解偏差。把画面作为讨论语言,而不是把画面当作流程末端的奖励。
2. 直接操作
当故事已经被拆成一组分镜,最自然的编辑方式应该是直接操作这些分镜:拖动镜头排序叙事,拉长缩短镜头调整节奏密度,合并相邻镜头让情绪推进,替换某个镜头。提示词适合生成,但编辑不够直观——换一张、变体、历史、下载,应该长在画面上,而不是长在输入框里。
3. 保持连贯
AI 视频最容易出现的问题,是镜头间断裂。单个画面不错,串起来后,角色状态、空间关系、情绪推进会突然跳变。我们以幕/场次为单元,将一组宫格组合输入,让 AI 理解镜头间的过渡联系;在提示词工程里注入叙事模版——建立(时间、地点、空间、世界观)、关系(人物与空间、人物与人物、情绪收紧)、余韵(情绪落点、记忆点、停顿感、悬念)——在分散的画面之间建立与故事契合的时空。
灵感画布 × 时间轴
认知心理学里有一个有用的区分:人脑有两种认知模式。
空间思维——思维导图、白板、无限画布,适合分类、推导、联想。时间思维——PPT、文档流、剪辑时间轴,适合讲故事、节奏、演进。
妙创初版规划建立在经典视频生产流程上:先有素材,再剪辑。于是很自然设计了两个页面——故事板/画布负责发散分镜,剪辑页负责时间轴编辑。它们各自独立。
但流水线生产是理想状态,实际创作中存在行为的分支和穿插。拆成两个工具,信息就会在切换中丢失:刚在画布上比较完三个分镜方案,又要切到另一个界面预览节奏;改了一个镜头,时间轴上的卡点就不容易对齐。在两个地方之间传输、下载、上传,是一种行动负担。
V0 版本是分离的时间轴:画布分镜轴、故事板分镜轴、剪辑时间轴,各自为政。媒体数据的传输本身成了负担。
V1 的转向是:把时间轴嵌入画布,让发散和预览共享同一视图。画布承载角色、场景、分镜、参考;时间轴负责节奏预览。用户不必在「想画面」和「看节奏」两页之间来回跳——只需要「放入画布」「放入时间轴」两个动作,就能打通一种数据在两处的投影。
空间上发散灵感,时间上预览节奏,互相投影。这是影视创作时空交叠的产品表达。
风格特征、资产锚点:将品味设计成系统能力
今天用 Vibe Coding 或 AI 生图,几乎都有类似感受:裸提示词有一个本能倾向——往最安全的平均值坍塌。
写上「真人写实」「电影感」「赛博朋克」「日漫」几个关键词,AI 很容易产出「能看、没大错、但没有辨识度」的中间结果。对抗这种坍塌,不能只靠用户写更长的提示词,更需要把品味设计成系统能力。
我们在底层做了 Harness 工程——用资产锚点和摄影语法,给整个项目添加一个拍摄滤镜。故事开拍前,把影片整体定调。具体包括:
资产锚点:脸、光线、构图、质感,跨镜头保持一致。角色、场景、道具在项目级复用,而不是每帧重新抽奖。
摄影思维写风格提示:光线方向、构图关系、镜头焦段、机位角度、景深范围、景别距离、曝光基准、对比曲线、黑白位控制、色彩倾向、颗粒锐度——像前期加后期的完整摄影语法,而不是堆几个风格词。
镜头间逻辑:A 镜头 + B 镜头 → 情绪 C。先给一个角色凝视的特写,再给一个荒凉原野的空镜,节奏放慢——情绪不是单帧属性,而是镜头关系推导出来的。
这三部分由 Agent 辅助把关,大多数用户只需关注画面内容,就能摆脱 AI 廉价感的困扰。
对于进阶玩家——有独特品味追求、阅片无数、希望在 AI 预设上更进一步调整——我们正在探索 项目情绪版 能力:让 AI 分析项目中的图片,自动提炼品味特征和关键词,快速统一导演者的视觉感受表达。韦斯·安德森的对称秩序、胡金铨的留白与建筑框景,都可以被翻译成可复用的风格描述,而不只是「好看」两个字。
设计工程:成为一个构建者的思路
在做妙创的过程中,我逐渐习惯了一种工作流程:用代码设计,而不是先用 Figma 设计再转代码。 从逻辑开始构建时,你不再只是画像素,而是真的在构建产品。
先跑起来,再甄选
很多需求,有大概 60%–70% 的想法后,直接放进 Agent 跑起来,快速把想法具象化;然后接受 AI 返回的不完美结果,再想办法将它推向想要的高度。
新的核心能力变成:从这些结果里分辨哪个是噪音、哪个是信号,并决定如何把优秀的交互模式沉淀进统一系统。设计价值不再局限于「通过原型推演方案」,而是转向 品味(Taste)与策展(Curation)——从大量已具象化的原型里,凭借系统思维和用户同理心,决定如何缝合进统一的系统。
更早接触真实约束
相比于 Figma 模拟游乐场,参数化可交互的结果比线稿、假画布有感染力。设计师的同理心也更容易发挥:
- 代入开发者视角:了解生产技术系统中的限制越多,就越能更好地指导 Agent——百分比宽度的变化、由真实剧本/AI 文本数定义容器尺寸、画布中迷路了怎么办
- 代入真实用户:操作屏幕上的每个元素,完整体验一套 Flow,会发现很多原型的不足——根据屏幕调整最优布局、发现被忽略的用户场景、让他人参与体验并提出可参考的观点
与 AI 沟通:乔哈里窗四象限
和 Agent 一起打磨设计时,我常用一个四象限思维模型(源于心理学中的乔哈里窗):
| 象限 | 含义 | 设计中的用法 |
|---|---|---|
| 已知的已知 | 清楚知道并写在提示词里 | 设计目标、交互行为、范围/约束 |
| 已知的未知 | 知道还没答案的问题 | 待决策点,先列出来再选 |
| 未知的已知 | 过于常识,看到才意识到 | 提供参考代码或组件 |
| 未知的未知 | 完全没意识的盲区 | 让 AI 扫描、记录、揭露 |
已知的已知是基础。画布拾取功能就是例子:目标、细节、约束三段式表达——在 @CanvasInput 加「从画布拾取」入口,点击吸管进入拾取模式,点击画布媒体写入引用槽,Esc 或点空白退出;约束写清用现有 Canvas API、Tailwind + 现有 UI 组件。两轮对话,交互符合预期。
未知的已知——头脑风暴。提出大略要解决的用户体验问题,并特别要求「基于代码空间实际存在的内容」。代码事实是 AI 宝贵的上下文。以画布引用资产为例:让 AI 摸清交互链路,写几句锐评指出痛点,按投产比给出建议。设计师只需找到共鸣,并决策指导实施。
未知的未知——盲点扫描。接触不熟悉的代码时,让 AI 结合功能目的写下计划,把盲区转化为已知的已知。任务浮窗功能就是这样开始的:先扫描代码库里分散的任务状态(画布生成、超分、资产生成各自为政),再基于扫描结果写 MVP 范围、数据源、边界情况和验收标准。
理解 Vibe 设计语言「微调」
前几个月遇到过很多视觉平衡和对齐问题——按钮两端间距不一致、布局跳变。Vibe coding 时打开 Tailwind 文档窗口边做边学,对精致细节的实现很有帮助。Flexbox 管布局对齐间距,Design Token 管全局变量,组件库管可复用模式——换一种方式去理解 Figma 中的变量、Auto Layout。熟悉之后会发现,Web/AI 产品的实现规则并不复杂,复杂的是愿不愿意在真实约束里抠到一致。
小结
AI 让「成片」变便宜,却让有辨识度的表达变贵。
妙创想做的,是把贵的那部分——风格、节奏、介入时机——设计成系统能力,而不是留给用户和提示词赌博。输入文字谁都会做;难的是让用户觉得自己还在导戏。
读完这篇,如果你也在做 AI 创作工具,可以问自己三个问题:
- 你的功能,默认把控制权放在链路的哪一层?
- 用户是在「解释」,还是在「验收」?
- 风格是单次生成的运气,还是可沉淀的系统参数?
这三条,是妙创从 11 月到如今,一直在用产品回答的设计问题。