为什么我们决定把导演经验做成一个 AI Skill
我们不是在教 AI 写 Prompt,而是在尝试教 AI 像导演一样思考。
这句话,是过去一年里我们在反复打磨一个叫 MadStory 的项目时,逐渐清晰起来的一个认知。它不是一句营销口号,而是我们踩了很多坑之后,终于想明白的一件事。

今天想完整地把这个思考过程分享出来。
一、AI 视频爆发的一年,但很少有人讨论导演
把时间拨回 2024 年初。
OpenAI 用一段名为 Sora 的演示视频,把整个内容行业炸开了。人们看到一段一分钟的视频——东京街头,一个女士穿着皮衣在走,镜面水洼里倒映着霓虹——然后被告知,这是 AI 生成的,没有摄影机,没有演员,没有剧组。
恐慌和兴奋同时到来。
接下来的一年,模型迭代的速度超出了所有人的预期。Runway 推出了 Gen-3,可灵(Kling)证明了国产模型的实力,字节跳动的 Seedance 在运镜的物理感上做到了令人惊讶的连贯,Google 的 Veo 也在不断逼近电影级质感。到今天,任何一个普通人,只要愿意花几分钟注册一个账号,就能生成一段 5 秒到 15 秒的、画质堪比院线的视频片段。
模型越来越强,参数越来越大,能生成的时长越来越长,分辨率越来越高。
但在热闹的模型竞赛之外,有一个现象一直困扰着我。
我观察了大量 AI 视频作品,参加了几十个创作者社群,看了上千条用 AI 生成的短片、广告、短剧。我发现一个共同的问题:绝大多数 AI 视频,都停留在"漂亮画面"这个层级。
它们好看。光线对,色彩对,构图也挑不出什么大毛病。但你看完之后,心里什么都没有留下。
它没有叙事的张力,没有情绪的弧线,没有一个让你"想知道接下来发生什么"的钩子。它是一组精致的画面素材,而不是一个作品。
我一开始以为是模型还不够强。等模型再迭代几个版本就好了,很多人这么说。
但后来我慢慢意识到,问题可能不在模型。
视频生成越来越容易,但好内容依然稀缺。这中间缺的那一环,不是算力,不是数据,而是导演。
这一年里,所有人都在讨论模型。参数、帧率、生成时长、物理一致性。但几乎没有人讨论:当人人都能生成画面的时候,谁来决定"拍什么"和"怎么拍"?
这是一个比模型本身更本质的问题。
二、一次真实的挫败感
讲一个我们团队真实经历的事。
去年下半年,我们接到了一个品牌短片的案子。客户想要一支 15 秒的电影感视频,主题是"城市夜归人"。按照以往的流程,我们会找导演、写脚本、画分镜、组剧组、拍摄、后期。
但这一次,我们决定全程用 AI 来做。毕竟,工具都已经这么强了。
第一周,我们信心满满。
团队里有人负责写 Prompt。他在参考了大量教程之后,写了一段 300 多字的提示词,从主体描述到环境氛围,从光线方向到色调风格,从运镜方式到镜头节奏,事无巨细地铺了进去。我们觉得这段 Prompt 简直可以拿去当教科书。
然后我们把 Prompt 喂给了模型。
生成出来的画面,说实话,挺好看的。霓虹灯、湿漉漉的街道、一个模糊的人影走过。光影考究,质感细腻。
但我们看了三遍之后,团队里有人问了一句:"它想表达什么?"
没人答得上来。
画面里的人走在街上,镜头跟着他。然后呢?他在做什么?他的情绪是什么?观众为什么要看这段视频?我们想传达的品牌信息,到底在哪?
我们开始改 Prompt。加更多描述,调整措辞,换关键词。Prompt 越写越长,从 300 字涨到 500 字,再到 800 字。我们甚至建了一个共享文档,专门收集和优化"好用的 Prompt 模板"。
但结果却越来越随机。有时候碰运气生成出一段还不错的,但我们不知道为什么这次好、上次差。改一个词,结果天差地别。
整整折腾了两周,我们废弃了上百条生成结果。
最后那个案子,我们妥协了。从一堆"漂亮但没有灵魂"的画面里,挑了几条相对能用的,拼在一起交了差。客户没说什么,但我知道,这不是我们想要的东西。
复盘的时候,我问团队一个问题:"我们到底卡在哪了?"
有人说,是模型不够稳定。有人说,是 Prompt 没写好。有人说是参考图选得不对。
但我心里隐隐有一个不同的答案。
那天晚上我一个人在办公室,重新看了那些被废弃的画面。我突然意识到:这些画面之所以空,不是因为它们不够美,而是因为它们没有"意图"。
每一个镜头都只是"一段好看的画面"。但我们从来没有真正想清楚:这个镜头为什么要存在?它在整个叙事里承担什么功能?它应该让观众感受到什么?
我们一直在写"画面里有什么",却从来没有回答过"为什么是这个画面"。
问题不是 Prompt 写得不够好。问题是,我们在用一种描述性的方式,去试图完成一件需要判断力的事情。
我们缺的不是更好的提示词。我们缺的是一个导演。
那一刻,这个项目的种子就埋下了。
三、导演到底在做什么
在影视工业里,导演是整个创作的核心。但"导演"这个词,对大多数非行业的人来说,其实是一个非常模糊的概念。
人们以为导演就是喊"Action"和"Cut"的人。或者以为导演就是那个"有想法"的人。
但在真正接触了专业导演的工作流程之后,我发现,导演本质上不是在做创作,而是在做决策。

一个导演在片场,或者说在前期的筹备阶段,他脑子里其实在不停地回答一连串的问题:
这个故事的内核是什么?是关于孤独,还是关于抗争,还是关于一个品牌想要传递的某种态度?
这个主角是谁? 他的性格、他的处境、他此刻的情绪状态是什么?观众要如何与他建立共情?
这一场戏的情绪曲线是什么?从哪里开始,到哪里转折,到哪里收束?节奏是快的还是慢的?
这个镜头为什么要用特写而不是全景? 因为这是一个情感爆发的瞬间,我们需要让观众看到角色的眼神。还是因为这是一个交代环境的镜头,我们需要让观众建立空间感?
为什么这里的运镜是缓慢推进而不是快速摇移? 因为这是一个压抑的、积攒情绪的段落,镜头的运动要服务于这种"慢慢收紧"的感觉。
为什么这里的灯光是冷色调,而下一场突然变暖? 因为情绪在转变,灯光是叙事的一部分,不是装饰。
为什么这个瞬间要配上一个低频的沉闷音效? 因为声音是一种潜意识的引导,它比画面更早地抵达观众的神经系统。
你看,导演做的每一件事,都是一个有明确理由的选择。
他不是在描述画面。他是在为一个又一个问题,做出服务于整体叙事意图的决策。每一个镜头的构图、运镜、光影、声音,都是这些决策的下游产物。
这就是为什么,一个专业导演拍出来的东西,和一个业余爱好者拍出来的东西,即使用的是同一台摄影机、同一个场景、同一批演员,结果会天差地别。
差距不在工具,而在那个一直在做判断的大脑。
而我们之前在用 AI 做视频时,犯的根本错误就在这里——我们把自己当成了"描述画面的人",而不是"做决策的人"。我们在堆砌形容词,而不是在做选择。
导演不是在写 Prompt。导演是在做决策。
这句话,是我整个思考过程里最重要的一次顿悟。
四、MadStory 的诞生
想明白这件事之后,接下来的问题就变成了:我们能不能把"做决策"这件事,拆解成一个 AI 可以理解和执行的流程?
这就是 MadStory 的起点。
我们没有从写代码开始。我们做的第一件事,是找来了几位真正在行业里做过导演、摄影指导、剪辑师的人,坐下来,花了很多时间,聊一个问题:你们在接到一个案子之后,脑子里到底在想什么?从第一秒到最后一秒,你们的思考顺序是什么?
我们把这个过程一层一层地拆。拆到最后,我们发现导演的思维流程,其实可以归纳成一条清晰的链路——在我们的系统里,它最终被拆成了八个阶段,从零数到七。但我不想在这里念设计文档。我想讲的是,这条链路的核心逻辑是什么。
它大概是这样的:
先搞清楚要做什么。这是最开始的一步,在我们系统里它叫"模式选择与意图澄清"。它逼着你回答:你是要卖一个产品,还是要讲一个品牌故事?你的观众是谁?你想让他们产生什么反应?很多人在这一步就会发现自己其实没想清楚——而这恰恰是大多数 AI 视频失败的根源。我们最早的设计里,试图跳过这一步直接出结果,后来发现不行。这是地基。
然后锁定核心创意。 明确了意图之后,要回答下一个问题:你的主体是什么?这个镜头里唯一要传达的信息点是什么?这里有一条我们踩了很多坑之后定下的硬规则——一个镜头只做一件事。因为当你在 15 秒里试图塞进三个信息点的时候,观众一个都记不住。这是导演的经验,不是模型的经验。
接下来是一连串更细的追问。 时间怎么分配,节奏怎么走,哪里是关键帧?画面怎么构图,主体放在哪,用三分法还是对称?镜头怎么动,为什么这么动?光从哪来,为什么要这个色温?声音怎么配,BGM 的情绪是什么?
这些问题里,有两个特别容易被忽略,但恰恰是区分"画面"和"作品"的关键。
一个是镜头运动。我们反复强调一个原则:镜头运动必须服务于叙事动机,而不是为了炫技。一个缓慢的推镜头,是因为情绪在收紧;一个快速的摇移,是因为节奏在爆发。系统会给每一个镜头标注一个"运动强度",让你明确知道这个镜头的"能量级别"。这不是装饰参数,这是一个叙事判断的外化。
另一个是声音设计。这是最容易被丢掉的一环。很多人做完画面才随便配个音乐。但声音不是画面的附属品,它是叙事的另一半。一个好的声音设计,能在画面还没出现之前,就先在观众心里铺好情绪的底色。
这些问题串起来,就形成了一条从"模糊想法"到"可执行分镜方案"的完整链路。每一个环节都对应着导演在真实工作中要做的一个决策。
我没有发明新的方法论。我们做的事情,是把一套被验证了几十年的工业流程,用 AI 能理解的方式重新结构化了一遍。
这中间当然经历了大量的试错。最初的版本,我们试图让系统一次性输出所有内容,结果一团糟。后来我们改成逐阶段推进——每完成一个环节就停下来给你看当前的草案,让你确认或者修改。这更接近真实导演的工作方式——他也不是一拍脑袋就想好所有事情,而是在不断的来回讨论中,逐步把方案打磨出来。
我们还设计了一套"质量门禁"。让我说一个最典型的:在我们系统里,不管你用的是哪种模式,只要一个镜头里混入了两种以上的运动,系统会直接判定不合格。因为一个镜头只承载一个意图,这是电影语言的基本功。这些门禁不是我们拍脑袋定的,每一条背后都是踩过的坑。

MadStory 不是在帮你写 Prompt。它是在模拟一个导演,陪你做完一次完整的创作决策。
这一点,是它和市面上其他工具最本质的区别。
五、从 Prompt 工程到导演工程
做完 MadStory 的第一个版本之后,我对"AI 创作"这件事的理解,发生了一次根本性的转变。
过去一年,"Prompt 工程"这个词被提了无数次。无数教程、课程、模板在教你怎么写更好的提示词。人们相信,只要 Prompt 写得足够好,AI 就能生成足够好的内容。
但我们的实践告诉我,这条路是有天花板的。
因为 Prompt 工程,本质上是一种描述能力。你在描述你想要的画面。但描述得再精确,你也只是在告诉 AI"画面里应该有什么",而不是"这个画面为什么应该存在"。
而真正决定一个作品好坏的,从来不是描述的精确度,而是判断力。
为什么用这个焦段而不是那个焦段?为什么这个段落要慢下来?为什么这里的情绪要从压抑转为释然?这些是需要判断的,不是需要描述的。
所以我认为,随着 AI 工具的成熟,一种新的能力会变得越来越重要——我把它叫做"导演工程"(Director Engineering)。
它的核心不是"怎么写提示词",而是"怎么驾驭叙事"。
未来真正优秀的 AI 创作者,可能不是那个 Prompt 写得最华丽的人,而是那个最懂得如何讲故事、如何调动情绪、如何用镜头语言传达意图的人。
模型会越来越强。它会越来越擅长理解你的意图,越来越擅长生成你想要的画面。但它不会自己长出"导演思维"。因为导演思维不是一种生成能力,而是一种决策能力。它需要有人告诉它,每一个选择背后的"为什么"。
Prompt 工程教 AI 听话。导演工程教 AI 懂事。
这是一个从"执行"到"判断"的跃迁。
而这恰恰是当下 AI 视频创作领域最大的认知盲区。太多人还在卷 Prompt 的长度和精细度,却忘了问那个最基本的问题:这个故事,到底值不值得讲?
六、MadStory 只是开始
我必须诚实地承认,MadStory 现在的版本,离"替代导演"还差得很远。
它做的事情,是在创作者和模型之间,架了一座导演思维的桥。但这座桥还有很多不完善的地方。有些复杂叙事场景,它的推导还不够细腻;有些创作意图,它理解得还是不够准确。短剧的跨集一致性、复杂的多线叙事、微妙的情绪转折,这些都是我们还在持续攻克的难题。
它是一个探索,不是一个成品。
但它的方向,我是确定的。
因为我们看到的趋势很清晰:AI 正在逐步接管影视工业里的每一个环节。
今天,我们有了 AI 分镜设计(MadStory 所做的)。明天,我们会看到 AI 摄影指导,它能根据叙事意图,自动给出最优的焦段、机位和运镜方案。会有 AI 剪辑师,它懂得蒙太奇的节奏,知道在哪里切一刀,在哪里留三秒。会有 AI 制片人,它管预算、排档期、协调资源。
最终,这些角色会串成一条完整的 AI 影视制作流水线。从一句话,到一部作品。
但无论流水线多么完整,无论模型多么强大,有一件事始终不会改变。
每一个镜头背后的"为什么",永远需要一个人来回答。
那个回答"为什么"的人,就是导演。无论他坐不坐在监视器后面,无论他手里的工具是摄影机还是 AI。
技术会越来越便宜,模型会越来越强,工具会越来越普及。但讲故事的能力——那种知道什么时候该犹豫、什么时候该沉默、什么时候该爆发、什么时候该用一个特写直击人心的能力——它不会因为技术的进步而贬值。
它会因为技术的进步,而变得更加稀缺,更加珍贵。
我们做 MadStory,不是为了取代谁,也不是为了卖一个产品。我们只是想试着回答一个问题:当 AI 接管了所有的"怎么做",人类的"为什么"应该怎么传承下去。
我们还没有完整的答案。但我们相信,这个问题的方向是对的。
写下这篇文章的时候,我们还在继续迭代。每一天都在和模型、和创作者、和那些"好看但空洞"的废稿较劲。
这个过程不轻松。但每当看到一个创作者,用了这套流程之后,第一次生成出一个"有意图、有情绪、有灵魂"的画面,我就觉得,这件事值得做下去。
因为我们相信一件很简单的事:
AI 或许会重构影视工业,但真正值得被保存下来的,始终是人类讲故事的能力。
MadStory v3.4.1 是一款电影级影视分镜设计引擎,支持多平台视频生成(Seedance / Runway / Kling / Sora)及图片生成(Seedream 4.x/5.x)。能将模糊的电影构思,通过 8 阶段专业推导流程,逐步转化为包含构图、运镜、光影、声音等全维度细节的专业分镜提示词。
开源地址>> https://github.com/qomob/madstory
更多推荐



所有评论(0)