不整虚的,今天直接拆解一条 60 秒竖屏短视频的实操全过程。

从写脚本、拆分镜、跑画面,到配音和自动合成,所有能直接套用的核心参数和避坑点全部公开。

做短视频最让人崩溃的,其实不是想选题。

而是后面那一堆琐碎的体力活:写完口播要拆镜头,拆完镜头要满世界找素材,接着配音、对字幕、调音量,最后还要防着字幕被平台的点赞图标遮挡。这一套流程走下来,两三个小时就没了。

所以,最务实的策略是:先别急着追求什么“全自动爆款”。

我们先用工具把整套管线从 0 到 1 跑通。

只要这个底层流程通了,以后你只需要换个脚本,整套自动化渲染就能直接复用。

1. 规范项目目录,这是自动化的前提

第一步看似不起眼,但相信我,不做好这一步,后面代码读取路径时绝对会疯狂报错。

在本地新建一个项目文件夹,名字用英文和数字:

codex_video_demo_001

在里面雷打不动地建立 6 个子文件夹:

  • script:放口播文本,比如 main_v1.txt
  • storyboard:放分镜数据,比如 storyboard_v1.json
  • pic:放画面素材,比如 001.png012.png
  • audio:放配音音频,比如 voice.wav
  • bgm:放背景音乐,比如 main.mp3
  • output:放最终成片,比如 final_1080x1920.mp4

避坑点:千万别用“最终版”、“绝对不改版”这种中文命名。后续用代码或工具链自动读取时,中文路径和特殊字符极易引发编码报错,折腾半天全是无用功。

2. 锁定视频基础参数

在动手制作之前,先把视频规格标准化。

我们直接按抖音、小红书、视频号通用的 60 秒竖屏规格来定:

项目 建议参数 备注说明
画面比例 9:16 竖屏主流平台通用标准
分辨率 1080 x 1920 确保清晰度,别用 720P,会被平台限流
帧率 30 FPS 知识、口播类视频的黄金帧率
时长 测试 30 秒 / 正式 60 秒 新流程建议先用 30 秒跑通测试
视频码率 6000 - 8000 kbps 兼顾画质与文件体积
编码格式 MP4 / H.264 / AAC 平台兼容性最好,上传不卡审
字幕位置 底部居中,距底边 180 px 避开各平台的点赞、评论按钮区
字幕字号 52 - 64 px 确保在手机小屏幕上不费眼睛

前期千万别想着横屏、竖屏一起做,光是调整构图和转场就能把你折腾到放弃。

先死磕竖屏,跑顺了再说。

3. 构建口播脚本:别指望 AI 一次写对

短视频口播最忌讳自嗨。60 秒的视频,字数必须死死卡在 180 到 220 字之间。字数再多,语速就得像机关枪,观众听着极度焦虑。

你可以直接把这段指令丢给 AI 助手:

我需要制作一条 60 秒的竖屏短视频,投放在抖音和小红书。
目标受众:想用 AI 工具做自媒体的新手。
视频主题:个人如何利用 Codex 跑通短视频制作流程。
具体要求:
1. 开头 3 秒内必须直击痛点,抓住注意力。
2. 正文字数控制在 180 至 220 字之间。
3. 语言口语化,严禁使用“首先、其次、综上所述”等书面套话。
4. 每 8 到 12 秒输出一个核心信息点。
5. 结尾给出明确的互动或行动引导。
请按“时间轴 + 口播正文”的格式输出。

真人经验:AI 第一次出来的东西通常有一股浓浓的“翻译腔”或“公关味”。

你得继续调教它:“请精简至 180 字,多用短句,把‘不仅...而且...’这种词删掉,用人话再写一遍。”

口播的核心是“听起来像朋友聊天”,而不是在念产品说明书。

4. 将脚本转化为结构化分镜

口播文案敲定后,别盲目去搜图,先拆解成标准分镜。

经验参数是:30 秒视频拆 8 个镜头;60 秒视频拆 12 到 15 个镜头。每个镜头时长控制在 3 到 5 秒,转场时间设为 0.3 到 0.5 秒。

推荐使用 JSON 格式来保存分镜,后续对接图片生成或剪辑工具时非常稳定。

单个分镜的数据结构如下:

{
  "shot": 1,
  "duration": 4,
  "voiceover": "很多人不是不会做短视频,是卡在流程太碎。",
  "visual": "一个人面对电脑,屏幕上是脚本、图片、音频、剪辑软件",
  "subtitle": "不是不会做,是流程太碎",
  "camera": "slow zoom in",
  "sfx": "soft click",
  "image_prompt": "3d style, blue and white tech background, a person looking at computer screen, video editing software open"
}

你可以使用如下指令让 AI 批量拆解:

请将上述口播脚本拆解为 12 个分镜。
每个分镜必须包含以下字段:shot、duration、voiceover、visual、subtitle、camera、sfx、image_prompt。
确保所有分镜的 duration 累加值正好等于 60 秒。
单个镜头时长控制在 3 至 5 秒之间。
画面风格设定为:3D 科技感、干净背景,适合知识科普。

这里有个大坑:所有镜头的时长总和,必须与你后面合成的音频时长完全对齐,否则音画不同步,后期调起来能让你抓狂。

5. 批量生成画面素材

有了分镜表,就可以提取 image_prompt 字段批量绘图了。

为了让教程更接近真实的开发环境,本文采用 iThinkAPI 作为演示环境。它非常适合用来做多模型聚合调用,在开发过程中可以根据任务需要切换不同的底层推理模型。

在 Codex 或其他支持 OpenAI Compatible API 的工具里,配置时主要关注三个字段:Base URL、Key 和 Model。

固定配置块如下:

Base URL:https://token.ithinkai.cn/v1
API Key:YOUR_API_KEY
Model:以服务文档为准,最新模型 gpt-5.5、claude-opus-4-8、gpt-image-2 等可按文档查看;涉及图片生成时,以 0.05¥/图起、2k/4k 支持等服务文档说明为准。
第一步:打开 iThinkAPI

第二步:挑选模型与确定分组

进入控制台的模型广场,用 imagegptclaude 搜索模型,确认模型对应分组。

确认模型后,需要查看并选择对应的分组或线路。

第三步:创建令牌

进入控制台,打开令牌管理,添加令牌,绑定第二步选中的分组。

回到 Codex 的配置界面,填入对应的 Base URL、Key 以及 Model 名称(比如支持高分辨率生图的 gpt-image-2),测试连接成功后再开始使用。

实操细节:批量出图最怕风格分裂,第一张是写实风,第二张变成了二次元。

在提示词后面必须死死锁住统一的风格词,例如:3d style, clay material, vibrant colors, clean background

生成的图片严格按 001.png002.png 顺序命名,存入 pic 文件夹。

6. 配置配音与背景音乐

配音的质感直接决定了视频的完播率。

很多人用 AI 配音,听起来一股“客服腔”或“营销号味”,让人一秒就想划走。

在配置音频合成时,推荐使用以下参数组合:

音频项 推荐参数 参数说明
人声类型 自然男声/女声 避开过于生硬或夸张的播音腔
语速倍率 1.05x 略快于常速,保持信息紧凑度
音高调节 0 (默认) 保持声音自然度
断句停顿 0.25 - 0.35 秒 给观众留出消化信息的时间
采样率 44100 Hz 满足主流平台的高清音频标准
BGM 音量 比人声低 30% 宁小勿大,绝不能喧宾夺主
淡入淡出 首尾各 1.0 秒 避免声音突兀出现或中断

实操建议:在合成时,先单独导出并试听人声轨(voice.wav),确认多音字、儿化音没有读错(比如 Codex 别读成奇怪的音译),确认断句和语气没问题后,再混入背景音乐。

如果一开始就混在一起,后期发现配音有错,修改起来会非常麻烦。

7. 使用 HyperFrames 自动化合成视频

当脚本、分镜、图片、配音和 BGM 全部准备就绪后,即可调用 HyperFrames 剪辑引擎进行组装。

合成配置参数如下:

  • 画布尺寸:1080 x 1920
  • 输出帧率:30 FPS
  • 字幕字号:58 px
  • 字幕位置:底部居中,距底边 180 px(完美避开平台交互区)
  • 字幕背景:黑色半透明(35% 不透明度),提升文字识别度
  • 镜头动效:每张静态图片设置 4% 的缓慢推拉(Ken Burns 效果),增加画面呼吸感,不至于像在放 PPT
  • 转场效果:0.4 秒淡入淡出
  • 编码格式:H.264 MP4

你可以向合成引擎发送如下指令:

请创建 HyperFrames 视频工程。
读取 storyboard/storyboard_v1.jsonpic/ 目录下的图片、audio/voice.wav 以及 bgm/main.mp3
设置画布为 1080 x 1920,帧率 30 FPS。
每个镜头的展现时间严格对齐 storyboard 中的 duration。
为图片添加 4% 幅度的轻微推拉动效。
字幕底部居中,字号 58px,白字,带黑色半透明背景框。
镜头转场统一使用 0.4 秒淡入淡出。
最终渲染输出至 output/final_1080x1920.mp4

8. 预览与排错的“四不改”原则

第一版 Demo 出来后,千万别凭感觉瞎改。

对照以下清单,重点排查这 4 类核心问题:

  • 字看不清:别去调字体,直接将字幕字号从 58px 调大至 64px,或者把背景遮罩调深。
  • 听不清人声:不要去拉高人声音量,直接把背景音乐音量整体降低 15% - 20%。
  • 画面太死板:检查静态图片是否漏掉了 4% 的缓慢推拉动效。
  • 音画不同步:重新核对分镜 JSON 中的 duration 是否与 voice.wav 的实际停顿点对齐。

对于第一条测试视频,整体修改控制在 3 轮以内。

第一轮通读流程,第二轮微调音画,第三轮确认封面直接导出。过度纠结细节容易陷入“完美主义陷阱”,极其消耗创作热情。

总结:赶紧去试,有问题评论区见

别等把所有的 AI 工具都研究透了才开始动手。

今天就挑选一个你最熟悉的主题,按照这个流程完整走一遍。

第一条视频不求完美,重点在于跑通闭环

一旦整套管线运转起来,你后续的创作就会变得极其轻松:你只需要专注于选题和脚本,而那些繁琐、重复、容易让人拖延的剪辑与后期工作,全部可以交给这套标准流程来自动处理。

代码和配置文件模版我放在后台了,回复 Codex 自取。

自己去跑一遍,比看十篇教程都强。

更多推荐