用 Codex + Remotion 做纸片分层动画:一套可复用的 AI 视频工作流

2026-08-05 0 73

先说结论:纸片风动画的立体感,主要来自素材拆分、前后遮挡和出场节奏。把一张完整画面做推拉,最多得到“会移动的海报”;把背景、人物和前景拆成独立图层,再交给代码控制位置、尺度与时间,画面才会像一组真正叠起来的纸片。

本文根据马叔讲AI在 2026 年 7 月 14 日发布的案例文章重新整理。原案例以唐朝题材为样片,使用 Codex 串联本地工具,用 Imagegen 准备素材,Python 处理透明通道,Remotion 负责动画和渲染,再用 F5-TTS 与 FFmpeg 完成声音和技术验收。下面保留方法论,重新组织叙述,并把它抽象成一套可以迁移到其他题材的 AI 视频工作流。

用 Codex + Remotion 做纸片分层动画:一套可复用的 AI 视频工作流
原文案例中的成片主题画面,图片来源:马叔讲AI原文。

一、先把“纸片感”拆开看

这类视频看起来像纸雕,底层逻辑却很朴素:每个视觉元素都有自己的前后位置和运动速度。远处山水只做缓慢漂移,主角先落到画面里,配角从两侧补进来,前景纸屑或人物负责遮挡边缘。观众看到的立体感,来自这些关系同时成立。

如果背景、皇帝、侍女和群臣都被画在同一张图上,后期只能整体缩放或平移。人物不能单独改朝向,前景也不能临时压住主体,动画很快就会失去层次。反过来,只要素材之间保持独立,复杂度就可以被拆成许多小而明确的控制项。

用 Codex + Remotion 做纸片分层动画:一套可复用的 AI 视频工作流
独立图层、错峰入场和前景遮挡共同构成纸片动画的空间关系。

二、工具分工:让每个环节只承担一种责任

案例没有把所有事情交给一个模型。它更像一条本地生产线:Codex 负责调度,绘图模型负责生成素材,脚本负责整理资产,Remotion 负责把静态素材变成时间轴,音频和媒体工具则负责声音与验收。

工具 在案例中的位置 主要产物
Codex 工作流总控 读取文案、拆分镜头、生成项目代码、执行命令、串联渲染
Imagegen 素材生产 背景底板、唐代人物、宫殿、山水和纸片装饰
Python + Pillow + NumPy 资产整理 检查透明通道、批量抠图、把人物素材表拆成独立 PNG
F5-TTS 旁白生成 根据获得授权的参考音频生成中文旁白
Remotion 动画与渲染 用 React 组件控制图层、入场、镜头、字幕、音乐和音效
FFmpeg / ffprobe 技术验收 检查时长、分辨率和音轨,并抽帧复查成片

这里有两个核心支点。Codex 解决的是“如何把一串工具接成可执行流程”;Remotion 解决的是“如何让每个图层在准确的帧上出现、移动和消失”。前者偏编排,后者偏画面。

用 Codex + Remotion 做纸片分层动画:一套可复用的 AI 视频工作流
角色先组成素材表,再拆成可以独立控制的透明 PNG。

三、先定镜头,再生成素材

案例样片只设置了两个镜头:一个全景,用来交代宫殿、皇帝、侍女和群臣的规模关系;一个特写,把捧礼盒的人推到中心,突出“万邦来朝”的叙事重点。镜头数量不多,反而更容易看出分层是否成立。

先定镜头有一个实际好处:同一个角色在全景和特写里不必使用同一套尺寸、位置与朝向。若先批量生成一堆人物,之后才决定谁是主角,常见结果是比例失衡、人物视线相反,或者关键道具被挡住。镜头草图应该先回答三件事:

  • 观众第一眼应该看见谁?
  • 哪些角色只负责交代规模,不能抢走焦点?
  • 前景要从哪里进入,才能形成遮挡和纵深?

四、背景底板只负责环境

背景底板不要提前塞入人物。它只保留山水、宫殿、城楼、纸张纹理、撕纸边缘、网点、胶带或印章等环境元素。这样做的意义在于,人物之后仍可以自由调整,不会被背景中的重复角色或错误透视牵制。

案例中的两个镜头采用了不同底色:全景偏米白,用来托住金色主体;特写使用大面积深红,把中央礼盒人物从画面里推出来。这不是必须照搬的配色方案,但说明了一个好原则:底板的颜色应该服务于主角的识别度。

五、角色生成要为后期留出接口

“生成一个唐朝人物”还不够。为了让角色能被动画系统接管,提示词需要把几个边界说清楚:时代服饰和发冠、人物完整不裁切、明确身体朝向、白色剪纸描边、单色背景、没有文字水印,也不要把复杂场景一并画进去。

人物素材更适合先做成一张素材表,再用 Python 拆成多张透明 PNG。这样皇帝、捧礼盒的人、跪拜者和侍从都能单独改变位置、宽度、延迟和动作。抠图完成后还要检查头发、衣袖、道具边缘与半透明像素;边缘处理粗糙,白色剪纸描边和投影会把问题放大。

六、静态排版先过关,动画放到第二轮

拿到素材后先把所有人物静止摆好。案例里的排版遵循“主角最大、次要角色居中、后排角色收小”的叙事尺度,而不是让所有人物均匀铺开。静态画面至少要检查:

  1. 主角是否拥有最大的视觉重量;
  2. 配角有没有盖住主角的脸、手或道具;
  3. 人物脚底是否落在同一套可信的地面关系上;
  4. 全景和特写是否各自有清楚的视觉中心。

这一步看似没有动画,却决定了后面所有动画是否自然。画面构图已经混乱时,增加更多缓动曲线只会让混乱移动得更顺滑。

七、用不同节奏给不同图层动画

可以把人物分成主角、次要角色和后排角色三类,再给背景与前景单独设定节奏:

层级 动作策略 叙事目的
背景层 极慢的漂移或推镜,幅度很小 让画面持续呼吸,不抢主体
后排层 小幅移动、较低透明度、较晚补齐 交代规模,维持空间深度
主体层 更明显的位移、缩放和落地感 建立视觉中心
前景层 从近处进入,速度略快并形成遮挡 制造纸片叠放的纵深

入场不要同时发生。用 delay 先让主角出现,再让次要人物从两侧补入,最后让后排群像填满空间。入场完成后保留很轻的上下浮动,画面会比“出现即静止”更有生命力。

图层顺序也要明确:背景底板、后排人物、中排人物、主角、前排人物,最后是字幕和装饰。每一层使用独立的 zIndex,再统一加纸片边缘和浅色投影。这个案例说明,二维遮挡关系已经足以产生立体错觉,不必先引入复杂的三维场景。

用 Codex + Remotion 做纸片分层动画:一套可复用的 AI 视频工作流
全景镜头用主次尺度和透明度交代盛唐长安的空间规模。

八、声音决定镜头的呼吸

画面大致完成后,再按旁白长度调整镜头时长。旁白每段对应一个 WAV,决定镜头应该停留多久;背景音乐循环播放,但音量要退到人声下面;章节切换可以用 impact 或 riser,主角入场用较重的 impact,次要人物使用 whoosh,后排则用更轻的 tick。

字幕只保留一层,固定在底部逐句跟随旁白,避免与画面内部的文字争夺注意力。声音应当帮助观众理解画面何时建立、何时转场、何时完成,而不是单纯填补空白。

用 Codex + Remotion 做纸片分层动画:一套可复用的 AI 视频工作流
特写镜头用中央主体与前后遮挡突出叙事重点。

九、把验收放进流程,而不是留到最后碰运气

在 Remotion Studio 中逐帧检查时,重点看以下问题:人物有没有被裁掉,朝向是否正确,主次尺寸是否拉开,遮挡顺序有没有反,入场有没有错峰,音效是否落在对应帧上。确认画面后,再用 FFmpeg 或 ffprobe 检查最终文件的时长、分辨率和音频轨道,并抽取若干帧复查。

“能渲染出来”只是完成了技术链路,不能说明成片已经可用。分层动画常见的问题往往出现在最后几秒:一个前景角色穿过主角的脸、一个透明边缘在缩放时露出色块,或者旁白已经结束而镜头仍停留在原地。把这些检查写进工作流,比依赖最后一次肉眼扫片更可靠。

十、可迁移的完整流水线

  1. 确定文案与镜头:先定义每个镜头的叙事目的和视觉中心。
  2. 生成背景底板:只画环境,不提前粘入人物。
  3. 生成角色素材表:把人物朝向、完整度、背景和描边要求写进提示词。
  4. 拆分透明资产:用 Python 抠图并检查边缘,得到可独立控制的 PNG。
  5. Remotion 静态排版:先解决大小、位置、地面和遮挡关系。
  6. 分层设置动画:按主角、次要、后排和背景分别设置位移、缩放与 delay。
  7. 加入旁白与声音:用旁白确定镜头长度,再补音乐、章节音效和入场音效。
  8. 预览、抽帧、渲染:先逐帧查画面,再做技术验收,最后输出 MP4。

这套方法并不依赖唐朝题材。历史人物、知识科普、商业故事、城市变迁,只要能拆成背景、主体、配角和前景,就可以沿用同一套思路。它的核心不在于让模型一次生成一条“完整视频”,而在于把视觉叙事拆成可检查、可复用、可重新组合的资产和时间关系。

适用条件与需要留意的边界

  • 适合:有明确脚本、希望保持统一画风、需要反复修改镜头或批量生成相近视频的个人创作者和小团队。
  • 不适合直接照搬:人物动作极其复杂、需要真实三维交互、或者必须保证历史服饰与细节完全考据的项目,仍需要更专业的资产与制作流程。
  • 声音授权:使用参考音频进行声音克隆前,应取得本人明确授权,并确认发布范围与保存方式。
  • 商业使用:Remotion、模型、字体、音乐和素材各有许可条件,商用前应逐项核对,不能因为素材是本地生成就默认没有授权问题。
  • 案例边界:本文讨论的是一条案例工作流,不把原文中的制作结果当作普遍性能或效率承诺。

常见问题

一定要用 3D 软件才能做出立体感吗?

不一定。对于纸片风、剪纸风或拼贴风画面,透明图层、zIndex、遮挡、缩放和错峰入场已经能提供足够的空间暗示。只有当镜头需要真实透视变化、连续旋转或复杂碰撞时,才有必要引入更重的三维方案。

为什么不先把所有人物生成出来,再慢慢想镜头?

因为镜头会反过来决定人物的尺寸、朝向和遮挡关系。先定镜头,能把生成任务限制在明确的构图里,也能减少后期发现主次不对时的返工。

Imagegen 可以换成别的绘图工具吗?

可以。工具名称不是这套方法的关键,关键是能否稳定产出完整人物、明确朝向、干净背景和可处理的边缘。只要素材最终能拆成独立透明层,就能接到后面的 Python 和 Remotion 流程里。

参考资料

  1. 马叔讲AI:用 Codex + Remotion 做一条唐朝纸片分层动画(原文,2026-07-14)
  2. OpenAI Help Center:OpenAI Codex CLI – Getting Started
  3. Remotion:用 React 以编程方式制作和渲染视频
  4. SWivid/F5-TTS:官方代码仓库与推理说明
  5. FFmpeg Documentation:媒体转换与视频抽帧
收藏 (0) 打赏

感谢您的支持,我会继续努力的!

打开微信/支付宝扫一扫,即可进行扫码打赏哦,分享从这里开始,精彩与您同在
点赞 (0)

Ai篮网 应用案例 用 Codex + Remotion 做纸片分层动画:一套可复用的 AI 视频工作流 https://ailantuw.com/255.html

常见问题

相关文章

猜你喜欢
发表评论
暂无评论
官方客服团队

为您解决烦忧 - 24小时在线 专业服务