【学习笔记】拆解抖音「基地」的 AI 科普视频:暗色 3D 世界、漂浮卡片与一镜到底是怎么做出来的

20 min

整理日期:2026-09-20 调研方式:一手取证——用 SnapAny 解析下载两期最新视频的无水印 2K 原片,ffmpeg 抽帧做接触表 / 关键帧 / 运镜连续帧 / 场景切分 / 响度与频谱分析;账号信息来自抖音网页版主页与百度百科词条。所有数字均为实测,推断处会明确标注。 写作动机:之前梳理过视频制作的一般流程代码生成视频的 skill 全景,理论地图有了,缺一个「现实中的高分样本」来对照。刷抖音时反复被「基地」的 AI 拆解视频击中——它既不是真人口播,也不是常见的 AI 拼贴,而是像「在一件 3D 装置里飞行」的观感。这篇就把这套效果拆到能复刻的粒度。

一、太长不看

「基地」最新 AI 拆解视频的效果,一句话概括:不是在「剪辑」一条视频,而是在一个主题化的暗色 3D 世界里飞行,所有知识内容都是躺在这个世界里的「卡片」。

三个实测支撑:

  1. 视觉系统:每期一个主题化 3D 场景(商业话题 = 黑色电路桌面,芯片话题 = 绿色主板世界),低多边形道具散落其间,信息卡带透视躺在场景里;卡面是严格的组件库设计系统(薄荷绿 + 紫 + 白三色、胶囊标签、大字标题、图表卡、对比面板),15 分钟全程不复用错一个样式。
  2. 运镜:准一镜到底。8 分 20 秒的片子里,场景切分阈值 0.3 下只检出 1 处硬切(430 秒处),放宽到 0.15 也只有 8 处软过渡——转场基本靠相机推拉平移完成。连续帧验证透视严格刚性、卡面中文随卡片一起变换却始终锐利,排除 AI 视频生成,判定为「3D 渲染 + 动画相机 + 卡面贴图」。
  3. 规格:上传原画 2.04 / 2.36 GB(约 33 / 20 Mbps),2K 60fps HEVC——专业渲染工程导出的量级;音频 -19.9 LUFS、响度范围 2.0 LU 的重度归一化混音,BGM 全程铺床。

复刻这件事,签名要素只有三个:固定设计 token 的卡面组件库、暗色 3D 世界、用运镜代替剪辑。路线与可行性见第十节,我认为用现有的代码渲染工具栈(Remotion / HyperFrames + TTS + ffmpeg)能做出「一眼同款」。

二、「基地」是谁

项目信息
账号基地(抖音号 jidifeng),认证「科普自媒体」
数据440.9 万粉丝,获赞 3581.7 万,作品 732 个(2026-09-20 主页数据)
背景2018 年 10 月入驻的老牌科普号(百度百科有词条),早期代表作《代码的世界,列传1》《从历代国手到吴清源到柯洁再到 Alphago》
现在的内容AI 行业事件深度拆解:达里奥联名呼吁限速、超级 AI 夺权路径、苹果 A20 Pro、OpenAI 思维链监控、OpenAI 封杀 Cursor 等,单期 8~15 分钟
其他IP 属地福建,37 岁;简介「数字货币摆脱奴役 / 人工智能摆脱肉体 / 宇宙殖民摆脱旧世界 / 联系 + ♈️ xfengzs」——留微信号引私域,走社群 / 课程变现的典型结构

值得注意的一点:这个账号在全网没有任何专访、团队报道或制作自述,搜索引擎几乎零覆盖。所以下文所有结论都来自对片子本身的取证,能实锤的实锤,不能的标「推断」。

三、分析方法:怎么拿到原片、怎么拆

抖音网页版不登录也能打开视频页和用户主页(会弹登录墙但内容可读),视频 URL 形如 douyin.com/video/<id>。把它丢进 SnapAny 就能免登录解析出无水印直链,提供原画 / 2K / 1080p 多档。我下载了两期:

视频时长下载档位编码
《罕见联手,达里奥带领AI巨头们逼宫白宫》8:202K(29.9 MB)2560×1440 / 60fps / HEVC
《苹果新CEO放开手脚上技术,A20pro芯片推翻10年祖传架》15:382K(69.1 MB)2560×1440 / 60fps / HEVC

然后用 ffmpeg 做了五件事:每 20 秒一帧的 5×5 接触表(整片结构一图看全)、按时间点抽全分辨率关键帧、运镜处的连续帧序列、select='gt(scene,阈值)' 场景切分统计、ebur128 响度与全片频谱图。下文所有定量结论都来自这几组数据。

四、舞台:一个主题化的「3D 信息世界」

先看达里奥那期的全片接触表(从左到右、从上到下,每 20 秒一帧):

达里奥期的全片接触表:暗色 3D 世界中的信息卡序列
达里奥期的全片接触表:暗色 3D 世界中的信息卡序列

能看到几个立刻跳出来的特征:

  • 整条片子共享一个「舞台」:黑色桌面 / 地面上有电路走线般的白色细线,散落着低多边形 3D 小道具——十字螺丝、电容、金手指、垫片、书堆、键帽、薄荷绿霓虹灯管,全部带柔和阴影。
  • 所有内容都是「卡」:大字标题卡、图表卡、插画场景卡,以轻微透视躺在场景里,卡片边缘有一圈白色描边,像真的实体屏幕 / 纸片。
  • 配色纪律严明:背景接近纯黑,内容只用三色——白色(正文与标题)、薄荷绿(强调、标签、进度)、紫色(次级强调)。15 分钟内没见过第四种强调色。

而 A20 Pro 那期,把接触表和上一张并排放:

A20 Pro 期的接触表:同一个系统换上绿色主板世界
A20 Pro 期的接触表:同一个系统换上绿色主板世界

是同一套系统换了主题皮肤:桌面变成一整块绿色主板,SMD 元件铺满地面;卡面组件、配色、字体、运镜语法完全一致,卡内还嵌入了芯片封装的等轴测 3D 渲染(蓝灰金属 + 薄荷绿发光元素)。这说明制作方维护的是一套可换场景的工程,而不是每期从零做——这是高频更新的产能基础。

道具放大后可以确认材质:几何完全笔直、平面着色、干净软阴影,是标准 3D 资产库的质感,没有任何生成式伪影。

五、卡面:一套组件库设计系统

按内容形态,卡面可以归为四类组件,且同类组件跨期跨分钟保持像素级一致的设计语言:

大字金句卡——一行超大号黑体占满卡面,下方一枚圆角胶囊小标签:

薄荷绿大字卡与胶囊标签
薄荷绿大字卡与胶囊标签

开场钩子也用同一语法:扁平矢量插画(Altman 与同行把联名信递向白宫)+ 薄荷绿标签「不给免死金牌」+ 大字「AI就要毁灭世界?」。注意拉丁字符「AI」用的是与中文黑体配套的几何无衬线,中英文字重视觉平衡,这是设计系统里定好的配对,不是随手排的。

图表卡——折线图 / 流程图 / 思维导图,灰线为主、结论节点用薄荷绿或紫色点亮:

双图表卡:各凭本事 vs 坐下来商量行规
双图表卡:各凭本事 vs 坐下来商量行规

对比面板——一张大卡内嵌左右两个子面板做二分论证,中间一枚圆形「?」:

悬崖说 vs 超车说的对比面板
悬崖说 vs 超车说的对比面板

插画场景卡——扁平矢量插画构成的隐喻小剧场:车内第一视角开向悬崖(前面:万丈悬崖 / 后视镜:马上超车)、两人对坐访谈、深夜办公室。人物是插画而非真人,规避了肖像与实拍成本,同时保留叙事感。

这套组件库的价值在于生产效率与观感稳定:文案写成节拍表后,每个节拍从库里挑组件填内容即可;观众看到的永远是「熟悉的语言讲新事件」。

六、运镜:招牌是「准一镜到底」

这是全片最核心、也最容易被观众「说不上来但觉得高级」的部分。传统 MG 科普视频是一个镜头一个镜头硬切(PPT 式);「基地」的做法是给 3D 世界架一台动画相机,转场全靠飞行

实测数据:达里奥期 499.9 秒,场景切分阈值 0.3 下只检出 1 处硬切(430.2 秒处);放宽到 0.15 也只有 8 处。剩下的所谓「转场」,全是相机在卡片之间的推、拉、横移,以及推入某张卡后卡内内容展开成全屏场景(开场车内夜路那段就是推入插画卡内部展开的)。

放在 95 秒处的三张连续帧(间隔约 0.33 秒)验证运镜性质:

运镜连续帧:相机后拉,卡片与道具做刚性透视收缩
运镜连续帧:相机后拉,卡片与道具做刚性透视收缩

三帧里两张卡片(「不是空穴来风」与「先看技术事实」)随相机后拉做严格刚性的透视收缩,桌面螺丝、键帽、霓虹管走精确视差,卡面上的中文大字跟着卡片一起变形却始终锐利无涂抹。这个性质直接排除了 AI 视频生成——生成式模型撑不住 15 分钟连续一致的世界,也做不到中文文字在透视变换下逐帧保持渲染级清晰。结论:真 3D 场景 + 动画相机 + 卡面作为贴图平面(卡面内容本身是预渲染的 MG 动画或设计稿)。

七、规格与声音:专业管线的指纹

画面之外的证据同样能说明生产方式:

  • 上传原画:达里奥期 2.04 GB(8:20,约 33 Mbps)、A20 期 2.36 GB(15:38,约 20 Mbps)。这个码率是渲染工程直接导出的量级——剪映随手导出通常在个位数 Mbps,差一个数量级。
  • 封装:容器 encoder=Lavf58.76.100,即 ffmpeg 封装——至少最后一道工序是脚本化 / 命令行化的,不是 GUI 剪辑软件的直接导出(推断:也可能是平台转码所致,此条证据强度弱)。
  • 响度:全片综合响度 -19.9 LUFS,响度范围 LRA 只有 2.0 LU——从开头到结尾响度被压得极平,是做过归一化母带的配音 + BGM 混音,不是随手铺音乐。
  • BGM:频谱显示 500 秒无一处静音,低频有持续的乐段能量床——铺底音乐全程存在,与人声分开处理(呼应流程笔记里「声音与画面分离处理」那条规律)。
  • 字幕:白色粗黑体、底部居中、烧录进画面,无描边无背景条,与卡片系统的极简风格一致。

八、叙事:模板化的论证结构

两期的叙事骨架完全同构:插画 + 大问句钩子 → 交代事件 → 拆成双论点(悬崖说 vs 超车说,各有章节卡与时间戳)→ 逐层图表推演(算力账单、反垄断豁免、监管俘获)→ 双卡对照收束(「限速 / 巨头的呼吁」vs「停下 / 并非停下」)

这套结构的信息密度靠卡片序列承载,8 到 15 分钟的时长不会散——因为观众始终被相机带着在「论证的地图」上走。另外抖音视频页上的「章节要点 / 内容由AI生成」摘要是平台侧功能,不是作者做的。

九、制作管线还原

把以上证据拼起来,最可能的管线长这样(✅ = 有实测证据,⚠️ = 合理推断):

选题 / 文案        每期一个 AI 行业事件,双论点论证结构模板化            ⚠️
配音 → 节拍表     定稿配音,按句切节拍,对齐卡片序列                    ⚠️
卡面设计          从组件库挑组件填内容(大字卡/图表卡/对比面板/插画卡)  ✅ 跨期样式一致
3D 世界 + 摆卡    主题化场景(黑桌/主板)+ 卡片作为贴图平面             ✅ 两期同系统换肤
相机路径          按节拍表编排飞行动作,转场即运镜                      ✅ 实测准一镜到底
渲染              2K 60fps,原画 20~33 Mbps 量级                        ✅ 文件规格
字幕 / 混音       烧录硬字幕;配音 + BGM 铺床,loudness 归一            ✅ -19.9 LUFS / LRA 2.0
封装上传          ffmpeg 封装后上传                                     ⚠️ Lavf 标签

工具链判断:最贴近的形态是 After Effects(3D 图层 / Element 3D)或 Blender / C4D 建场景与卡片平面、相机动画,卡面内容用 AE 合成或设计导出做成贴图或视频纹理;插画的来源(画师绘制还是 AI 生成后清理)无法从帧上判定。工具名本身是推断,但「3D + 贴图 + 相机」这个架构是实锤的。

十、能否复刻:两条路线与三要素

签名要素只有三个,都可直接工程化:

  1. 固定设计 token 的卡面组件库——三色体系、圆角胶囊标签、大字卡、图表卡、对比面板,做成可复用的模板 / 组件;
  2. 暗色 3D 世界——低多边形道具 + 主题化地面,一次搭建多期复用、按话题换肤;
  3. 用运镜代替剪辑——相机从卡片 A 飞到卡片 B,推入即全屏,这才有「装置感」。

两条实现路线:

  • 真 3D 路线(还原度最高):Blender(Python API)搭场景库,卡面用 HTML/CSS 渲染成贴图贴到平面,脚本按节拍表驱动相机路径,EEVEE 渲 2K60。工程量中等,透视与光影完美。
  • 2.5D 伪 3D 路线(性价比最高):全部用 HTML/CSS perspective + rotateY / translateZ 做卡片透视与分层视差道具,Remotion 或 HyperFrames 把 DOM 逐帧渲染成视频——正好是我代码生成视频 skill 调研里盘过的两条主力管线。配合 TTS + 强制对齐出字幕、ffmpeg 混音归一,就能接到我那套 AI 日报视频化流水线上,做成「md → 节拍表 → 卡片序列 → 相机飞行 → 成片」的全代码管线。

差距主要在资产不在架构:低多边形道具库和扁平插画人物需要用免费资产包拼或 AI 生成后清理。做到「一眼同款」没有障碍;做到他这种 15 分钟连续世界的成熟度,预计要几期迭代。

十一、没搞清楚的事

  • 配音是人声还是 TTS:频谱无法可靠区分。账号 2018 年起就有配音史,可能是本人,但也可能已换 AI 配音(这类账号的常见做法)。需要听感判断,我没有音频理解能力,存疑。
  • 插画与 3D 道具的来源:自绘 / 资产库 / AI 生成后清理,从帧上无法判定。
  • 团队构成:零公开信息。单看产能(高频、15 分钟、双主题世界)不像一个纯单人业余项目,但也没有任何 MCN 或工作室署名可查。
  • 这套风格何时上线、是否自建:主页作品网格翻旧页需要登录,没拿到风格切换的精确时间点。

附录:工具与命令备忘

  • 无水印下载:SnapAny 的「TikTok(抖音)视频图片下载」页,粘贴 douyin.com/video/<id> 即可解析出原画 / 2K / 1080p 直链,免登录。下载直链需要带浏览器 UA 与 referer,大文件用 curl -C - 断点续传(直链有有效期)。
  • 接触表ffmpeg -i in.mp4 -vf "fps=1/20,scale=384:-1,tile=5x5" -frames:v 1 contact.jpg
  • 场景切分统计ffmpeg -i in.mp4 -vf "select='gt(scene,0.3)',showinfo" -f null - 2>&1 | grep -c pts_time
  • 响度ffmpeg -i in.mp4 -af ebur128 -f null - 2>&1 | tail
  • 频谱图ffmpeg -i in.mp4 -lavfi "showspectrumpic=s=1600x700:legend=1:stop=8000" spec.png
  • 分析用的原片与全部中间图在临时目录留存,文中配图版权归「基地」所有,此处为评论性使用的少量截帧。

来源