一段需求换来一部 37 分钟的诺奖科普片

片里没有一张 AI 生成的图。错是一层层查出来的,最后几样还得靠人

左蓝右橙两只发光的手隔着一条镜面虚线,下面压着片名伸出你的手
图 1 成片封面。开场请观众伸出自己的手,2026 年有三项奖都能在这只手上找到

今年 10 月,诺贝尔奖还在一项项公布的那一周,我把下面这段话贴给了 Claude Code。

帮我深度调研一下近三年所有获得诺贝尔奖的项目,并按规律依次排列,做成一个科普短片。

  1. 每个诺奖项目用 2 分钟,做成可视化的图解视频,通俗易懂,让中学生都能听明白。三年内大概有多少个诺奖,你先统计一下
  2. 整个视频要达到诺奖级别的水准,如果设一个视频科普奖,这个视频得能获奖
  3. 请打开脑洞,做好深度调研、深度思考和深度设计后再动手制作。这是一个长程任务,务必思考周全再开始
  4. 如果需要旁白,使用克隆声音

它先数了一遍。诺贝尔奖每年六个,2024 到 2026 年一共 18 个,当时已经公布了 16 个,2026 年的和平奖要等 10 月 9 日,经济学奖要等 10 月 12 日。然后它问了我两个问题。年份我照它推荐的选了 2024 到 2026。类别那一题,它推荐只收物理、化学、医学三类科学奖,一共 9 项,片长约 22 分钟。选项说明里它把理由写在了前头,「文学和和平奖没有『机制』可以图解,只能讲人物和故事,风格会断层。和平奖政治敏感度也高」。

我选了六类全收。

从贴出需求到母版渲完,一共 19 小时 16 分钟。除了那段需求和这两个选择,我只说过三句话。一句是告诉它,remotion-video 这个 skill 达不到它设想的效果就可以弃用。另外两句都是「继续做诺奖片」。最后我拿到的片子长 37 分 13 秒,开场之后是 18 站,再接尾声,每站两分钟上下,旁白是我自己的克隆声。

这 19 个小时里发生过什么,项目里留着会话记录、核查记录和审片报告,下面的数字都出自这些记录。

十八个奖排成一条从原子到星系的路

我写的「按规律依次排列」其实很含糊。它的答案在开工 12 分钟后就写进了给调研员的说明。整片不按年份排,按研究对象的尺度从小到大排,量子、分子、细胞、大脑、机器、个人、社会、世界、宇宙,每个调研员都要交出自己那项奖的「特征尺度」。

这样排下来,第一站是 2025 年物理奖的量子芯片,原子尺度的规则长在一块一厘米的芯片上。最后一站是 2026 年物理奖的冰立方,在南极冰层下捕捉从几十亿光年外飞来的中微子。头尾之间隔着 35 个数量级。文学奖放进「一个人」那一幕,经济学奖与和平奖放进「人群」。记录里看不到它比较过别的排法,按年份排只在旁白里出现过一次,当作反衬,「按年份讲,它们是十八个互不相干的名字」。

18 站按研究对象的尺度从小到大排列,分成看不见的世界、生命与心智、一个人、人群、宇宙五幕,右侧标出每站在 10 的负 10 次方米到 10 的 25 次方米之间的位置
图 2 18 站的站序。右侧是每站在尺度上的位置,单位是米,对数刻度。虚线圈是 2026 年经济学奖,成片时还没有公布

开场把这条路接到观众身上。旁白先请你伸出两只手,手心朝下叠起来,大拇指对不上。左右手互为镜像,却怎么也叠不到一起,很多分子也分左右手,这是 2026 年的化学奖。再看手掌。就在这一秒,有几百亿个中微子从太阳飞来,穿过你的一片指甲,诺奖官网的科普页给的数是每秒约 650 亿个。冰立方追的是来自宇宙深处的高能中微子,太阳中微子在这里只负责让观众感到「穿过」这件事。调研档案专门提醒过两者不能混为一谈,旁白也是分两句说的。最后动一动手指,大脑里一群神经元刚刚放电,用光开关神经元是 2026 年的医学奖。三项奖在一只手上碰头,尾声再回到这只手。

配乐跟的也是这条规律,尺度越大,音越低。小东西振动得快,声音高,大东西低沉。开场的四个音 F、A、C、E 往上走,紧接着它的镜像 F、D、降 B、G 往下走,算是音乐里的左右手。

尾声讲的几条规律都是从数据里算出来的。等待年数收了 11 项科学奖和经济学奖,从关键发现到获奖,最短的 AlphaFold 等了 4 年,最长的 Hopfield 网络等了 42 年,排好序以后正中间那个是 31 年,落在 microRNA 那一项。年龄收了 28 人次,其中 25 人次做出发现时在 30 到 49 岁之间。最年轻的是马蒂尼斯,当时 27 岁,还在读博士。

尾声里的等待年数图,11 条横线从发现年份连到获奖年份,最短 4 年,最长 42 年
图 3 尾声里的等待年数图。旁白说「大多数,等了三十年上下」,说的就是这张图的中位数

片子里没有一张 AI 生成的图

开工十几分钟后,它把手头的生成工具挨个试了一遍。MiniMax 的音乐接口返回 2153,说这个接口不再对新用户开放。Gemini 项目撞上了月度消费上限,Lyria 配乐、Veo 视频和 Gemini 生图一起用不了。火山方舟的 Seedance 视频模型没有开通。能用的只剩 Seedream 生图。

Seedream 在整个项目里一共生成过 8 张图,4 只手、3 个脑,外加 1 张冰立方实验室。手和脑只拿来描轮廓。它用 OpenCV 把剪影描成坐标,再按坐标重画成发光的线条,生成图本身没有进片。记录里写的理由是避开 AI 画手时常见的手指画错。那张冰立方实验室图很像真的,极光底下一栋两层的科研楼,结果直接弃用了,它给自己定的规矩是真实地点只用真实照片。

左侧是 Seedream 生成的四张白色手掌剪影,右侧是成片开场里用剪影轮廓重画的一蓝一橙两只发光的手
图 4 左边是 Seedream 生成的剪影,只取了轮廓坐标。右边是成片开场里重画出来的两只手

剩下的画面全是代码画的。我允许它弃用 remotion-video 以后,它给的理由只有一句,Remotion 那套 2D 卡片做不了从量子到宇宙的连续缩放。它回头拿了我上一部片子《九条曲线》的引擎,three.js 加 Canvas,每一帧都由帧号从头算出来。代码里不许用随机数和系统时间,这样 12 个无头浏览器可以各渲一段,拼起来不会错位。18 站加开场、尾声一共 20 个段落文件,合计两万一千多行,最长的两站各有一千五百多行。第 14 站只有 25 行,原因后面再说。

片中用到 50 张照片,全部来自 Wikimedia Commons,下载器只收公有领域和 CC 许可的图,片尾逐条署名。配乐和音效也是程序合成的,189.6 秒的配乐 11.7 秒就算完,音效只在换尺度和到站两处出声。旁白是我的 MiniMax 克隆声,325 句,9,029 个汉字,每分钟约 281 字。

成片里六站的画面拼成三行两列,依次是量子芯片的温度计、死亡谷里的集水装置、两只小鼠的对照实验、韩江的照片册、诺加莱斯被边境切开的街区、冰立方的光锥
图 5 六站的画面。从左上到右下依次是量子芯片、分子里的房间、免疫系统的刹车、韩江、为什么有的国家富、南极冰下的幽灵粒子

十九个小时里,将近十三个小时在等额度

整个制作前后派出过 99 个子代理。调研 22 个,编剧 18 个,核查 10 个,画面 24 个,审片 8 个,修复 17 个,其中 6 个是子代理自己又派出去的助手。最多的时候有 10 个同时在跑。

这么多代理一起干活,额度很快见底。19 个小时里撞了 4 次用量上限,每次停一个半到四个多小时,加起来将近 13 个小时。23 个子代理被拦腰截断,最糟的一次,第一批 8 个画面工程师全部中断,一行代码都没写进磁盘。

制作时间线,横轴是开工后的小时数,四段斜纹是撞上用量上限后的停顿,上方标出调研、配音、审片、渲染等节点,下方标出我说过的五句话
图 6 制作时间线。蓝色是在干活,斜纹是在等额度重置,下方的三角是我说过的话

它的应对办法很朴素。每次快撞上限之前,先把进度和所有定下来的决定写进项目的顶层文档,中断以后下一轮可以直接接上。额度重置后系统自动续跑,它先去磁盘上看被打断的代理留下了什么,缺什么就重派什么,后来干脆改成小批量派活。

我那两句「继续做诺奖片」,是它每次停下前教我说的。记录显示,第一次我说这句的时候,它已经自己续跑一个多小时了。

一百亿亿是十的十八次方

第一站量子芯片的稿子是它自己写的,写完给编剧们当样板。里面有一句讲实验装置有多安静,「他们的滤波器把外来干扰削弱了一百亿亿倍」。它本意是 10 的 20 次方,也就是功率衰减 200 分贝。可一百亿亿是 10 的 18 次方,差了一百倍。

这个错是配音回听抓到的。旁白用克隆声配好以后,它用 Whisper 把音频转写回来,跟稿子逐字比对。第一次回听,这一句报了一处差异,少了一个「亿」。它顺着这一处回头去算,才发现数字本身就写错了。那时第一个核查员还没派出去,再过 10 分钟才派。记录还显示,第一站、开场和尾声这三段,后来也一直没有独立的核查员看过。交付的时候它告诉我,这是核查改掉的错。记录里的经过不是这样。

改后的句子是「削弱了十的二十次方倍。隔着它听火箭发射,会比听手表滴答还轻」,字幕写作 10²⁰。

量子芯片一站的画面,杂乱的外来干扰波形穿过铜粉滤波器后变成一条直线,标注削弱 10 的 20 次方倍,下方写着火箭发射比手表滴答还轻
图 7 改过以后的这一拍。画面上的数字跟着旁白一起改了

回听这道工序本身也改过两次。第一版给 Whisper 的提示词里带着这句旁白的原文,结果开场 14 句全是满分。它很快意识到,Whisper 会照着原文去「听」,读错了也查不出来,就换成一句通用的提示词。一换就冒出一串差异,隧听成碎,薄听成搏,搓衣听成错一,多数是同音字。于是又改了一次,两边都转成带声调的拼音再比,同音字不再报警,多音字读错和数字读错照样抓得到。

这道工序后来抓到过真问题。「宇宙深处来的中微子」被听成「生出来的」,那句就改写成「来自遥远宇宙的中微子」。「长句」被读成了 zhǎng,加进读音词典重配。也有它管不了的地方。物理学家哈尔岑的名字,Whisper 从头到尾都听成「哈尔城」,可能只是它不认识这个少见的名字,读音词典加了,最后还得靠人耳确认。开场最后一句只有两个字「出发」,Whisper 在这里自己编出一长串「吧吧吧」,得分是 0。

核查员改掉的那些差一点

核查员一共派了 10 个,每人管一到两站,逐句去对调研档案和原始出处。它们抓到的错大多只差一点,专家一眼能看出来,外行很难察觉。

冰立方一站原来写「当时书上说,光在冰里走八米就没了」。核查员回到哈尔岑 2014 年的一次访谈,书上那 8 米是吸收长度,意思是光每走 8 米,强度降到原来的三成多,哈尔岑本人的说法是走 30 米左右光才完全熄灭。旁白改成「走八米就暗掉大半」。

免疫一站原来说调节性 T 细胞「不杀谁」。核查员引了一篇 2008 年的综述,细胞溶解正是它压制免疫反应的四种基本方式之一。改稿只加了两个字,「一般不杀谁」。核查记录里的理由写得很准,说「不杀谁」,专家会觉得错,说「一般不杀谁」,专家只会觉得粗。同一站还有一句「用它治自身免疫病和癌症」。治癌的思路恰恰是清除肿瘤里的这种细胞,原句会让中学生听成输这种细胞去治癌,意思正好说反。改成了「用它治自身免疫病,清掉它治癌症,都还在试验中」。

这样的改动还有不少。microRNA 一站说「人类六成以上的基因」都留着接调光器的位置,原论文说的是六成以上编码蛋白质的基因,补上了几个字。2024 年经济学奖一站说「五百年前越繁华的地方,如今往往越穷」,这个逆转只在被欧洲殖民过的国家之间成立,前面补了「前殖民地里」。阿吉翁说过一句玩笑话,访谈记录里他紧接着补了一句 It was half joke, of course,旁白就从「开玩笑说」改成「半开玩笑说」。化学奖一站的「七成半的右手进去,九成右手产物出来」,出自诺奖科普稿图 4 里的一个 For example,本来就是举例,旁白前面加了「理想情况下」,画面标上示意曲线。

核查员也会和它意见相左。写作纪律规定外国人名用新华社的通行译名,核查员照章把「阿西莫格鲁、罗宾逊」改成了新华社 2024 年通稿里的「阿杰姆奥卢、鲁滨逊」,还留了一句话,想破例的话,要在写作纪律里写明例外。它最后改了回来,理由是中学生能读到的那本中文版《国家为什么会失败》署的是阿西莫格鲁,这条例外和出处一起写进了这一站的事实依据。

审片的人只看画面

画面做完以后,它把全片每 5 秒抽一帧,拼成一张张 12 格的联系表,再缩到手机宽度另拼一份。审片的子代理不看代码,只看这些帧,对着分镜挑毛病,按轻重分三级。P0 必须修,包括字读不出、字压字、画面和旁白对不上、空画面、渲染错误。P1 应该修,P2 只记录。每一轮换一批新的审片员,它们没参与过制作,也不看上一轮的结论。

第一轮审了两段,报出 P0 6 条、P1 72 条。第二轮审了三段,其中一段是头一回审,P0 8 条、P1 42 条。到第三轮,三段加起来新的 P0 只剩 2 条。

有几条读起来很直观。旁白第一次报出「一共 18 个奖」的那几秒,画面上只有一片深蓝,审片员写道,这是全片第一次报总数,正该有画面。韩江一站有一份清单,十五个词都是白字压在米白色的纸上,手机宽的联系表里一个也读不出来。化学奖一站要表现一大片分子,用了 30 万个 1 像素的点,联系表上就是一屏电视雪花,审片员说这种点经过视频压缩会糊成一块,手机上看更像坏片。

左边是第一轮审片时满屏一像素噪点的分子海,右边是修复后的点阵,标注 1000 万个里只多 5 个,每点约代表 5000 个分子
图 8 化学奖一站。左边是第一轮审片时的「分子海」,右边是修复后的点阵

修复员有一条规矩,不许改旁白,因为改旁白就得重新配音。还有一条是它们自己守的,不编数。有个修复员本可以给一段动画加个计数器,最后没加,理由是笔画数不是真实的发现数,加了就是编数字。另一个修复员碰上一段 RNA 序列比格子少一位,宁可留着 21 格的真实序列,也不自己补一个碱基。

审片员也盯着修复带出来的新问题。第二轮有一份报告写,修 P2 时把 P1 级的平衡打破了。第三轮最后那两条 P0 也是这么来的。尾声的年龄图上,上一轮有一条 P2 建议给最左边那个点加个标注,加上去的「约 27 岁,还在读博士」正好压住了图例。片尾致谢把同一作者的署名合并以后,照片署名从 3 页缩成 2 页,片尾时长却还按 3 页留着,最后空出了 14 秒的暗场。这两处它自己改了,图例挪到右上角,每页署名的停留时间改成按剩余时长自动分配。

有一个毛病连着报了两轮,只是一轮比一轮轻。第一轮的总评说,画面系统性地慢半拍,关键词只在字幕里出现。到第二轮,说法变成画面比字幕晚一到三秒。

每五秒看一帧,看不见只闪一帧的东西

联系表 5 秒才取一帧,只闪一帧的问题在联系表上注定看不见。第二轮审片的同时,它把整片用半分辨率渲了一遍,一共 66,503 帧,逐帧量画面的平均亮度,专找相邻两帧之间的大跳变。

全片只有一处出了问题,就是冰立方一站镜头从宇宙拉回到手的那一段。回程原来只有 0.86 秒,镜头每一帧要穿过将近两个数量级,星系那一层在屏幕上只停了一帧,贴图上的星点被拉成满屏方块。南极冰盖是一个白色椭圆,两帧之内铺满半屏,又骤然变暗。相邻两帧的亮度最大跳了 65.8。

修复员把回程拉长到 1.28 秒,银河换成预先模糊过的贴图,冰盖的不透明度从 0.55 降到 0.06。改完以后每一层尺度在屏幕上至少停 9 帧,最大跳变降到 11.4。

冰立方一站镜头拉回段的逐帧平均亮度曲线,修复前有几根很高的尖刺,相邻两帧最大跳变 65.8,修复后曲线平缓,最大跳变 11.4
图 9 冰立方一站修复前后的逐帧亮度。上面那几根尖刺,联系表一根也没抓到

六类全收,难处落在了这几站

我选六类全收的时候,它提醒过的那句「和平奖政治敏感度也高」,后来落在了四站上。马查多、皮莱、日本被团协是和平奖,韩江是文学奖。三站和平奖的调研档案各有一节专门讲风险,列出能讲什么、什么不进片。

马查多一站只讲计票单这套程序,不判断谁赢了选举,官方的说法和反对派的说法同等分量上屏。核查员把「认定这些计票单是伪造的」改成「称这些计票单涉嫌伪造」,法院判决的原文是 presuntos documentos forjados,用「认定」就比原文走得更远了。站尾有一张字卡,写着「本站内容截至 2025 年 12 月颁奖时」,这张卡改过三次。最早的版本写的是此后委内瑞拉局势发生重大变化,后来把「变化」删了,免得这句话本身去暗示什么。第二轮审片员还专门量了照片的饱和度,发现这一段里唯一一张彩色的得主照片,偏偏落在最敏感的这一站,于是改成和其他得主一样的双色调。第三轮的结论是通过,没有发现倾向性问题。

马查多一站的画面,左边是一格格空着的计票单,标注官方未公布逐台结果,右边是官方宣布的全国总数,下方写着官方称网络攻击拖延了计票和公布,两边都注明了出处
图 10 马查多一站。左边是官方没有公布的逐台结果,右边是官方宣布的总数和给出的解释,两边都标了出处

日本被团协一站只讲时间先后,不讲因果。旁白说日本从 1931 年起侵略中国,又挑起太平洋战争,那年 8 月美国在广岛、长崎投下原子弹,同一个月苏联对日宣战,日本宣布投降。画面上四个日期颜色一样、大小一样,中间不画箭头。旁白也提到,当时城里有被强征来的朝鲜和中国劳工。审片员报过一处,废墟下躺着的人形很容易被读成遇难者,后来改成旁白说「他没受伤」时,画面上站着一个人。

皮莱一站的主线是罪名、法庭、判决三环。卢旺达只用地图和时间来讲,遇害人数用了「八十万到一百多万」这个区间,联合国常引约 80 万,卢旺达政府 2002 年的普查统计是 107 万多,两种口径都要盖住。画面上不出现伤亡,性暴力相关的字眼也一个不留。

韩江一站,光州只作为背景出现一次。她的演讲原文用的是「屠杀」,片子里用的是「一场镇压」,核查员的判断是比原文轻,但不失实。

这几站的分寸,它在交付时交还给了我。它的原话是,正式发布前,请你按要发布的平台再判断一次。

还没做完的部分

有几件事它在交付清单里写明了要人来做。卡森一站画了一张萨福残篇,上面的希腊字母和补字的读法,修复员在记录里写得很直白,要请古典学者在交付前核对,它没法替代这一步。哈尔岑这个名字要人耳听一遍。韩江的两段引文是根据英译自己译的,正式中译本的措辞没有核到。配乐和音效只量过响度,整片 -16 LUFS,讲解时音乐比旁白低约 15 分贝,交付时还没有人把它从头到尾听过一遍。

第 14 站现在是一张 12 秒的说明卡。2026 年的经济学奖要到 10 月 12 日才公布,片子渲完的时候还不知道得主是谁。第一轮审片员指出站号从第 13 站直接跳到第 15 站,观众会以为漏了一站,才补上了这张卡,旁白说等它揭晓,我们再把这一站补上。

第 14 站的说明卡,米白底上写着 2026 诺贝尔经济学奖,10 月 12 日公布
图 11 第 14 站的说明卡。那 25 行代码画的就是它

经济学奖公布以后,这一站要从调研开始重走一遍,整部片子也要再渲一次。上一次渲了 67 分钟。

已有 0 条评论
滚动至顶部