← 研究笔记English
技术研究 · 2026-07-24 · 25 分钟阅读 · 考据

精剪能交给 AI 吗:边界不在模型精度,在谁定义了这一刀

「AI 能不能剪片」这个问题问错了。按证据把边界摊开之后,分界线不在模型强弱,而在一刀的位置由什么定义:由信号定义的切点(词边界、静音、镜头切换、节拍)早就帧级自动化了,而且帧精度全部来自确定性信号处理、跟 AI 没关系;由语义和情绪定义的切点仍然做不到,卡点也不是分辨率,是没有反事实数据、没有目标函数、没有验收标准。

研究声明

本文审查的是「AI 配上工具能否完成视频精剪」的能力边界。182 个研究代理并行检索,56 条载重结论各经 3 个独立视角对抗核验(技术机制 / 产品现实 / 时效性),核验时被要求默认「这条站不住,除非你能确认」。

结果值得先说清楚:56 条无一条被三个视角原样放行,也无一条被推翻,全部落在「方向对、表述需修正」。这个 0 通过率有一部分是我那句「默认站不住」的先验造出来的,不等于原结论全错。真正的产出是 56 份修正稿,本文写的是修正后的版本。分档:【稳】=核验后仍成立(可能被收窄)· 【已收窄】=初稿被推翻或大幅限定,此处给修正版 · 【判断】=分析推导。

时效说明:本轮联网搜索额度耗尽,只能靠模型知识(截止约 2026 年初)加对已知权威 URL 的抓取。2026 年 2 月到 7 月是明确盲区,凡与产品版本相关的结论都请当作可能过期。

先给总裁决。「精剪能不能自动化」其实是两个问题。按「这一刀的位置由什么定义」分开之后,由信号定义的那一半早已帧级出货多年,由语义定义的那一半一个产品都没有,而且卡点不在模型。更要紧的是,今天连「剪得好」都还没有任何公开的打分方式,所以这件事连评分标准都还没有,谈不上正在被慢慢攻克。

一、先把「精剪」和「粗剪」定清楚

不把定义说死,这个题目会立刻滑成「AI 能自动剪视频」这种没有信息量的结论。行业工序链是 assembly(顺剪)、rough cut(粗剪,结构与取舍)、fine cut(精剪,帧级)、picture lock(锁画)。

市面上几乎所有「AI 剪辑」宣传混淆的正是这两层。而精剪的退出条件只被部分形式化了【已收窄】。picture lock 本身不是可机器验证的事实,它是导演或制片在排期与合约压力下的宣告。被形式化的是它的后果:锁定后下游按冻结的帧号排期计费(VFX pull list 带 head/tail handles、作曲 spotting 按时码写 cue sheet、混音 AAF 交接带 2 到 10 秒 handles),任何改动必须出 change list 供下游自动 conform。

顺带纠正一个我原本也会写错的地方。这套 diff 不是 O(n) 的逐片段比较。插入一段后所有下游时码平移,必须先做序列对齐(LCS 或 Myers 量级,键为 reel 加源时码),而且存在语义歧义:「掐头 12 帧加 slip」与「删掉旧镜头、插入另一条 take」可以产出逐帧相同的新时间线,却对应完全不同的 conform 指令。这正是商业 conform 工具都带交互式裁决界面、助理剪辑师要手工 QC 的原因。而且「diff 为空」既不充分也不等价于画面没变,VFX 换版本、reframe、timewarp、等长的叠化时长变化、字幕、调色全都不动任何时码。

二、真正的分界线:谁定义了这一刀

这是本轮研究最有信息量的一条分界,也是所有 14 个维度的修正稿反复收敛到的同一个结论【稳】:

能不能自动化,不取决于操作有多精细,取决于这一刀的位置是由一个可检测的物理事件定义的,还是由语义、情绪、风格定义的

由信号定义的边界,比如词的起止、静音段、镜头切换、节拍,早已有帧级甚至亚帧级的标注、指标、现成工具和 leaderboard。强制对齐的评测主指标就是毫秒级边界误差,镜头边界检测是逐帧二分类,节拍跟踪的标准容差是正负 70ms。这些都比一帧还细,或者同一量级。

由语义定义的边界,比如「他开始犹豫的那一刻」「情绪起来的那一下」「这个包袱讲完就切」,不仅没有 loss、没有 leaderboard,更根本的是做不出可靠的帧级真值,人类标注者之间的边界一致性本身就在正负 1 秒量级。所以问题不在于没人训练,而是评测与监督在原理上先失效了。

这条线横切整个精剪清单,而不是沿着「简单和困难」切:

精剪操作判定卡在哪(机制)
去气口 / 删口误 / 静音修剪已自动化边界由词与静音定义;强制对齐 10 到 20ms 栅格细于一帧
音乐卡点(切在拍上)已自动化边界由节拍定义;但只在稳定速度的制作类音乐上成立
还原已有剪辑点已自动化逐帧检测;但只能恢复已经存在的切点,不提议新切点
多机位按说话人切已自动化规则式:谁在说切谁,加最短镜头时长;是外部可观测的代理变量
呼吸口该留多长做不到所有产品都是全局常数;无逐实例决策,缺配对语料与验收
J/L cut 错位多少帧做不到写进格式是平凡的;缺的是「该错位多少」的目标函数
match cut做不到表示里根本没有「跨镜头形式对应」这个量(见下文模型阶梯)
景别节奏 / 情绪曲线做不到判据非局部;valence 不可靠,arousal 可靠但不是要的那条

三、已经能自动剪的那部分,帧精度都不来自 AI

这是最容易被误读的一点【稳】。上表里判定为「已自动化」的四项,帧级精度无一来自视频大模型,全部来自确定性检测器:

LLM 在这条链路里的位置是符号层的取舍与排序,它面对的是每秒几个到几十个已经文本化的候选,而不是 24 个任意帧。LLM 从来不需要「说出第 37 帧」,也不该由它说。今天所有已出货的帧精确 AI 剪辑都是这个两层架构:秒级语义选择,加帧级确定性吸附。

但要给这份「已自动化」打两个折扣。

折扣一:所谓节奏其实是一个常数。【已收窄】开源去静音工具的呼吸口就是 --margin 这一个默认 0.2 秒的标量,商用产品的「缩短词间停顿」是一根全片统一的滑杆。它们暴露的都是 g' = f(g) 这种无记忆标量映射,目标值只依赖气口自身长度,对语义位置、句法边界、情绪的条件依赖恒为零。而且结果并没有把气口压平,而是把它量化成一根尖峰,低于阈值的原样保留,其余全部塌到同一个值。这在定义上就不是节奏。

折扣二:域差比想象大。镜头边界检测在专业素材上 F1 约 0.96,在 UGC 短视频数据集上只有 77.9,而后者恰好是 AI 剪辑真正部署的那个域,测量原语本身就掉了约 18 个点。

四、卡住的几层,没有一层是「模型不够强」

1. 反事实数据缺失【稳,本轮最硬的一条】

所有公开语料只记录了被采用的那一版。没有任何一份数据集记录了同一段素材被否掉的入出点,因此没有任何模型见过「这一刀早 6 帧还是晚 6 帧更好」的成对偏好标签。公开工作只能拿「真实切点对随机位移的假切点」做对比学习,而「真切对随机切」远比「好切对可行但更差的切」容易。

这件事有个可以直接引用的数字:从成片学切点位置的代表工作,在正负 1 个 snippet(约 8 帧)容差下的 top-1 命中只有 8.18%(随机基线 0.60%)。在比精剪宽得多的容差上,top-1 只有 8%。

值得注意的是,这不是拿不到。该工作自己的人评环节就是 10 位职业剪辑师做「哪个 cut 更好」的成对比较,协议已验证可行,只是停在数十例的评测规模。放大到 105 量级约需 600 到 800 剪辑师小时,成本量级 4 万到 8 万美元,比中等规模的偏好数据集还便宜。所以准确的说法是,没人愿意为一个小市场买这个单,而不是物理上做不到。

2. 没有目标函数,也没有 verifier【稳】

截至 2026 年,不存在任何把「剪接手艺好不好」当被评量对象的公开 benchmark。所有现存资产都把问题偷换成「模仿成片」,评的是「你选的帧和当年那位剪辑师选的一样吗」。

这个偷换有多致命,在相邻领域已经被证过一次。视频摘要曾用「同素材多条人工标注」做多参考评测,结果随机生成的摘要与已发表方法得分相当。多参考没救回指标,反而暴露了指标本身的退化。

更直接的证据来自唯一一个把 J cut、L cut、match cut 等列为显式类别的公开基准。在刀口位置已经给定、只判类型这个简单版任务上,最佳基线 mean AP 只有 47.9%,其中 match cut 是 2.43%

但这里必须做两处修正,否则会引错:

3. 采样经济学让 RL 走不通【判断,但算术已复核】

既然写不出解析目标,能不能用真实互动数据当奖励?算一下就知道不行。用留存做 A/B 检测 1 个百分点的差异,每臂约需 3.9×10⁴ 次播放;检测 0.5 个百分点需 1.6×10⁵。而一个 3 帧的修剪,其真实效应几乎必然远小于 0.5 个百分点,一条 10 分钟口播又有 200 到 500 个切点。全片逐切点做一轮信用分配需要 10⁷ 到 10⁸ 次播放,超过绝大多数目标用户频道的终身播放量。这是采样经济学的限制,不是算力问题。

4. 判据本身非局部【稳,但需去掉一个常见误引】

剪辑界最常被引的权重表是 Walter Murch 的 Rule of Six:emotion 51%、story 23%、rhythm 10%、eye-trace 7%、二维平面 5%、三维空间 4%。它常被用来论证「可形式化的只占底部 16%」。

【已收窄】这个用法是范畴错误。Murch 给的是词典序优先级,他的原话是「从底下一项一项往上牺牲」,不是可加份额,把 7 加 5 加 4 当成「能力上界 16%」在数学上没有意义。它真正证明的是另一件事:不存在一个可手写、可分解的剪辑质量目标函数,因为占前两档的 emotion 与 story 在这套术语里从未被定义为可测量量。

而且它有一个直接后果,脱离整场戏做正负 6 帧的 A/B,收到的主要是噪声。这意味着即便拿到某部片子 v1 到 v40 的全部 EDL 差分,标签也是这位剪辑师、这场戏特定的,未必可迁移。

五、被核验推翻的那条:「1fps 是硬限制」是错的

这条值得单独写,因为它是我自己最可能写错、而且在中文技术讨论里流传最广的说法【已收窄】。

常见论证是,主流视频大模型以 1 帧每秒摄入,24fps 素材有 96% 的帧根本没进过上下文,所以帧级精剪在输入表示上就被封死了。这个论证不成立。1 fps 是默认值而不是上限,主流 API 的视频元数据里带可配置的采样率字段(合法区间上至 24),开源侧采样率完全由调用方设定,24fps 素材可以 100% 进上下文。

成本也不构成限制。一小时素材按 1fps 扫一遍约 90 万 token、几毛钱量级;即使低分辨率档拉满 24fps,一小时约 570 万 token。挡住它的不是钱,也不是像素进不去。

真正幸存的卡点有三条,而且更有意思:

  1. 输出契约:API 不回传帧号,模型没有 frame-index 句柄,官方约定用 MM:SS 书写;而且采样率上限 24 意味着 25/30/50/60fps 素材即使拉满也取不全源帧。要拿帧号必须靠调用方自己的抽帧器建立映射。
  2. 时间定位精度:厂商自己承诺的上限一直是「秒级」。整个时序定位领域最严的公开评测档止于 IoU=0.95,而帧级精度对应 IoU 约 0.99 到 0.997,这个区间没有任何 benchmark、loss 或 leaderboard 指向它。反推一下,在平均 8 秒的片段上,IoU=0.7 允许 34 帧的整体位移。
  3. 标签栅格:主流数据集的真值按 2 秒 clip 量化,人类标注者的边界分歧本就在秒级。在正负 1 秒噪声的标签上评 IoU 约 0.99,等于在量噪声。

所以正确的表述是:裸模型直接吐帧级入出点做不到,机制是秒级定位精度加上没有帧号输出契约;配工具的 agent 做帧级修剪做得到,但帧精度由确定性工具提供。把机制归因到「1fps 采样」会招来「提高帧率不就行了」的错误反驳,而真正封死路的是标签与目标函数。

还有一个反证很有说服力。早在 2017 年,一项 SIGGRAPH 工作就用手写的电影惯例代价函数加动态规划,全自动做出了帧级的对白场景剪辑决策,全程零神经网络视频理解。九年过去,产品的决策层仍然是手写启发式。这说明瓶颈从来不在模型智力。

六、「AI 不会用剪辑软件」这句话已经过期

本轮最反直觉的发现在执行层【已收窄,初稿严重低估】。到 2026 年年中,帧级时间线操作对 agent 已经是开放的

换句话说,AI 今天就能吐出一条带 J/L cut 的、帧准的时间线,它只是不知道该不该错位、错多少。瓶颈整体迁移到了判断层。

而最有力的旁证是厂商的沉默。某旗舰 NLE 最新版官网列出的十余项 AI 功能,包括素材检索、语音生成、焦点调整、人脸年龄与修饰、场记板识别、锐化、去运动模糊,零项触及剪辑时机。整轮 AI 预算全进了检索、修复、美颜与生成。

所以精剪这一层当前不存在「宣传对实测」的落差,因为根本没人在宣传。厂商连吹都不吹,这比任何实测都更能说明问题。

七、如果你要自己搭:一条今天就能跑的管线

基于以上,可落地的架构只有一种形状,而且它不需要等任何模型变强

  1. 确定性检测层(帧精度来源):词级强制对齐、镜头边界检测、VAD 或静音检测、节拍网格、说话人分离。全部开源、成熟、便宜。
  2. 符号选择层(LLM 的正确位置):把上一层的产物变成带时间码的文本候选,让模型只做取舍、排序、分段。一小时素材走「词级转录加镜头表」约 1.2 万到 2 万 token,比 108 万视频 token 省约 70 倍,而气口、口误、口播节奏这些恰恰在这条廉价路径上就能做帧级决策。
  3. 写回层:输出交换格式,或者直接调 NLE 脚本接口。

格式选型有个反直觉的结论【已收窄】:不要把 OTIO 当交付格式。它的核心 schema 里没有音量自动化、没有关键帧、没有 A/V 链接语义、没有变速斜坡,凡能归约成「时间点」的它都无损(帧级入出点、J/L 错位量本身、卡点),但精剪里的音频包络和斜坡在转出那一刻静默丢失。正确用法是把 OTIO 当内部中间表示(有理数时基精确、schema 小、JSON 好生成好 diff),交付层直接生成 FCPXML。

更要避开 EDL。它在文件里根本不存帧率(这不是实现缺陷,规范就没这个字段),而且承载不了第二条视频轨、关键帧、变速斜坡,事件号只有 3 位。

真实翻车点的排序也和直觉相反【已收窄】,按杀伤力从大到小是:

  1. 速率语义错:23.976 当 24 处理,一小时差 86 帧;drop-frame 当 non-drop,一小时差 108 帧
  2. 区间语义错:有的格式 out 是闭区间,有的 end 是开区间,于是每个切点系统性差一帧。这是跨格式转换最经典的 off-by-one。
  3. VFR 素材:手机和录屏没有恒定帧时长,conform 之前「帧精确」本身无定义。
  4. 数值表示精度排在最后。微秒表示的误差约 1.5×10⁻⁵ 帧,「累加几百个切点会漂到整帧」的说法差了约 100 倍。真正的风险是渲染端反解时的舍入模式失配,不是精度耗尽。

换句话说,时基不兼容是确定性、可单测、工业界已解决二十年的记账问题,而感知层的误差底噪比它大 100 到 1000 倍。

八、几个值得单独记住的细节

九、这份研究没能覆盖的

诚实标注要紧,尤其是这轮搜索额度耗尽的情况下:

主要来源(经三视角核验):剪辑手艺与工序:Murch《In the Blink of an Eye》(词典序优先级,非可加权重)、picture lock 与 change list / conform 的下游契约;计算式剪辑:Leake et al. SIGGRAPH 2017(对白场景帧级自动剪辑,零神经视频理解)、Berthouzoz et al. SIGGRAPH 2012;学习切点:Pardo et al. ICCV 2021《Learning to Cut by Watching Movies》(255K 切点,±8 帧容差下 top-1 8.18%)、MovieCuts ECCV 2022(173,967 clips / 10 类,mean AP 47.9,match cut 2.43,模型阶梯 1.1→2.3)、AVE ECCV 2022、Netflix Match Cutting WACV 2023(候选检索,明确把定帧留给剪辑师);评测方法学:Otani et al. CVPR 2019(多参考 F1 下随机摘要与已发表方法相当)、Otani et al. BMVC 2020(时序定位数据集的强先验);时序定位:QVHighlights(2 秒 clip 量化真值)、Charades-STA、ActivityNet Captions、Qwen2.5-VL 技术报告(second-level event localization);信号层:CTC 强制对齐与音素级对齐器(10–20ms)、TransNetV2(BBC 96.2 / RAI 93.9 / ClipShots 77.9)、节拍跟踪(mir_eval ±70ms 容差)、PodcastFillers(非词汇填充词 Event F1 92.8);同步阈值:EBU R37、ITU-R BT.1359-1(视听阈不对称);格式与接口:FCPXML DTD(audioStart/audioDuration 表达 split edit)、OTIO 核心 schema、CMX3600 规范、各 NLE 脚本接口与 MCP 生态。共 56 条载重结论进入三视角对抗核验,全部落在「方向成立、表述需修正」,本文写的是修正版;分档与时效风险已逐条标注。

Amos · research.xishe.ai · 转载注明出处