本文是对「绕过 ASR 转写、从音频向量直接理解并执行」的技术研究,结论经多来源对抗式核验(TMLR 2025 语音语言模型综述、多篇 ICASSP/EMNLP/Interspeech 论文与官方代码库、OpenAI 官方公告与开发者文档等)。文中逐条标注「事实 / 研究 / 判断」;厂商自评数字与未同行评审的 preprint 均已注明,请按标注打折。这是快速演变领域的快照(2026 年年中),不是选型结论。
先给一句话结论。封闭命令集上,这条路今天就成熟且更优;开放任务上已经产品化,但要接受「约三分之一复杂调用失败,加上没有可靠转写」的代价;而且「绕过文字」这件事本身可能并没有真的发生。
一、可能性:分两个层级看
封闭命令集(固定意图):成熟,而且赢
【研究,多源证实】「音频进、意图出、全程不产生转写」在封闭域上不仅可行,还能打赢级联:
- Fluent Speech Commands(31 意图,智能家居域):完全 ASR-free 的端到端模型达到 1.15% 错误率的 SOTA,略胜带 ASR 预训练的 1.20%;
- Skit-S2I(14 意图,银行域):端到端全面高于级联(0.946 到 0.956 对 0.923 到 0.933),而且参数量只有级联的六分之一到二十七分之一(19.8M 到 87M 对 522M 到 593M);
- wav2vec 2.0 向量直接喂简单分类器,在标注量不超过 100 小时的三个任务上(包括真实 911 通话的心脏骤停检测)胜过 SOTA ASR 转写路径。
但硬边界也在这里。ASR-free 模型遇到训练没见过的措辞,错误率会从 1% 飙到 15% 到 57%,论文自己承认这是「端到端 ASR-free 口语理解的固有局限」。它赢在固定说法,死在换个说法。
开放任务:已产品化,带着代价
【事实】OpenAI Realtime API 于 2025-08-28 正式 GA(gpt-realtime)。官方定位是单一模型直接吃音频、吐音频,不走 STT 到 LLM 到 TTS 的三级链,会话内原生支持函数调用、远程 MCP、SIP 电话、打断与 agent 交接;Zillow、T-Mobile、StubHub 等企业部署被官方引用。这就是「语音直接执行任务」的已落地形态。
但「绕过文字」可能是错觉:隐式转写
【研究,2026-02 preprint,中置信】这是全场最重要的发现。对 Ultravox 和 Qwen2-Audio 两个开源语音大模型做机制分析(logit lens)发现,在 LLM 的隐层里能直接读出字面转写。再用概念抹除术(LEACE)删掉隐层里的文本预测方向,两个模型在所有任务上的准确率崩到 0.0% 到 0.3%,而随机抹除同样多的维度几乎无影响(下降 1.5% 到 4.0%)。结论是所谓「音频向量直接进 LLM」,因果路径上仍然途经文本样表征,它只是把 ASR 藏进了隐层,没有真的绕开文字。
该工作是单作者、未同行评审的 preprint,机制分析只覆盖两个开源架构;GPT-4o Realtime 等闭源模型未测,「隐式转写」对它们只是合理嫌疑,不是已证事实。有两篇独立并行工作方向一致。
【事实,利益相反证据】一个旁证是,OpenAI 自己的文档承认,语音到语音路径给你的「输入转写」是异步旁路 ASR 生成的,「只能当作参考,并非模型真正听到的内容」。
二、已有应用盘点
| 形态 | 状态 | 备注 |
|---|---|---|
| 唤醒词 / 命令词(KWS) | 【事实】量产多年 | 本质就是「音频到动作」的无转写执行 |
| 开源 audio→intent | 【事实】2019 年即公开 | Lugosch et al. 官方 repo 的 decode_intents(waveform) 直接从波形解码出 {activate, lights, kitchen} 结构化意图,推理零转写。但训练期仍依赖 LibriSpeech 960 小时文本强制对齐,所以「无文字」只是运行期的,训练管线仍靠文本监督,这是普遍规律 |
| Realtime 原生语音 + 函数调用 | 【事实】GA,企业在用 | 见上文;语音会话内直接触发工具执行 |
| 无文字语音生成 / 直接语音翻译 | 【研究】 | wav2vec 向量加浅层探针在开放生成任务上惨败(英译德 BLEU 6.1,对照真值文本 15.5);但同年全量微调的端到端语音翻译已可与级联竞争。分类任务能赢,生成任务要靠大规模训练堆上去 |
三、「绕过文字」的三大动机,实证成色参差
- 误差不级联(ASR 错则 NLU 必错),【有硬数据,但有界】。SLURP 基准上,16% 词错率的级联,意图准确率也只比金标转写低约 5%(实体任务掉得更多,SLU-F1 从 78.19 掉到 70.84)。反方向的证据倒更扎实:纯生僻词(OOV)命名实体上,直接向量路径错误率 23%,转写路径 36%,绕过转写在生僻实体上的鲁棒性优势有硬数据。
- 保留副语言信息(语气、情绪、说话人、韵律),【成立】。这是端到端当前唯一稳定的优势项(TMLR 2025 综述:级联在语义任务上典型胜出,在说话人与副语言任务上落后)。
- 省延迟,【未证实】。在全部存活证据里,延迟优势只有厂商公告和论文的断言,没有一条公开对照实测存活下来。别把这条当定论。
四、缺点与风险(重点)
- 语义任务上级联至今普遍占优,噪声下差距还扩大。【研究,多源】TMLR 2025 综述汇总六项基准;VoiceBench 独立佐证,朴素的 ASR 到 LLM 管线在口语指令上胜过所有端到端语音助手 10 分以上。加噪实验(0dB 人声噪音)显示,Whisper 级联只掉 0.5% 到 4.2%,四个端到端语音大模型掉 3.9% 到 12.7%,干净场景下的端到端优势最大能被反转 7.6 个百分点。
- 复杂函数调用约三分之一失败。【厂商自评】gpt-realtime 在 ComplexFuncBench 音频版得 66.5%(2024-12 前代 49.7%),注意这是 OpenAI 内部私有评测。独立学术旁证是,音频入口的工具调用比文本入口系统性低约 4.8 个百分点。
- 可审计性是公认的结构性短板。【事实,对撞双方都承认】主张绕过转写的论文自己写明「自动转写为现代语音应用提供了重要的可解释性层」。更有分量的是,卖 Realtime 的 OpenAI 官方文档反而推荐客服、审批型流程用链式架构,理由正是「持久转写加各级之间的确定性逻辑」。厂商做出不利于自家新产品的推荐,属于利益相反证据,可信度最高。
- 配对数据稀缺是硬约束。【研究】语音到意图的语料比文本意图数据小数个量级(Skit-S2I 仅 13.8 小时、11 个说话人;SLURP 58 小时),方言口音覆盖天然薄弱,截至 2022 年底连印度口音的口语理解数据集都不存在。
- 确定性门禁难插。文本路径可以用 regex 或 schema 校验、审核后再放行;音频向量路径的护栏只能退到工具调用参数那一层,好在那里还是结构化 JSON。
五、务实结论
【判断,由前述核验结论推导】
- 封闭命令集(唤醒词、车机命令、智能家居、固定 IVR 菜单):纯端到端今天就是正确选择,更准、参数更少、天然不需要转写。
- 开放任务 voice agent:高可靠、要合规审计的场景选级联(连 OpenAI 都这么推荐);追求低延迟自然对话、业务能容错的场景选 Realtime 原生,但必须做三件事。第一,开启异步转写做审计日志,明知它只是参考也要留。第二,把所有关键执行收敛到服务端 schema 校验的函数调用上,工具参数是结构化 JSON,文本层的护栏在这一层依然有效。第三,高风险动作加确认回合。
- 未来两三年:原生音频模型会继续缩小级联在延迟与副语言上的差距;但审计与确定性门禁的需求,会让「音频进、结构化文本出」的混合形态长期存在。彻底无文字更可能停留在封闭命令集和研究论文里。
主要来源:TMLR 2025《On The Landscape of Spoken Language Models》综述、arXiv 2602.17598(级联等价假说,preprint)、Borgholt et al. ICASSP 2022、Lugosch et al. 2019 与官方代码库、SLURP(EMNLP 2020)、Skit-S2I、VoiceBench,以及 OpenAI gpt-realtime 公告与 voice agents 官方文档。研究经 104 个检索与核验代理、每条结论三票对抗核验;「事实 / 研究 / 判断」三档与厂商数字、preprint 状态均已逐条标注。