本文是对「绕过 ASR 转写、从音频向量直接理解并执行」的技术研究,结论经多来源对抗式核验(TMLR 2025 语音语言模型综述、多篇 ICASSP/EMNLP/Interspeech 论文与官方代码库、OpenAI 官方公告与开发者文档等)。文中逐条标注「事实 / 研究 / 判断」;厂商自评数字与未同行评审的 preprint 均已注明,请按标注打折。这是快速演变领域的快照(2026 年年中),非选型结论。
先给一句话结论:封闭命令集上,这条路今天就成熟且更优;开放任务上已经产品化,但要接受「约三分之一复杂调用失败 + 没有可靠转写」的代价;而且「绕过文字」本身可能是个幻觉。
一、可能性:分两个层级看
封闭命令集(固定意图):成熟,而且赢
【研究,多源证实】「音频进、意图出、全程不产生转写」在封闭域上不仅可行,还能打赢级联:
- Fluent Speech Commands(31 意图,智能家居域):完全 ASR-free 的端到端模型达到 1.15% 错误率的 SOTA,略胜带 ASR 预训练的 1.20%;
- Skit-S2I(14 意图,银行域):端到端全面高于级联(0.946–0.956 vs 0.923–0.933),而且参数量只有级联的六分之一到二十七分之一(19.8M–87M vs 522M–593M);
- wav2vec 2.0 向量直接喂简单分类器,在标注量不超过 100 小时的三个任务上(包括真实 911 通话的心脏骤停检测)胜过 SOTA ASR 转写路径。
但硬边界也在这:ASR-free 模型遇到训练没见过的措辞,错误率会从 1% 飙到 15%–57%——论文自己承认这是「端到端 ASR-free 口语理解的固有局限」。它赢在「固定说法」,死在「换个说法」。
开放任务:已产品化,带着代价
【事实】OpenAI Realtime API 于 2025-08-28 正式 GA(gpt-realtime):官方定位是单一模型直接吃音频、吐音频(而非 STT→LLM→TTS 三级链),会话内原生支持函数调用、远程 MCP、SIP 电话、打断与 agent 交接;Zillow、T-Mobile、StubHub 等企业部署被官方引用。这就是「语音直接执行任务」的已落地形态。
⚠️ 但「绕过文字」可能是幻觉:隐式转写
【研究,2026-02 preprint,中置信】这是全场最重要的发现。对 Ultravox 和 Qwen2-Audio 两个开源语音大模型做机制分析(logit lens):在 LLM 的隐层里能直接读出字面转写;再用概念抹除术(LEACE)删掉隐层里的文本预测方向,两个模型在所有任务上的准确率崩到 0.0%–0.3%,而随机抹除同样多的维度几乎无影响(−1.5%~−4.0%)。结论:所谓「音频向量直接进 LLM」,因果路径上仍然途经文本样表征——它只是把 ASR 藏进了隐层,不是真的绕开了文字。
该工作是单作者、未同行评审的 preprint,机制分析只覆盖两个开源架构;GPT-4o Realtime 等闭源模型未测,「隐式转写」对它们只是合理嫌疑而非已证事实。有两篇独立并行工作方向一致。
【事实,利益相反证据】一个旁证:OpenAI 自己的文档承认,语音到语音路径给你的「输入转写」是异步旁路 ASR 生成的,「只能当作参考,并非模型真正听到的内容」。
二、已有应用盘点
| 形态 | 状态 | 备注 |
|---|---|---|
| 唤醒词 / 命令词(KWS) | 【事实】量产多年 | 本质就是「音频→动作」的无转写执行 |
| 开源 audio→intent | 【事实】2019 年即公开 | Lugosch et al. 官方 repo:decode_intents(waveform) 直接从波形解码出 {activate, lights, kitchen} 结构化意图,推理零转写。但训练期仍依赖 LibriSpeech 960 小时文本强制对齐——「无文字」只是运行期的,训练管线仍浸在文本监督里(这是普遍规律) |
| Realtime 原生语音 + 函数调用 | 【事实】GA,企业在用 | 见上文;语音会话内直接触发工具执行 |
| 无文字语音生成 / 直接语音翻译 | 【研究】 | wav2vec 向量 + 浅层探针在开放生成任务上惨败(英→德 BLEU 6.1,对照真值文本 15.5);但同年全量微调的端到端语音翻译已可与级联竞争——「分类能赢,生成要大力出奇迹」 |
三、「绕过文字」的三大动机,实证成色参差
- 误差不级联(ASR 错 → NLU 必错)——【有硬数据,但有界】。SLURP 基准上,16% 词错率的级联,意图准确率也只比金标转写低约 5%(实体任务掉得更多:SLU-F1 78.19→70.84)。反方向的证据倒更扎实:纯生僻词(OOV)命名实体上,直接向量路径错误率 23%,转写路径 36%——绕过转写在生僻实体上的鲁棒性优势有硬数据。
- 保留副语言信息(语气 / 情绪 / 说话人 / 韵律)——【成立】。这是端到端当前唯一稳定的胜场(TMLR 2025 综述:级联在语义任务上典型胜出,在说话人与副语言任务上落后)。
- 省延迟——【未证实】。在全部存活证据里,延迟优势只有厂商公告和论文的断言,没有一条公开对照实测存活下来。别把这条当定论。
四、缺点与风险(重点)
- 语义任务上级联至今普遍占优,噪声下差距还扩大。【研究,多源】TMLR 2025 综述汇总六项基准;VoiceBench 独立佐证:朴素的 ASR→LLM 管线在口语指令上胜过所有端到端语音助手 10 分以上。加噪实验(0dB 人声噪音):Whisper 级联只掉 0.5%–4.2%,四个端到端语音大模型掉 3.9%–12.7%,干净场景下的端到端优势最大能被反转 7.6 个百分点。
- 复杂函数调用约三分之一失败。【厂商自评】gpt-realtime 在 ComplexFuncBench 音频版得 66.5%(2024-12 前代 49.7%)——注意这是 OpenAI 内部私有评测。独立学术旁证:音频入口的工具调用比文本入口系统性低约 4.8 个百分点。
- 可审计性是公认的结构性短板。【事实,对撞双方都承认】主张绕过转写的论文自己写明「自动转写为现代语音应用提供了重要的可解释性层」;更有分量的是,卖 Realtime 的 OpenAI 官方文档反而推荐客服、审批型流程用链式架构,理由正是「持久转写 + 各级之间的确定性逻辑」——厂商做出不利于自家新产品的推荐,属于利益相反证据,可信度最高。
- 配对数据稀缺是硬约束。【研究】语音→意图语料比文本意图数据小数个量级(Skit-S2I 仅 13.8 小时、11 个说话人;SLURP 58 小时),方言口音覆盖天然薄弱——截至 2022 年底连印度口音的口语理解数据集都不存在。
- 确定性门禁难插。文本路径可以 regex / schema 校验、审核后再放行;音频向量路径的护栏只能退到工具调用参数那一层(好在那里还是结构化 JSON)。
五、务实结论
【判断,由前述核验结论推导】
- 封闭命令集(唤醒词 / 车机命令 / 智能家居 / 固定 IVR 菜单):纯端到端今天就是正确选择——更准、参数更少、天然不需要转写。
- 开放任务 voice agent:高可靠、要合规审计的场景选级联(连 OpenAI 都这么推荐);追求低延迟自然对话、业务能容错的场景选 Realtime 原生,但必须做三件事:① 开启异步转写做审计日志(明知它只是参考也要留);② 把所有关键执行收敛到服务端 schema 校验的函数调用上(工具参数是结构化 JSON,文本层的护栏在这一层依然有效);③ 高风险动作加确认回合。
- 未来两三年:原生音频模型会继续吃掉级联的延迟与副语言优势;但审计与确定性门禁的需求,会让「音频进、结构化文本出」的混合形态长期存在——「彻底无文字」更可能停留在封闭命令集和研究论文里。
主要来源:TMLR 2025《On The Landscape of Spoken Language Models》综述、arXiv 2602.17598(级联等价假说,preprint)、Borgholt et al. ICASSP 2022、Lugosch et al. 2019 与官方代码库、SLURP(EMNLP 2020)、Skit-S2I、VoiceBench,以及 OpenAI gpt-realtime 公告与 voice agents 官方文档。研究经 104 个检索与核验代理、每条结论三票对抗核验;「事实 / 研究 / 判断」三档与厂商数字、preprint 状态均已逐条标注。