← 研究笔记English
技术研究 · 2026-07-14 · 10 分钟阅读 · 考据

语音不落文字:从音频向量直接执行任务的可能性与代价

语音助手的经典管线是三级跳:语音转文字(ASR)、文字理解意图(NLU)、执行。一个自然的问题是,能不能跳过中间那步,让模型直接从音频的向量表征理解意图、执行任务?这条路今天走到哪了、谁已经在用、代价是什么?这篇按「已落地事实 / 研究阶段 / 分析判断」三档摊开讲,最反直觉的发现是:很多号称端到端的语音模型,隐层里其实还在偷偷转文字。

研究声明

本文是对「绕过 ASR 转写、从音频向量直接理解并执行」的技术研究,结论经多来源对抗式核验(TMLR 2025 语音语言模型综述、多篇 ICASSP/EMNLP/Interspeech 论文与官方代码库、OpenAI 官方公告与开发者文档等)。文中逐条标注「事实 / 研究 / 判断」;厂商自评数字与未同行评审的 preprint 均已注明,请按标注打折。这是快速演变领域的快照(2026 年年中),不是选型结论。

先给一句话结论。封闭命令集上,这条路今天就成熟且更优;开放任务上已经产品化,但要接受「约三分之一复杂调用失败,加上没有可靠转写」的代价;而且「绕过文字」这件事本身可能并没有真的发生。

一、可能性:分两个层级看

封闭命令集(固定意图):成熟,而且赢

【研究,多源证实】「音频进、意图出、全程不产生转写」在封闭域上不仅可行,还能打赢级联

但硬边界也在这里。ASR-free 模型遇到训练没见过的措辞,错误率会从 1% 飙到 15% 到 57%,论文自己承认这是「端到端 ASR-free 口语理解的固有局限」。它赢在固定说法,死在换个说法。

开放任务:已产品化,带着代价

【事实】OpenAI Realtime API 于 2025-08-28 正式 GA(gpt-realtime)。官方定位是单一模型直接吃音频、吐音频,不走 STT 到 LLM 到 TTS 的三级链,会话内原生支持函数调用、远程 MCP、SIP 电话、打断与 agent 交接;Zillow、T-Mobile、StubHub 等企业部署被官方引用。这就是「语音直接执行任务」的已落地形态。

但「绕过文字」可能是错觉:隐式转写

【研究,2026-02 preprint,中置信】这是全场最重要的发现。对 Ultravox 和 Qwen2-Audio 两个开源语音大模型做机制分析(logit lens)发现,在 LLM 的隐层里能直接读出字面转写。再用概念抹除术(LEACE)删掉隐层里的文本预测方向,两个模型在所有任务上的准确率崩到 0.0% 到 0.3%,而随机抹除同样多的维度几乎无影响(下降 1.5% 到 4.0%)。结论是所谓「音频向量直接进 LLM」,因果路径上仍然途经文本样表征,它只是把 ASR 藏进了隐层,没有真的绕开文字。

限定

该工作是单作者、未同行评审的 preprint,机制分析只覆盖两个开源架构;GPT-4o Realtime 等闭源模型未测,「隐式转写」对它们只是合理嫌疑,不是已证事实。有两篇独立并行工作方向一致。

【事实,利益相反证据】一个旁证是,OpenAI 自己的文档承认,语音到语音路径给你的「输入转写」是异步旁路 ASR 生成的,「只能当作参考,并非模型真正听到的内容」

二、已有应用盘点

形态状态备注
唤醒词 / 命令词(KWS)【事实】量产多年本质就是「音频到动作」的无转写执行
开源 audio→intent【事实】2019 年即公开Lugosch et al. 官方 repo 的 decode_intents(waveform) 直接从波形解码出 {activate, lights, kitchen} 结构化意图,推理零转写。但训练期仍依赖 LibriSpeech 960 小时文本强制对齐,所以「无文字」只是运行期的,训练管线仍靠文本监督,这是普遍规律
Realtime 原生语音 + 函数调用【事实】GA,企业在用见上文;语音会话内直接触发工具执行
无文字语音生成 / 直接语音翻译【研究】wav2vec 向量加浅层探针在开放生成任务上惨败(英译德 BLEU 6.1,对照真值文本 15.5);但同年全量微调的端到端语音翻译已可与级联竞争。分类任务能赢,生成任务要靠大规模训练堆上去

三、「绕过文字」的三大动机,实证成色参差

四、缺点与风险(重点)

  1. 语义任务上级联至今普遍占优,噪声下差距还扩大。【研究,多源】TMLR 2025 综述汇总六项基准;VoiceBench 独立佐证,朴素的 ASR 到 LLM 管线在口语指令上胜过所有端到端语音助手 10 分以上。加噪实验(0dB 人声噪音)显示,Whisper 级联只掉 0.5% 到 4.2%,四个端到端语音大模型掉 3.9% 到 12.7%,干净场景下的端到端优势最大能被反转 7.6 个百分点。
  2. 复杂函数调用约三分之一失败。【厂商自评】gpt-realtime 在 ComplexFuncBench 音频版得 66.5%(2024-12 前代 49.7%),注意这是 OpenAI 内部私有评测。独立学术旁证是,音频入口的工具调用比文本入口系统性低约 4.8 个百分点。
  3. 可审计性是公认的结构性短板。【事实,对撞双方都承认】主张绕过转写的论文自己写明「自动转写为现代语音应用提供了重要的可解释性层」。更有分量的是,卖 Realtime 的 OpenAI 官方文档反而推荐客服、审批型流程用链式架构,理由正是「持久转写加各级之间的确定性逻辑」。厂商做出不利于自家新产品的推荐,属于利益相反证据,可信度最高。
  4. 配对数据稀缺是硬约束。【研究】语音到意图的语料比文本意图数据小数个量级(Skit-S2I 仅 13.8 小时、11 个说话人;SLURP 58 小时),方言口音覆盖天然薄弱,截至 2022 年底连印度口音的口语理解数据集都不存在。
  5. 确定性门禁难插。文本路径可以用 regex 或 schema 校验、审核后再放行;音频向量路径的护栏只能退到工具调用参数那一层,好在那里还是结构化 JSON。

五、务实结论

【判断,由前述核验结论推导】

主要来源:TMLR 2025《On The Landscape of Spoken Language Models》综述、arXiv 2602.17598(级联等价假说,preprint)、Borgholt et al. ICASSP 2022、Lugosch et al. 2019 与官方代码库、SLURP(EMNLP 2020)、Skit-S2I、VoiceBench,以及 OpenAI gpt-realtime 公告与 voice agents 官方文档。研究经 104 个检索与核验代理、每条结论三票对抗核验;「事实 / 研究 / 判断」三档与厂商数字、preprint 状态均已逐条标注。

Amos · research.xishe.ai · 转载注明出处