← 研究笔记English
技术研究 · 2026-07-14 · 10 分钟阅读 · 考据

语音不落文字:从音频向量直接执行任务的可能性与代价

语音助手的经典管线是三级跳:语音转文字(ASR)、文字理解意图(NLU)、执行。一个自然的问题是——能不能跳过中间那步,让模型直接从音频的向量表征理解意图、执行任务?这条路今天走到哪了、谁已经在用、代价是什么?这篇按「已落地事实 / 研究阶段 / 分析判断」三档摊开讲,最反直觉的发现是:很多号称端到端的语音模型,隐层里其实还在偷偷转文字。

研究声明

本文是对「绕过 ASR 转写、从音频向量直接理解并执行」的技术研究,结论经多来源对抗式核验(TMLR 2025 语音语言模型综述、多篇 ICASSP/EMNLP/Interspeech 论文与官方代码库、OpenAI 官方公告与开发者文档等)。文中逐条标注「事实 / 研究 / 判断」;厂商自评数字与未同行评审的 preprint 均已注明,请按标注打折。这是快速演变领域的快照(2026 年年中),非选型结论。

先给一句话结论:封闭命令集上,这条路今天就成熟且更优;开放任务上已经产品化,但要接受「约三分之一复杂调用失败 + 没有可靠转写」的代价;而且「绕过文字」本身可能是个幻觉。

一、可能性:分两个层级看

封闭命令集(固定意图):成熟,而且赢

【研究,多源证实】「音频进、意图出、全程不产生转写」在封闭域上不仅可行,还能打赢级联:

但硬边界也在这:ASR-free 模型遇到训练没见过的措辞,错误率会从 1% 飙到 15%–57%——论文自己承认这是「端到端 ASR-free 口语理解的固有局限」。它赢在「固定说法」,死在「换个说法」。

开放任务:已产品化,带着代价

【事实】OpenAI Realtime API 于 2025-08-28 正式 GA(gpt-realtime):官方定位是单一模型直接吃音频、吐音频(而非 STT→LLM→TTS 三级链),会话内原生支持函数调用、远程 MCP、SIP 电话、打断与 agent 交接;Zillow、T-Mobile、StubHub 等企业部署被官方引用。这就是「语音直接执行任务」的已落地形态。

⚠️ 但「绕过文字」可能是幻觉:隐式转写

【研究,2026-02 preprint,中置信】这是全场最重要的发现。对 Ultravox 和 Qwen2-Audio 两个开源语音大模型做机制分析(logit lens):在 LLM 的隐层里能直接读出字面转写;再用概念抹除术(LEACE)删掉隐层里的文本预测方向,两个模型在所有任务上的准确率崩到 0.0%–0.3%,而随机抹除同样多的维度几乎无影响(−1.5%~−4.0%)。结论:所谓「音频向量直接进 LLM」,因果路径上仍然途经文本样表征——它只是把 ASR 藏进了隐层,不是真的绕开了文字。

限定

该工作是单作者、未同行评审的 preprint,机制分析只覆盖两个开源架构;GPT-4o Realtime 等闭源模型未测,「隐式转写」对它们只是合理嫌疑而非已证事实。有两篇独立并行工作方向一致。

【事实,利益相反证据】一个旁证:OpenAI 自己的文档承认,语音到语音路径给你的「输入转写」是异步旁路 ASR 生成的,「只能当作参考,并非模型真正听到的内容」

二、已有应用盘点

形态状态备注
唤醒词 / 命令词(KWS)【事实】量产多年本质就是「音频→动作」的无转写执行
开源 audio→intent【事实】2019 年即公开Lugosch et al. 官方 repo:decode_intents(waveform) 直接从波形解码出 {activate, lights, kitchen} 结构化意图,推理零转写。但训练期仍依赖 LibriSpeech 960 小时文本强制对齐——「无文字」只是运行期的,训练管线仍浸在文本监督里(这是普遍规律)
Realtime 原生语音 + 函数调用【事实】GA,企业在用见上文;语音会话内直接触发工具执行
无文字语音生成 / 直接语音翻译【研究】wav2vec 向量 + 浅层探针在开放生成任务上惨败(英→德 BLEU 6.1,对照真值文本 15.5);但同年全量微调的端到端语音翻译已可与级联竞争——「分类能赢,生成要大力出奇迹」

三、「绕过文字」的三大动机,实证成色参差

四、缺点与风险(重点)

  1. 语义任务上级联至今普遍占优,噪声下差距还扩大。【研究,多源】TMLR 2025 综述汇总六项基准;VoiceBench 独立佐证:朴素的 ASR→LLM 管线在口语指令上胜过所有端到端语音助手 10 分以上。加噪实验(0dB 人声噪音):Whisper 级联只掉 0.5%–4.2%,四个端到端语音大模型掉 3.9%–12.7%,干净场景下的端到端优势最大能被反转 7.6 个百分点。
  2. 复杂函数调用约三分之一失败。【厂商自评】gpt-realtime 在 ComplexFuncBench 音频版得 66.5%(2024-12 前代 49.7%)——注意这是 OpenAI 内部私有评测。独立学术旁证:音频入口的工具调用比文本入口系统性低约 4.8 个百分点。
  3. 可审计性是公认的结构性短板。【事实,对撞双方都承认】主张绕过转写的论文自己写明「自动转写为现代语音应用提供了重要的可解释性层」;更有分量的是,卖 Realtime 的 OpenAI 官方文档反而推荐客服、审批型流程用链式架构,理由正是「持久转写 + 各级之间的确定性逻辑」——厂商做出不利于自家新产品的推荐,属于利益相反证据,可信度最高。
  4. 配对数据稀缺是硬约束。【研究】语音→意图语料比文本意图数据小数个量级(Skit-S2I 仅 13.8 小时、11 个说话人;SLURP 58 小时),方言口音覆盖天然薄弱——截至 2022 年底连印度口音的口语理解数据集都不存在。
  5. 确定性门禁难插。文本路径可以 regex / schema 校验、审核后再放行;音频向量路径的护栏只能退到工具调用参数那一层(好在那里还是结构化 JSON)。

五、务实结论

【判断,由前述核验结论推导】

主要来源:TMLR 2025《On The Landscape of Spoken Language Models》综述、arXiv 2602.17598(级联等价假说,preprint)、Borgholt et al. ICASSP 2022、Lugosch et al. 2019 与官方代码库、SLURP(EMNLP 2020)、Skit-S2I、VoiceBench,以及 OpenAI gpt-realtime 公告与 voice agents 官方文档。研究经 104 个检索与核验代理、每条结论三票对抗核验;「事实 / 研究 / 判断」三档与厂商数字、preprint 状态均已逐条标注。

Amos · research.xishe.ai · 转载注明出处