被点名才开口:全双工语音模型为何听得见内容却不干预
该研究用同一话题下只换触发句并压缩停顿的配对独白,检验五个模型家族何时抢话,结果显示被直接提问和静音可靠地触发开口,而错误事实与危险行为几乎不触发,且把话轮交出去后纠错与警告比例仍很低。
该研究用同一话题下只换触发句并压缩停顿的配对独白,检验五个模型家族何时抢话,结果显示被直接提问和静音可靠地触发开口,而错误事实与危险行为几乎不触发,且把话轮交出去后纠错与警告比例仍很低。
针对约 265K 参数的紧凑声学模型,论文用感受野对照证明超过 15 个音素的编码器上下文无一致收益,再用梅尔适配的梯度方差损失恢复细节,在同等预算下把 UTMOS 从 3.591 提升到 4.086,代价是大模型在可懂度和频谱失真上仍占优且结论限于 LJSpeech 自动指标。
该研究把 8 类独奏谱面图像转成 bootleg score 词序列做文本分类,用无标注语言模型预训练把 RoBERTa 片段准确率从 34.5% 提升到 42.9%,再用移调式训练与测试增强推到 58.8%,代价是长片段整页推理退化和大偏移抹掉音域线索。
该综述把乐器建模中的逆问题统一为从声振观测反推物理量的框架并分为十类任务,强调病态性与噪声敏感是共同困难,正则化与建模假设是稳定求解的关键,但感知相似的声音匹配不等于物理一致的参数恢复。
针对跨通道矛盾定义的犹豫与矛盾识别问题,论文选择显式建模模态差异的 9 token Transformer 路线,在 BAH 标注测试集上报告 0.7408 Macro F1,代价是小数据下额外 token 带来的过拟合风险与多窗口训练成本。
针对田间噪声、多说话人和农业词汇三类失败,论文用可开关的增强、说话人分离与词表修复包裹未改动的 ASR 模型,在印地语等三语评估上实现云端相对 16% 至 23% 的词错误率下降,多说话人下达 32% 至 42%,代价是增强与修复只在证据支持时生效且 M4 未被测量。
针对直播带货语音合成中流畅度、语调、情感和直播感需要分维度评价的问题,论文先把 Gemini 的成对判断蒸馏为开源的 Live-ProsodyJudge,再用去掉总体结论、按维度掩码与分段归因的 Decoupled 版本解决维度塌缩,十次平衡顺序采样的 LPJ 在四个主测试集点准确率高于单次 Gemini 调用,而 D-LPJ 的混合维度一致率达到 …
针对电子喉语音与健康语音域失配且大模型难流式部署的问题,论文用冻结自监督模型的离散音素目标加电子喉微调识别模型的瓶颈特征做三阶段渐进蒸馏,最好的 Mel-Conformer 把电子喉词错误率从最强零样本基线的 39.3% 降到 21.2%,代价是仍需平行语料做对齐且只用识别探测验证,ONNX 单核实时率为 0.30。
针对历史转写会传播实体错误并丢失发音与说话人信息的问题,该研究用场景可控的数据管线构造多模态对话历史并做上下文监督微调,最强证据是微调后语音加文本上下文在两个模型上取得最高的总体实体召回,但代价是需要合成语音过滤与条件匹配的微调,且无上下文基线与无关历史的鲁棒性仍有限。
论文把音乐幻觉定义为五层感知接地失败,用矛盾判定加三范式诊断九个模型,发现人声误听普遍而调性感知分化架构,两种免训练干预在辨别式探针有效却常不能迁移到自由生成。
针对波斯语缺少大规模高保真语音数据的问题,PersianVox 用声学轮次感知的韵律切分与 CTC/RNN-T 双自动语音识别一致过滤从网络音频构造语料,最强证据是 SCOREQ 在 564 句人工平均意见分上皮尔逊相关达 0.6658 优于 DNSMOS 且修复后 SCOREQ 均值从 3.04 升至 4.03,代价是从 6179.66 小时原料仅保留 …
针对语音大模型用自回归解码做四分类情绪识别会产生无效标签并偏向多数类的问题,论文在冻结主干上对比同一最终提示词隐状态的生成式解码与单层线性分类头读出,最强证据是加入对话上下文后宏平均 F1 达到 78.14 且在 ASR 转写下从 74.47 提升到 76.50,代价是只验证了 IEMOCAP 四类设置且可解释关联暴露了预训练的文化偏置。
针对真实扰动下单一音频伪造检测器不稳定的问题,ROGUE 用扰动智能体出难题、策略智能体按序挑选检测工具的对抗方式构造工作流,在 WaveFake 训练与多扰动和跨数据集评测中提升了平均准确率,但代价是联合搜索更贵且依赖工具多样性。
该研究针对诈骗话术快速演变且酷似正常客服来电的问题,用混合树生成共享开头的诈骗与合法近域通话并以月度冻结快照评测,证明近域负例把分类器宏平均 F1 从 1.000 拉低到 0.65 左右并暴露全判欺诈坍缩,代价是固定 2 比 1 类别先验与合成语音的真实性局限。
针对泰卢固语语音事实问答缺少基准与评测不可靠问题,VākQA 用 2001 对真人 quiz 语音与双语转写先校准自动评测再测问答,发现 Gemini 作答与做裁判均领先但仍受语言、模态与级联误差影响且文化域最敏感。
论文把已知录音的谐波打击分离放在离线预处理、把相位声码器与叠加相加放在逐帧可变速的实时合成,并用预计算频谱查表把总运行时间降低约一半,代价是更小的预计算跳长需要更多预计算与内存。
该研究把持续学习任务收紧到单攻击者加已知真人多样性,用三种检测模型和四种训练策略对比,报告攻击者训练数据与架构影响相当、任务顺序与说话人多样性对不同方法影响不一,而随机回放最稳但需存旧数据。
共分析 36 篇语音/AI 论文
针对多编码器大音频语言模型靠直觉或穷举选编码器的问题,论文提出只用单编码器成绩算类别级与任务级相关性的 CUES 规则,在 XARES-LLM 上 Track A 选出三编码器提升 4.3% 而 Track B 主动只留双编码器提升 6.3%,代价是选择依赖开发集打分且仅在单 135M 骨干上验证。
该研究用先定位中频能量谷再验证释放的闭合计数器替代包络峰计数,在六个语料库 356 名说话人 3560 个合格颤音上得到中位数 2 个闭合、约 36 毫秒间隔,语境效应稳健而性别效应消失,代价是只描述成形良好的浊音周期性颤音且缺乏人工逐点基准。