在单位球面上做高斯似然:以结构化说话人先验连接余弦、PLDA 与时长
论文针对深度说话人嵌入后端仍需结构化建模与时长补偿的问题,提出各向同性 PLDA 与球面高斯 T-PSDA 及其时长扩展,在 NIST SRE 与 CN-Celeb 上以 EER 与最小代价显示时长建模带来可复现增益,但最小主代价改善有限且依赖前端与归一化条件。
论文针对深度说话人嵌入后端仍需结构化建模与时长补偿的问题,提出各向同性 PLDA 与球面高斯 T-PSDA 及其时长扩展,在 NIST SRE 与 CN-Celeb 上以 EER 与最小代价显示时长建模带来可复现增益,但最小主代价改善有限且依赖前端与归一化条件。
该研究在德语到巴伐利亚语意图分类和德语到瑞士德语话题分类上对照文本直用、语音直用与先转写后分类,报告标准语上文本最好而方言上语音最好且级联分化严重,代价是方言语音为单说话人朗读且结论限于亲缘变体。
论文针对句子重音改变语义这一被忽视的能力,提出 StressTest 基准与 Stress-17k 合成训练管线,微调得到的 StresSLM 在真实录音上显著超过现有语音模型,同时基本保留原有识别能力。
论文把多轮语音风格保持定义为首轮指令后的逐轮指令遵循率,用同一话题与同一模拟用户测五类模型,报告首轮尚可但后续迅速退化,并显示显式回忆能部分缓解但需额外轮次代价。
针对多人重叠会议中内容、说话人与时间边界相互纠缠的问题,TagSpeech 用解耦的语义与说话人双流加交错数字时间锚统一解码,在 AMI 与 AliMeeting 上以只训练投影层的低成本取得 diarization 误差的明显下降,但重叠区外的时间边界精度仍不及专用级联系统。
针对克丘亚语到西班牙语低资源语音翻译,QUESPA 比较了级联与端到端路线,最强证据是端到端微调 SpeechT5 结合 SIDON 增强、数据增广与 Collao 语料在官方集上取得 27.2 的 BLEU,代价是 CHRF 未同步提升且大模型提示翻译仍远低于微调基线。
针对一句内多情绪与多语速控制问题,TED-TTS 选择冻结预训练自回归语音合成模型、只在推理时重组条件可见性与终止控制,消融表显示完整方案在过渡平滑与说话人一致性上优于去掉对齐或局部调速的变体,但局部加速仍带来实时因子上升的代价。
针对多人对话中谁在何时说话与内容难以联合对齐的问题,TellWhisper 在语音编码器内用时间说话人旋转位置编码联合建模时间与说话人活动,并用双曲空间说话人日志估计帧级活动,在真实会议数据上取得内容加说话人加时间的一致改进,但支持说话人数限于 1 至 4 人且编码器与双曲分类器仍处在不同几何空间。
针对统一大音频语言模型偏向平滑上下文而漏掉短暂声学线索的问题,论文提出只在推理时对比原始与时域模糊音频的对数几率并做门控稀疏修正,在 MMAU 上 Qwen2.5-Omni 平均达 73.2%,代价是每样本多一次慢路径预填充前向与双路解码缓存。
针对功能磁共振时间分辨率不足以区分言语与语言加工阶段的问题,该工作用词 onset 对齐的皮层脑电高频信号做时空预测微调,在三个语音模型上提升脑对齐且保持下游任务,同时以时间平均与打乱对照证明毫秒结构带来额外增益,但数据仅为 9 人单播客因而覆盖与多样性受限。
论文把电话传输拆成降带宽与过编码分别测量,发现未见过的编码是退化主因,并用窄带重采样加随机量化加 RawBoost 加 G711 仿真在未见真实 VoIP/PSTN 上把 EERc 从 18.9% 降到 15.1%,代价是训练条件变多且干净宽带上的匹配性能不再是最优。
针对无预切分、无说话人标签的 21 语言多说话人长对话选择题任务,论文对比了 Voxtral-Mini-3B 的 LoRA 微调、冻结 Voxtral-24B 的多模态上下文学习纠偏、以及免训练语音锚定检索三条路线,最强证据是上下文学习在第二阶段评测取得 0.81 准确率,代价是微调在小数据上过拟合回落与检索前端依赖转写和切分质量。
该工作用语音活动检测加字幕块翻译先固定时间模板,再把相邻音频聚成长段并用整句翻译重写文本后回填原时间,开发集证据显示翻译质量随句子尺度提升,但更长更完整的译文需要后处理才能兼顾阅读速度与行长限制。
该研究用双轨应答蜜罐加音频指纹与商用合成语音检测器测量骚扰来电开场,报告机器发声至少占 26.9%,其中约一半是跨通话重放的录音,但合成标签只有约 54.4% 经盲听确认且阈值与播种历史显著影响读数。
针对无参考语音翻译质量估计中连续分数制造大量文档内微排序噪声的问题,该工作冻结 COMETKiwi-22 只做文本打分再用训练集上搜出的分桶宽度把近似分数压成精确平局,在开发集上把平均段级 Kendall τb 做到 39.4% 而系统级 SPA 维持 88.0% 左右。
针对粗粒度标注刻画不了语速情感韵律时变的问题,论文用直接听音频写细粒度描述的 FCaps 数据与分两阶段做全局加细粒度对比学习的 CLSP 模型,在检索与人评一致性上报告更强证据,代价是仅英文与大规模算力依赖。
针对噪声下单流纠错被音频质量卡住的问题,论文用独立 ASR 与 VSR 双路 N-best 假设加可靠性提示词做语言空间组合,在 LRS2 上把基线相对误差降低约一半,代价是依赖上下游识别头质量并增加大模型串行纠错开销。
针对语音与音乐联合训练中的任务冲突和数据不均衡,论文用动态容量混合专家做按词元分配计算的三阶段课程训练,在语音内容一致性和音乐美学指标上报告了超越专用基线与稠密联合基线的结果,代价是更复杂的专家初始化与路由调参流程。
UniVocal 把同一话语内说话与唱歌自动切换定义为 SCS 合成,用 CosyVoice 2 加两阶段课程学习与精细 cent 音高规划实现语义驱动切换,在 SCSBench-Mixed 上报告 0.871 客观与 0.810 主观切换 F1,代价是歌声数据电流音与真实纯隐式场景泛化仍受限。
该研究用 62 名巴西受试者的持续/a/元音检验特纳综合征是否存在可测声学偏离,发现 F1-F3 中心趋势和 shimmer 系统性偏低并用树集成模型得到 AUC 在 0.70-0.75 到 0.821 左右的初步判别,但仅 19 例患者且只用单一元音任务,尚不能作为临床筛查依据。