共分析 38 篇论文
⚡ 今日概览
✅ 筛选入选 38 篇 → 🔬 深度分析完成
🏷️ 标签说明:本期使用新版受控 taxonomy;站点标签页暂时兼容展示历史标签与新标签。
🏷️ 热门方向
| 方向 | 数量 | 分布 |
|---|---|---|
| #语音识别 | 5 篇 | █████ |
| #音乐理解 | 3 篇 | ███ |
| #病理语音评估 | 2 篇 | ██ |
| #语音合成 | 2 篇 | ██ |
| #语音属性识别 | 2 篇 | ██ |
| #语音编码 | 2 篇 | ██ |
| #音视频语音识别 | 2 篇 | ██ |
| #音频深度伪造检测 | 2 篇 | ██ |
📊 论文评分排行榜(38 篇,按分数降序)
📋 论文列表
🥇 先出声再等文本:用原生语音令牌在波形之前跟踪读到哪
英文题目:X2-NativeCursor: Native-Token Text Progress Tracking for Incremental-Text Streaming Codec TTS
标签:#强制对齐 | #注意力机制 | #流式处理 | #语音 | #高效推理
评分:8.2/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5
排名:前25% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Zehan Liu:X Square Robot
- Carl Chen:X Square Robot
- Rime Wen:X Square Robot
- Kaiqi Fu:X Square Robot
- Altman Lin:X Square Robot
- Shawn Qin:X Square Robot
- Lights Shi:X Square Robot
- Roy Gan:X Square Robot
- Hao Wang:X Square Robot
- Qian Wang:X Square Robot
📌 核心摘要
增量文本流式语音合成需在文本分块到达且语音逐帧生成的条件下实时报告原文朗读进度以支撑高亮与中断,但到达时间与帧计数无法定位当前词且波形对齐需等待解码与声学重编码。X2-NativeCursor先由归一化规划将增量原文转为发音固定且携带原文区间的口语标签,歧义读法延迟释放使标签不可修正,其输出同时送入语音合成器与观察器。文本编码器对标签序列建模,原生令牌编码器对编解码器令牌提取有限前视语音特征,局部匹配器在上一估计附近打分并更新可回退的内部位置,单调输出规则取历史最远标签并投影为永不后退的原文光标。与波形对齐路径相比,该机制跳过波形解码与声学重编码,直接利用生成器原生时间信息并将可修正估计与对外发布解耦。在Qwen3-TTS生成语音测试集评测下,X2-NativeCursor的平均绝对误差指标为0.151,低于在线波形基线的1.253。该优势在第二自动参照与另一编解码器主干复现中依然成立,但英文词级粒度和未见声线下误差明显上升。其适用边界受限于固定语音与自动参照条件下的验证,跨主干与跨说话人外推尚未验证,而观察器仅2.166M参数且单帧中位延迟为1.33 ms,并发扩展时硬件吞吐仍能满足实时要求。
🔗 开源资源
- 代码相关资源:https://github.com/X-Square-Robot/X2Streaming-TTS — 链接可访问(HTTP 200)
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🥈 从播报式评测转向双人对话:Candor-LR 如何暴露音频退化并放大视觉补偿
英文题目:Candor-LR: A Dyadic Conversational Dataset for Audio-Visual Speech Recognition
标签:#音视频语音识别 | #数据集构建 | #基准测试 | #鲁棒性 | #音视频
评分:8.0/10 | 创新 1.3/2 | 技术严谨 1/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1.2/1.5 | 开源 1/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5
排名:前25% | 文档类型:数据集与基准 | arXiv 原文
👥 作者与机构
- Rishabh Jain:机构信息未在 arXiv HTML 中可靠披露
- Aristeidis Papadopoulos:机构信息未在 arXiv HTML 中可靠披露
- Zhaofeng Lin:机构信息未在 arXiv HTML 中可靠披露
- Naomi Harte:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
自然双人视频会议AVSR需从单人视角视频与单通道音频中转写自发对话语音,输出对应说话人的文本,其难点在于重叠打断、自发轮次、非正式词汇与可变声学使音频显著退化而纯视觉又极脆弱。流水线先以Speechmatics词级转写提供的毫秒级起止时间戳与标点置信度驱动切分,并完成说话人与视频通道的映射对齐,使双人会话解耦为单人音视频片段。随后对片段施加填充词过滤与文本归一化,仅保留含实词的短语并丢弃不合格片段及其音文,输出再按单次出现说话人隔离划分为训练验证测试集并固化为规范ID文件。相对LRS2与LRS3等摆拍朗读基准,该机制差异在于保留自然分布与人口平衡而非受控采集,从而放大视觉模态价值并检验跨域泛化。在Candor-LR测试集下,联合LRS2、LRS3与Candor-LR训练的AV-HuBERT的AV WER为9.83%,低于AO WER的16.37%。该结论适用边界限于英语双人视频会议场景,在多人鸡尾酒会、强混响与平台压缩等条件下尚未验证且自动标签与低分辨率人脸仍受限。原文未披露训练、推理或部署成本。
🔗 开源资源
代码相关资源:https://github.com/rishabhjain16/lipreading-data-guide/tree/main/Candor — 链接可访问(HTTP 200)
第三方资源:https://github.com/yakhyo/uniface — 链接可访问(HTTP 200)
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🥉 错误稀疏下只改该改的片段:韩语咨询对话的检测门控纠错
英文题目:Leveraging Fine-grained Error Correction in Korean Speech Recognition for Consultation Services
标签:#语音识别 | #SFT | #数据集 | #低资源
评分:7.9/10 | 创新 1.4/2 | 技术严谨 1.1/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5
排名:前25% | 文档类型:数据集与基准 | arXiv 原文
👥 作者与机构
- Yonghyun Jun:Chung-Ang University
- Jimin Lee:Chung-Ang University
- Hwan Chang:Chung-Ang University
- Dongho Shin:Korea Local Information Research & Development Institute
- Seolah Kim:SK intellix
- Hwanhee Lee:Chung-Ang University
📌 核心摘要
该任务输入为隐私受限下无音频可用的韩语咨询自动语音识别文本及对话历史,输出为保留正确话语并仅改写错误片段的干净转写,难点在于错误样本稀疏、韩语形态音系变化复杂且缺乏面向纠错的平行语料。方法检测门控上下文span纠错先将对话切分为话语级样本,再由编码器检测器做词元级错误定位并经话语级门控决定是否转发,只有判为含错的话语才进入下一步。纠错器在自回归预测对话上下文增强下生成span级改写串,最后经字符串替换回填完整句子,使发现与改写解耦且监督收缩到需改片段。与直接整句重写基线相比,该设计以显式检测门抑制对干净话语的不必要改写,从而在错误稀疏分布下兼顾纠错覆盖与保真。在DasanCallDial话语级测试集下,pkoT5版本DCSC的Bal-WER从14.67降至13.30,E-WER从29.35降至26.27。该结论适用边界受限于单主导识别系统的咨询域短上下文纠错,对多错误密度、开放域及音频可用场景尚未验证。原文披露的训练成本与延迟为检测器约1.5小时、韩语序列到序列纠错器约2.3小时、大语言模型纠错器约7.3小时,单句延迟从毫秒级至秒级不等。
🔗 开源资源
代码相关资源:https://github.com/yonghyun010102/DasanProjectCode — 链接不可用(HTTP 404)
数据相关资源:https://huggingface.co/datasets/zgold5670/DasanCallDialDataset — 暂时无法访问
数据相关资源:https://doi.org/10.1016/j.engappai.2026.116038 → https://linkinghub.elsevier.com/retrieve/pii/S0952197626023225 — 链接可访问(HTTP 200)
数据相关资源:https://creativecommons.org/licenses/by-nc-nd/4.0/ — 链接可访问(HTTP 200)
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
4. 长录音多维标注如何不推倒重来:以字段级复核做局部修复
标签:#语音属性识别 | #数据标注 | #基准测试 | #数据集 | #说话人分离标注
评分:7.9/10 | 创新 1.4/2 | 技术严谨 1.2/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 1.2/1.5 | 可复现 0.1/0.5 | 工程/实践 1.2/1.5
排名:前25% | 文档类型:系统技术报告 | arXiv 原文
👥 作者与机构
- Qirui Zhan:Northwestern Polytechnical University, China
- Shuiyuan Wang:Northwestern Polytechnical University, China
- Jingbin Hu:Northwestern Polytechnical University, China
- Haoyu Zhang:Northwestern Polytechnical University, China
- Xiaming Ren:Northwestern Polytechnical University, China
- Jinrui Liang:Northwestern Polytechnical University, China
- Chaoren Yu:Northwestern Polytechnical University, China
- Bengu Wu:yutuzhineng, China
- Yunxiang Chen:Shenzhen Pimei Technology Co., Ltd., Guangdong, China
- Houdun Liu:Shenzhen Pimei Technology Co., Ltd., Guangdong, China
- Su Feng:Shenzhen Pimei Technology Co., Ltd., Guangdong, China
- Liumeng Xue:Nanjing University, China
- Lei Xie:Northwestern Polytechnical University, China
📌 核心摘要
可控语音生成需要对长录音输出说话人归属时间线与多维段级描述,难点在于局部声学证据弱、说话人历史与邻段语境分散且转写语义易污染声学判断。SpeechAnnotator先由前端构建说话人感知分段与精修转写,并由先验抽取器附加声学、情感与事件线索,形成共享段键状态。规划智能体将局部音频证据、说话人历史、邻段与录音级上下文转化为字段级证据合约,标注智能体据此执行多模态预测。复核智能体仅对证据不足或跨段不一致字段触发定点重标而不重启全链,再经确定性模块归一化为JSON,这与单次提示商用系统和固定流水线不同,将修正限制在受影响字段并保留审计轨迹。在SA-Bench时间线恢复设置下,SpeechAnnotator的CER为12.42±0.18%,低于MOSS-Transcribe-Diarize的12.84±0.18%。声学场景与细粒度情感仍是主要失效区,结论适用边界受限于中文主导8.87小时基准及固定时间线属性评测,跨语言与跨域泛化尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
代码相关资源:https://github.com/ASLP-lab/SpeechAnnotator — 链接可访问(HTTP 200)
数据相关资源:https://github.com/ASLP-lab/SpeechAnnotator — 链接可访问(HTTP 200)
演示资源:https://zhanqirui.github.io/SpeechAnnotator-demo-page/ — 链接可访问(HTTP 200)
第三方资源:https://ai.google.dev/gemini-api/docs/models/gemini-3.1-pro-preview — 链接可访问(HTTP 200)
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
5. 广播满分不等于学会唇读:六条件复测下的视觉泛化断层
标签:#音视频语音识别 | #基准设计 | #基准测试 | #音视频
评分:7.9/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 1/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5
排名:前25% | 文档类型:数据集与基准 | arXiv 原文
👥 作者与机构
- Rishabh Jain:机构信息未在 arXiv HTML 中可靠披露
- Naomi Harte:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
音视频语音识别以声学波形与唇部视频为输入并输出文本转写,难点在于广播域外口音随意性、视角偏移、伦巴德效应与自发会话使视觉线索迅速失效。该工作先用RetinaFace检测与68点关键点抽取96×96嘴部感兴趣区域并统一音频与文本规范,再将GRID、LombardGrid、TCD-TIMIT与RoomReader转换为兼容Auto-AVSR和AV-HuBERT的清单格式,最后在视觉单模态、音频单模态与音视频多模态下固定解码器横评三种架构。与已有单因素模拟评估相比,该工作把词汇结构、超清晰发音、视角、发音人能力和视频会议会话放在同一流水线下对照,揭示了融合增益高度条件化。在LombardGrid评测条件下,Auto-AVSR的AV WER为11.73%,低于AO的14.02%。在GRID与自发会话中融合反而无益或有害,而极端90°视角与短话轮下视觉几乎完全失效。结论适用边界受限于英文广播训练模型的跨域推理,不支持对新训练方法有效性的外推。推理开销上Llama-AVSR的AV推理硬件需求为17.91 GB,远高于Auto-AVSR的2.29 GB而不适合低延迟实时应用。
🔗 开源资源
- 代码相关资源:https://github.com/rishabhjain16/lipreading-data-guide — 链接可访问(HTTP 200)
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
6. 整段对话只换一句话:冻结检测器如何给出伪造时间戳
英文题目:Zero-Shot Temporal Localisation of Audio Deepfakes in Multi-Speaker Conversations
标签:#音频深度伪造检测 | #信号处理 | #0 样本 | #基准设计 | #语音
评分:7.6/10 | 创新 1.3/2 | 技术严谨 1.1/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前25% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Soumyadeep Roy:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
输入为约60秒多说话人会话波形,其中仅一至两句为克隆语音手术式注入,输出为伪造区间的起止时间戳集合,难点在于单文件同时含真假两类致使话语级等错误率与最小检测代价不适定,且窗口分数在边界处剧烈抖动易碎裂。方法为训练无关五阶段流水线:滑动窗口切分冻结二值检测器打分,其输出重叠相加插值为连续时间线后送入中值与高斯平滑抑制毛刺,再由双阈值迟滞有限状态机将抖动吸收为连贯区间,最后删除短区间并合并近间隔后输出。平滑后时间线直接作为迟滞解码器输入,解码器输出再作为后处理输入,形成分数到区间的前向链条。相对需帧级标签训练的部分伪造检测,该工作仅需窗口级分数即可复用任意冻结检测器,具有即插即用意义。在相同协议重建基准实例条件下,训练局部器的t-IoU为0.909,高于DF Arena 1B零样本的0.871。真实会议对话验证显示虚警仍可控,但域外短时高保真克隆注入下定位接近失效,其适用边界受限于已见伪造分布的拼接会话。原文未披露训练、推理或部署成本。
🔗 开源资源
- 代码相关资源:https://github.com/sami42200/tdlmc-audio-deepfake-localization — 链接可访问(HTTP 200)
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
7. 时间一致性看穿音频伪造:相似度分布为何在实验室与野外反向
英文题目:Audio Deepfake Detection Using Temporal Coherence Analysis
标签:#音频深度伪造检测 | #统计分析 | #语音 | #音乐
评分:7.5/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 1.1/1.5 | 清晰度 0.7/1 | 影响力 1/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5
排名:前25% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Justin D. Norman:机构信息未在 arXiv HTML 中可靠披露
- Sarah Barrington:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
输入为待判定真伪的语音或音乐波形,输出为二分类真伪标签,难点在于合成器快速迭代导致的训练与野外部署分布漂移,以及语音与音乐伪造痕迹方向不一致。方法链分为四步:先将音频切分为重叠短窗并用冻结的对比语言音频预训练 Contrastive Language-Audio Pretraining / CLAP 编码器提取分段语义向量,再计算段间两两余弦相似度得到刻画内部时间一致性 Temporal Coherence 的分布,接着从分布提炼多类统计量并按训练判别力筛选子集,最后送入梯度提升树与多专家加权集成或分位数自适应规则完成判定。与端到端波形或频谱神经检测器相比,该机制不学习生成器指纹而度量语义表征随时间的波动形态,因而更轻量且可解释。在 ASVspoof5 评测上五专家集成取得等错误率 Equal Error Rate / EER 为 17.7%,优于所列的 AASIST 与 RawNet2 基线,而在名人野外语音上仅取得曲线下面积 Area Under Curve / AUC 为 0.718。结论适用于有源域多数据集与目标批统计可得的场景,在全新合成器、单一样本判定或严重类别不平衡下尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
- 代码相关资源:https://github.com/stbiadmin/audiodeepfake_public — 链接可访问(HTTP 200)
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
8. 把模糊边界变成可评测事件:TimeCues Studio 的整库标注与算法共用时间轴
英文题目:TimeCues Studio: A Workspace for Music Annotation and Algorithm Prototyping
标签:#音乐理解 | #数据标注 | #开源工具 | #音乐
评分:7.5/10 | 创新 1.3/2 | 技术严谨 1/1.5 | 实验充分 0.4/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 1.5/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5
排名:前25% | 文档类型:系统技术报告 | arXiv 原文
👥 作者与机构
- Sapir Caduri:Bar-Ilan University, Ramat Gan, Israel
- Yoav Goldberg:Bar-Ilan University, Ramat Gan, Israel
📌 核心摘要
TimeCues Studio要解决的输入是整库音乐音频与待校准的节拍网格,输出是可供训练与评测的结构化标注与算法预测,难点在于跨曲目协作、边界歧义与算法迭代长期散落在多个离线工具中。管理员先导入音频并设定静态、动态或手动节拍网格以统一对齐基准,标注员再在共享网格上叠加三频带波形与分离音轨特征放置多类型标记,同一画布与缓存随后驱动基线检测、自研检测器与共识建议的对比回填。相对单轨编辑器与固定单点评测的关键机制差异在于多候选边界与关键可选加权评分,使歧义与容忍度成为可计算的一等公民,检测器同时作为排名候选与标注助手也加速了验证闭环。在109首曲目的EDM语料评测下,Drop的占比指标为39%,高于Buildup的23%。该语料还呈现中位约10个边界且约20%边界被标为可选,支撑了歧义确实高频的判断。结论的适用边界受限于节拍稳定且以频带级事件为主的舞曲类协作标注,向漂移速度与非节拍音乐的外推尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
- 数据相关资源:https://freemusicarchive.org — 链接可访问(HTTP 200)
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
9. 东南亚语音评测为何难做:长音频定位与低资源提示的双重缺口
英文题目:SEA-SpeechBench: A Large-Scale Multitask Benchmark for Speech Understanding Across Southeast Asia
标签:#音频理解 | #基准设计 | #多语言 | #基准测试 | #语音
评分:7.4/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1.2/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5
排名:前50% | 文档类型:数据集与基准 | arXiv 原文
👥 作者与机构
- Jingyi Liao:Institute of Advanced Intelligence and Computing, A*STAR
- Wenyu Zhang:Center for AI Safety
- Zhuohan Liu:Institute of Advanced Intelligence and Computing, A*STAR
- Yingxu He:Institute of Advanced Intelligence and Computing, A*STAR
- Geyu Lin:Institute of Advanced Intelligence and Computing, A*STAR
- Xunlong Zou:Institute of Advanced Intelligence and Computing, A*STAR
- Shuo Sun:Institute of Advanced Intelligence and Computing, A*STAR
- Syed Ali Redha Alsagoff:机构信息未在 arXiv HTML 中可靠披露
- Ai Ti Aw:Institute of Advanced Intelligence and Computing, A*STAR
📌 核心摘要
该基准以语音波形加英语或母语文本指令为输入,要求模型输出转写文本、英译文本、问答答案、情感年龄性别等属性标签或时间区间,难点在于东南亚声调语言与多文字转写评分、低资源语料稀缺以及最长180秒长音频的时间定位与内容抽取导航。构建链条第一步按九类任务筛选源语料并统一重采样为16千赫兹单声道标准化音频与并行提示模板,输出规范化评测三元组进入过滤环节。第二步用CTC强制对齐置信度、语种识别匹配与说话人隔离配对进行质量过滤并按数据集定额采样,输出干净均衡的候选集进入合成环节。第三步对缺失的问答与时间推理任务基于清洗转写用GPT-4.1生成问答对与时间查询并经母语者抽检,输出完整九任务九万余样本评测套件进入双语评测。与既有英语中心基准的关键机制差异是引入时间到内容与内容到时间双向时间推理任务并采用英语与母语提示并行评测,使提示语言敏感性可直接度量而非仅测转写精度。在ASR基准评测下,Gemini 2.5 Flash的平均WER/CER为0.14,低于MERaLiON-2 10B的0.27。该结论适用边界受限于官方语言朗读与YouTube式录音语料,方言口音、自发对话与强噪声场景的失败条件尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
10. 流式对齐语音切分:在块边界上把声音逐字贴到文本子词
英文题目:StreamAlign: Streaming Text-Aligned Speech Tokenization
标签:#语音编码 | #向量量化 | #流式处理 | #语音
评分:7.3/10 | 创新 1.6/2 | 技术严谨 1.2/1.5 | 实验充分 1.3/1.5 | 清晰度 0.8/1 | 影响力 1.1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5
排名:前50% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Kang-wook Kim:Seoul National University;University of California, Berkeley
- Jinyoung Park:Seoul National University
- Jinsoo Kim:Seoul National University;KRAFTON
- Sehun Lee:Seoul National University;KRAFTON
- Sang Hoon Woo:Seoul National University;Georgia Institute of Technology
- Gunhee Kim:Seoul National University
📌 核心摘要
流式语音交互需将逐块输入语音直接转为与大语言模型子词一一对齐的离散单元再重建波形,难点在于离线识别需等待完整话语且识别词表与模型词表失配会把声学粒度从子词粗化到词级。StreamAlign先由流式编码器输出语义与声学帧特征,并由冻结流式词级识别给出词假设再转写为字符序列作为引导。接着字符级循环神经网络转导器对帧特征与字符序列做维特比解码得到帧到字符单调对齐,再按大语言模型分词器切分的子词划分声学帧块,经注意力池化聚合成子词嵌入并经残差向量量化离散为单元三元组。同时轻量词边界分类器基于联合网络状态预判块尾单词是否完整以决定立即冲刷或延迟到下一块,重建时由单元预测器生成帧级语音单元再经流式声码器合成波形。相对已有离线文本对齐方法,该设计以词汇无关字符为中间粒度,既继承词级识别精度又保留子词级声学细节,并将等待下词起始改为边界预测从而降低流式延迟。在LibriSpeech test-clean测试集下,StreamAlign的WER为4.41,低于Mimi的4.82。其结论适用边界受限于英语朗读训练与评测,对自发对话与多语码切换尚未验证,且对齐质量仍受引导识别器误差制约。推理开销方面分词与下游模型合计端到端实时因子为0.350且块级延迟降至270毫秒,仍高于纯声学流式编码器但以更低单元率换取序列效率。
🔗 开源资源
第三方资源:https://huggingface.co/OpenMOSS-Team/SpeechTokenizer — 暂时无法访问
第三方资源:https://huggingface.co/novateur/WavTokenizer — 暂时无法访问
第三方资源:https://huggingface.co/kyutai/mimi — 暂时无法访问
第三方资源:https://huggingface.co/Ereboas/MagiCodec_16k_50hz — 暂时无法访问
第三方资源:https://huggingface.co/Qwen/Qwen3-TTS-Tokenizer-12Hz — 暂时无法访问
第三方资源:https://huggingface.co/MediaTek-Research/Llama-1B-TASTE-V0 — 暂时无法访问
第三方资源:https://huggingface.co/amphion/TaDiCodec — 暂时无法访问
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
11. 给黑盒声码器加先验:低频子带引导与按能量加权的相位监督
标签:#语音合成 | #生成对抗网络 | #语音 | #时频分析
评分:7.3/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 1/1.5 | 清晰度 0.6/1 | 影响力 1/1.5 | 开源 1/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5
排名:前50% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Nan Xu:机构信息未在 arXiv HTML 中可靠披露
- Mingxue Yang:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
该任务从80维对数梅尔频谱图重建24 kHz波形,难点在于生成器黑盒预测全带幅度与相位时丢失频谱细节,且相位存在卷绕难以直接监督。首先由条件网络(CondNet)从梅尔频谱图并行预测低频子带对数幅度与相位,经指数与余弦正弦构造复频谱系数,再经跳长64的逆短时傅里叶变换(inverse short-time Fourier transform, iSTFT)合成6 kHz子带波形。接着对该子带波形做跳长4与跳长1的短时傅里叶变换(short-time Fourier transform, STFT),得到与主干两次上采样输出分辨率对齐的频域先验。最后两路耦合块将先验逐元素相加注入主干特征,引导全带幅度与相位预测并经帧长16、帧移4的逆变换输出波形;训练采用目标幅度加权的抗卷绕相位损失,强调大能量时频点的相位精度。与已有方法相比,关键差异是以显式低频子带频谱先验替代无监督黑盒预测,并以能量加权替代等权相位惩罚。在LibriTTS train-clean-100训练、域内500条与VCTK域外500条测试下,该模型感知语音质量评估(perceptual evaluation of speech quality, PESQ)域内达到4.02、域外达到3.78,超越112.4M参数的BigVGAN对应得分3.74与3.66。结论目前仅在朗读语音重建与CosyVoice声学特征驱动合成中验证,未验证音乐与通用音频外推能力。训练与推理成本方面,单张NVIDIA A100上1M步约需3.6天、占用15GB显存,NVIDIA V100上合成速度为145.67倍实时。
🔗 开源资源
- 代码相关资源:https://github.com/vspeech/SCNet — 链接可访问(HTTP 200)
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
12. 以单语微调对抗多语诅咒:BuzzASR 的百语种适配路线
英文题目:BuzzASR: A Swarm of 100+ Monolingual Speech Recognition Models
标签:#语音识别 | #SFT | #多任务学习 | #多语言 | #开源工具
评分:7.2/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1.2/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5
排名:前50% | 文档类型:模型报告 | arXiv 原文
👥 作者与机构
- Shivam Singh:UC San Diego
- Aditya Yadavalli:UC San Diego
- Catherine Arnett:EleutherAI
- Alex Warstadt:UC San Diego
📌 核心摘要
自动语音识别需将多语言语音输入转写为对应正字法文本,难点在于Whisper等多语言模型在低资源语言和非拉丁文字上分词碎片化导致序列过长且声学文本联合建模欠拟合。BuzzASR先为每种语言训练专用字节对编码分词器并以原嵌入加权和热启动替换多语言分词器,其输出的更短目标序列进入解码器语言建模预热阶段。随后解码器先在单语文本数据上微调以补足词法句法先验,再与语音文本对以一半文本比例混合多任务训练使编码器与解码器协同,最后仅用语音数据收尾微调并按FLEURS开发集词错误率选优。与保留单一多语言分词器和解码器的做法不同,专用分词器提升每词元字符数与词汇利用率并压缩解码长度,从而同时改善精度与速度。在FLEURS与Common Voice合并测试集评测下,与Whisper-large-v3零样本基线相比,最优微调模型的归一化character error rate中位数为7.6%,从15.5%降至7.6%。增益集中于Whisper最差的51种语言,中位压缩达3.45倍,阿姆哈拉语等10种语言超6倍,并在102种语言中27种取得开源最优。单语模型的适用边界受限于已知语言场景,多语言覆盖需部署多模型且代码切换与跨域泛化尚未验证。全部实验使用8×A100-80GB硬件,专用分词器使解码器延迟带来约1.6倍全局中位加速,计算量差异源于序列长度而非每词元吞吐。
🔗 开源资源
代码相关资源:https://lemn-lab.github.io/buzz-asr — 链接不可用(HTTP 404)
模型相关资源:https://lemn-lab.github.io/buzz-asr — 链接不可用(HTTP 404)
第三方资源:https://github.com/jitsi/jiwer — 链接可访问(HTTP 200)
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
13. 浅正字法不等于无重音:用弱监督让 ByT5 在句子级学会菲律宾语重音
英文题目:Towards Stress-Aware Sentence-Level Filipino G2P With Weakly-Supervised ByT5 Fine-Tuning
标签:#语音合成 | #弱监督学习 | #SFT | #多语言 | #韵律
评分:7.2/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 0.7/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5
排名:前50% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Lorenz Bernard Marqueses:机构信息未在 arXiv HTML 中可靠披露
- Paulo Grane Gabriel Silva:机构信息未在 arXiv HTML 中可靠披露
- Chastine Cabatay:机构信息未在 arXiv HTML 中可靠披露
- Ericson Adler Tan:机构信息未在 arXiv HTML 中可靠披露
- Ann Franchesca Laguna:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
菲律宾语字素到音素转换 grapheme-to-phoneme / G2P输入为无重音符号的句子字素序列,输出为含重音标记的国际音标 international phonetic alphabet / IPA序列,难点是重音 diin具有词汇性且正字法省略变音符号,须依赖上下文消歧同形异音词并处理黏着词缀导致的重音漂移。方法链分三步:先从WikiPron挖掘词级词典并按重音类划分语义歧义词,再用大语言模型 large language model / LLM辅助管线对句子中歧义词做上下文选音而其余词用规则转写合成弱标签,最后以多语言CharsiuG2P初始化字节级模型 byte-level T5 / ByT5并在混合句子语料上微调以学习整句映射。与词级多语言基线和规则系统Epitran的关键机制差异在于字节级端到端建模整句上下文而非孤立查词,从而直接预测重音位置。在1173条人工校对测试集上最佳模型混合错误率显著低于基线,相对词级基线实现了数量级的下降并能区分多数重音类别。适用边界是长新闻域噪声较大且malumi与非标准词仍易误判,未在真实语音合成 text-to-speech / TTS可懂度或跨域口语上验证。原文未披露训练、推理或部署成本。
🔗 开源资源
代码相关资源:https://github.com/dlsu-cse-nlp/filipino-byt5-g2p — 链接可访问(HTTP 200)
第三方资源:https://github.com/andrianllmm/tagalog-stemmer — 链接可访问(HTTP 200)
第三方资源:https://github.com/lingjzhu/CharsiuG2P — 链接可访问(HTTP 200)
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
14. 固定音色查不出偏置:语音到语音模型跟内容误判说话人性别
英文题目:Voice or Stereotype? Disentangling Acoustic and Content-Based Gender in Speech-to-Speech Models
标签:#语音属性识别 | #评测协议 | #公平性 | #多语言 | #语音
评分:7.0/10 | 创新 1.6/2 | 技术严谨 1.2/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5
排名:前50% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Xiaoqun Liu:Centific Research
- Tanu Mitra:University of Washington
- Harshit Rajgarhia:Centific Research
- Abhishek Mukherji:Centific Research
📌 核心摘要
输入为男性或女性合成语音朗读的男性刻板、女性刻板与中性长文本,输出为模型重读语音的声学性别与对说话人性别的显式判断,难点在于主流模型输出语音固定,传统声音漂移探针结构性失明而漏检文本偏见。方法分三步推进:先以职业偏见种子生成第一人称无性别文本并经强度筛选与人工校验得到中性载体文本,再用男女声合成并经分类器与声学门控认证载体无泄漏后进入评测,然后施加复述、释义、概括、翻译与性别描述五种任务并分别以复合声学 femininity 与逻辑回归归因度量双通道。相对文本偏见问答与语音多选评测,关键机制差异在于以跨声音与内容正交的不变性为判据而非正确率,直接分离听到的声音与说的内容,因而能定位偏见藏于归因而非渲染,具有部署审计意义。在性别归因任务评测下,内容与声音错位条件下的误判错误率为90%,高于内容与声音一致条件下的2%。渲染语音无可靠漂移而归因全面内容驱动,闭源模型的内容敏感度约为开源模型的十倍,证实偏见是通用属性而非单厂商问题。结论适用边界仅为二元男女声与英西中三语,不覆盖非二元、真实人声与保留原声架构,属尚未验证的外推范围。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
15. 去掉语言可预测成分后跨语言帕金森检测为何能找回灵敏度
标签:#病理语音评估 | #领域适应 | #跨语言 | #语音 | #语音生物标志物
评分:7.0/10 | 创新 1.3/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 0.5/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:前50% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Minu Kim:机构信息未在 arXiv HTML 中可靠披露
- Eunjung Yeo:机构信息未在 arXiv HTML 中可靠披露
- Kwanghee Choi:机构信息未在 arXiv HTML 中可靠披露
- June-Woo Kim:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
跨语言帕金森病检测输入为源语言健康对照与患者语音加目标语言仅健康人语音,输出为目标语言未见患者的二分类标签,难点是冻结自监督语音表示同时编码语言身份,分类器易把目标语言等同于健康类而出现高特异低灵敏失效。第一步冻结自监督模型做分层均值加标准差池化并按说话人平均,得到话语嵌入进入对齐阶段。第二步由VoxLingua107 ECAPA-TDNN提取说话人级语言向量,作为外部语言参考进入回归拟合。第三步在健康人子集上岭回归拟合从语言向量到语音表示的线性映射并相减取残差,残差标准化后送入均衡逻辑回归完成检测与阈值选择。与按语言平移质心的语言偏移不同,该方法逐说话人去除语言可预测分量,能削弱均值之外的语言协方差结构,使健康表示集中而患者表示弥散。在OneVoice-MSD-2026基准下,LO的F1为0.87,高于原始特征的0.52。该结论适用边界受限于德语、捷克语、西班牙语三种印欧语言及元音、DDK、朗读任务,对类型差异更大语言和非线性语言混杂尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
- 代码相关资源:https://github.com/MINUKIMS/language-orthogonalization — 链接可访问(HTTP 200)
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
16. 答对不等于听懂:用六维过程分拆开音频推理的感知与推进
英文题目:Beyond Accuracy: ARIA-Rubrics for Evaluating Audio Reasoning in Large Audio Language Models
标签:#音频问答 | #评测协议 | #音频大模型 | #人类参与评测
评分:7.0/10 | 创新 1.6/2 | 技术严谨 1/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1.1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5
排名:前50% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Yupei Li:Imperial College London, UK
- Qiyang Sun:Imperial College London, UK
- Mohamed Mady:机构信息未在 arXiv HTML 中可靠披露
- Chenxi Wang:机构信息未在 arXiv HTML 中可靠披露
- Zhengwei Gong:Shanghai Jiao Tong University, Shanghai, CN
- Berrak Sisman:机构信息未在 arXiv HTML 中可靠披露
- Björn Schller:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
该工作针对大型音频语言模型(Large Audio Language Models, LALMs)多选题推理中准确率虚高、无法区分真实推理与猜测或模式捷径的问题,输入为音频加问题与选项,输出为结构化思维链(Chain-of-Thought, CoT)与答案,难点在于感知幻觉与跨模态对齐难以被纯文本指标捕捉。方法链分三段:先用感知、分析、推理、答案四步CoT提示迫使模型外显中间过程,输出进入六维自动评分,覆盖声学接地、步间连贯、内容实质、因果增益、逻辑推进与音频词密度,最后取六指标无加权均值得到ARIA分并映射到推理、脚手架、装饰三种模式。与依赖人工金链或纯大模型黑盒裁判的已有方法不同,该框架以可检查算子为主,仅在内容充实度上用小模型打分,兼顾透明与音频原生性。在MMAR与MMAU-mini各1000题、9个模型的评测中,完整ARIA与人类5点量表评分的Spearman相关达0.671,显著高于任一单指标,最优单指标仅0.563,支撑整体优于局部之主张。结论仅适用于有明确选项的多选音频推理,对开放式生成、长音频与强噪声场景尚未验证,且依赖既定提示结构与英文词表,外推需谨慎。原文未披露训练、推理或部署成本。
🔗 开源资源
第三方资源:https://huggingface.co/fse/word2vec-google-news-300 — 暂时无法访问
第三方资源:https://huggingface.co/typeform/distilbert-base-uncased-mnli — 暂时无法访问
第三方资源:https://huggingface.co/cross-encoder/nli-MiniLM2-L6-H768 — 暂时无法访问
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
17. 固定模长换可预测性:SphereVAE 把连续语音表示压到球面上治自回归漂移
标签:#语音编码 | #变分自编码器 | #自回归模型 | #文本到语音 | #语音
评分:7.0/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 1/1.5 | 清晰度 0.7/1 | 影响力 1/1.5 | 开源 1/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Haoyu Zhang:Fuxi AI Lab, NetEase Inc., Hangzhou, China
- Jingbin Hu:Fuxi AI Lab, NetEase Inc., Hangzhou, China
- Hanke Xie:Fuxi AI Lab, NetEase Inc., Hangzhou, China
- Qirui Zhan:Fuxi AI Lab, NetEase Inc., Hangzhou, China
- Wenhao Li:Fuxi AI Lab, NetEase Inc., Hangzhou, China
- Ziyu Zhang:Fuxi AI Lab, NetEase Inc., Hangzhou, China
- Xiaming Ren:Fuxi AI Lab, NetEase Inc., Hangzhou, China
- Yue Li:Fuxi AI Lab, NetEase Inc., Hangzhou, China
- Xunyu Zhu:Fuxi AI Lab, NetEase Inc., Hangzhou, China
- Zhipeng Chen:Fuxi AI Lab, NetEase Inc., Hangzhou, China
- Lei Xie:Fuxi AI Lab, NetEase Inc., Hangzhou, China
📌 核心摘要
连续表征零样本语音合成的输入是文本加提示语音,输出是长时语音波形,难点在于自回归逐步预测连续隐向量时单步方向与范数误差会沿时间累积为隐漂移。所提超球面变分自编码器 SphereVAE 先由编码器输出方向分支与集中度分支并经归一化得到单位超球面上的幂球面 Power Spherical 后验,再以均匀先验做散度正则并重采样解码重建波形,随后将该有界方向序列交给 VoxCPM 式自回归加扩散后端做零样本生成。与欧氏高斯隐空间同时编码范数与方向相比,该设计以固定范数迫使信息集中于方向变化,从而切断经由范数发散的漂移通道。在 SeedTTS-eval 零样本设置下 SphereVAE 英文词错误率与中文字符错误率分别为 5.305% 和 1.141%,均为所比四种变分自编码器中最低并保持说话人相似度相当。作者承认球面约束损害单步重建自由度,长文本外推与漂移因果度量尚未充分验证。原文未披露训练、推理或部署成本。
🔗 开源资源
代码相关资源:https://github.com/ASLP-lab/SphereVAE — 链接可访问(HTTP 200)
演示资源:https://haoyuzhang3.github.io/SphereVAE_Demo/ — 链接可访问(HTTP 200)
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
18. 从文本标签到波形边界:NVV-Locator 如何把非言语发声钉在时间轴上
标签:#音频事件检测 | #多任务学习 | #基准测试 | #数据集
评分:7.0/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0.2/1.5 | 可复现 0.1/0.5 | 工程/实践 1/1.5
排名:前50% | 文档类型:数据集与基准 | arXiv 原文
👥 作者与机构
- Yuang Cao:机构信息未在 arXiv HTML 中可靠披露
- Bingshen Mu:机构信息未在 arXiv HTML 中可靠披露
- Zhennan Lin:机构信息未在 arXiv HTML 中可靠披露
- Guojian Li:机构信息未在 arXiv HTML 中可靠披露
- Haoyue Zhan:Shanghai Lingguang Zhaxian Technology, China
- Jie Liu:Shanghai Lingguang Zhaxian Technology, China
- Chuan Xie:Shanghai Lingguang Zhaxian Technology, China
- Qiang Zhang:Shanghai Lingguang Zhaxian Technology, China
- Liumeng Xue:Nanjing University, China
- Lei Xie:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
本文面向连续语音中非言语发声的波形级时序定位,输入为音频与去除事件标记的词级转录,输出为每个事件的类别与声学起止时间,难点在于类别碎片化、边界模糊与人工标注昂贵。方法链首先统一26类标签并经双大模型校验筛选可定位样本,其输出的含事件转录进入转录引导的强制对齐得到词间粗候选区间。粗区间再经能量轮廓收缩为声学边界,精化后的时间戳连同类别均衡与多视图增强样本共同监督定位模型训练。定位模型在转录每单元后插入五槽模板,并行预测词边界与事件类别和起止,避免自回归时间戳的误差传播。与把非言语发声仅作转录标签的大音频模型不同,该槽位并行建模把词汇对齐与事件定位解耦为同序列结构化填充,因而兼顾词时间与事件边界精度。在NVV-TimeBench基准下,NVV-Locator的Macro F1指标为70.2%,高于Gemini-2.5-Pro的49.8%。该结论适用边界受限于中英文朗读类语音与封闭26类集合,对重叠语音、强噪声与开放新类别尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
- 演示资源:https://nvv-locator.github.io/Demo-Page/ — 链接可访问(HTTP 200)
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
19. 松标注学出松边界:因果一致性伪标签为何收得过紧
英文题目:Over-Tightening-Aware Pseudo-Labeling for Tight-Boundary Speaker Diarization
标签:#说话人分离标注 | #弱监督学习 | #严格因果 | #语音识别
评分:7.0/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5
排名:前50% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Shota Horiguchi:NTT, Inc., Japan
- Takanori Ashihara:NTT, Inc., Japan
- Marc Delcroix:NTT, Inc., Japan
- Naohiro Tawara:NTT, Inc., Japan
- Alexis Plaquet:NTT, Inc., Japan
📌 核心摘要
输入为多人混合录音,输出为每说话人每帧的语音活动,要求仅用松散标注训练仍输出紧边界,说话人分离标注(speaker diarization)在此面临暂停填充与起止填充混杂且跨语料标准不一的难点。方法链分三步:先由因果模型(causal model)与反因果模型(anticausal model)生成平均伪标签并只收紧内部暂停而强制保留松散起止边界,再为双向单向模型各加1 s预热上下文以消除块首冷启动漏检,最后在双模型协同训练时并行更新最终非因果模型(non-causal model)并以其验证性能做早停。与前人同时收紧暂停与边界的做法不同,该设计承认边界填充量级很小从而避免误伤起止段,对下游不可恢复的漏检更友好。在AMI-MHM紧标签评测下,所提完整方法将说话人分离错误率(diarization error rate,DER)从18.28%降至16.40%,大幅逼近14.03%的理想紧标签上限。结论限于EEND向量聚类框架下的近场与会议数据及10 s滑窗设置,对重叠密集或强混淆场景的外推尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
第三方资源:https://huggingface.co/Wespeaker/wespeaker-voxceleb-resnet34-LM — 暂时无法访问
第三方资源:https://huggingface.co/BUT-FIT/diarizen-wavlm-base-s80-md/tree/main/plda — 暂时无法访问
第三方资源:https://github.com/n — 链接可访问(HTTP 200)
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
20. 低资源希腊语合成靠确定性提示词稳住说话人:多语先验加两阶段适配
英文题目:Deterministic Prompting for Speaker-Stable Low-Resource Greek TTS
标签:#文本到语音 | #LoRA | #低资源 | #数据集构建
评分:7.0/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 0.7/1.5 | 开源 1/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5
排名:前50% | 文档类型:系统技术报告 | arXiv 原文
👥 作者与机构
- Georgios Syllas:机构信息未在 arXiv HTML 中可靠披露
- Efthymios Georgiou:机构信息未在 arXiv HTML 中可靠披露
- Kosmas Kritsis:机构信息未在 arXiv HTML 中可靠披露
- Alexandros Potamianos:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
现代希腊语文本到语音 (text-to-speech / TTS) 的输入为希腊语文本加风格描述,输出为单说话人波形,难点在于干净单人数据稀缺、多说话人数据导致音色平均化与希腊语重音韵律难学。该工作先以 WhisperX 对齐加置信度与声学过滤把有声书与社区语音转为短句训练集,再在多说话人池上全量微调多语言编解码模型以迁移语音先验,最后冻结主干并以单人数据训练低秩适配器锁定音色。与随机措辞的生成式提示相比,确定性分箱提示消除了条件方差,使低秩分支能对齐稳定风格信号并保留预训练知识。在 Common Voice 测试集的 50 句可懂度评测中,最优配置词错误率 (word error rate / WER) 为 10.7%,仅高于真人录音的 7.8% 基线 2.9 个百分点,同时双句一致性达 4.24 分而真人为 4.30 分。结论仅限于男性朗读风格的希腊语单说话人场景,未验证跨语言、跨说话人与自发语体的外推。全文披露了全量微调约 20 小时与适配约 2 小时的硬件量级,可作为低算力复现的成本参照。
🔗 开源资源
代码相关资源:https://github.com/gsyllas/greek-stable-tts/tree/main/scripts/data — 链接可访问(HTTP 200)
代码相关资源:https://gsyllas.github.io/greek-stable-tts/ — 链接可访问(HTTP 200)
模型相关资源:https://gsyllas.github.io/greek-stable-tts/ — 链接可访问(HTTP 200)
数据相关资源:https://github.com/gsyllas/greek-stable-tts/tree/main/scripts/data — 链接可访问(HTTP 200)
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
21. 视频推理为何仍贵:沿采样编码连接器与解码四段查开销
标签:#音视频理解 | #系统综述 | #高效推理 | #音视频 | #多模态模型
评分:7.0/10 | 创新 1.3/2 | 技术严谨 1/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 0.5/1.5 | 开源 1/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5
排名:前50% | 文档类型:综述 | arXiv 原文
👥 作者与机构
- Killian Steunou:机构信息未在 arXiv HTML 中可靠披露
- Yannis Tevissen:机构信息未在 arXiv HTML 中可靠披露
- Mounîm A. El Yacoubi:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
视频大语言模型以采样帧与同步音频及文本提示为输入,以问答、描述、检索与时序定位生成为输出,难点是帧数与上下文长度同时推高编码与注意力开销而限制实时部署。该综述先界定编码器-连接器-大语言模型系统边界与纳入标准并检索至2026年8月的候选机制,其输出的机制集合进入按管线阶段划分的归纳。接着按输入构建、编码器计算、表征与连接器、大语言模型执行与状态归类上百种机制,明确上游时序覆盖如何转化为下游词元与缓存预算。再在共享主机与输入协议下组装文献报告的精度-代价对照并与异构跨文证据分离,其鉴别的共享对照与评测缺口直接支撑视听联合预算与未来方向判断。与以往按压缩算子组织的工作相比,其差异是把上游选择与编码代价和下游词元预算与缓存增长显式关联,并要求计入选择器自身开销与计算量统计边界,具有系统权衡意义。在LLaVA-Video-7B共享主机与64帧输入协议基准评测下,TSPO方法的LongVideoBench得分为63.9,高于均匀基线的58.9。该结论适用边界受限于多项选择问答与离线长视频评测,尚未验证生成式描述、定位与流式长视频的外推。在延迟与推理开销方面,原文报告STC在复用75%缓存特征时将ViT编码延迟降低24.5%并将大语言模型预填充延迟降低45.3%,表明节省的词元预算须与编码代价一并评估。
🔗 开源资源
- 代码相关资源:https://github.com/momentslab/awesome-efficient-videollm — 链接可访问(HTTP 200)
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
22. 科学语音助手为何听懂却答不严:识别感知推理发音四段断链诊断
英文题目:\(S^3\)-Bench: Evaluating Speech Interaction Models as Scientific Voice Assistants
标签:#语音对话系统 | #基准设计 | #音频问答 | #语音 | #基准测试
评分:6.9/10 | 创新 1.5/2 | 技术严谨 1.3/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5
排名:前50% | 文档类型:数据集与基准 | arXiv 原文
👥 作者与机构
- Heyang Liu:机构信息未在 arXiv HTML 中可靠披露
- Jiayi Huang:机构信息未在 arXiv HTML 中可靠披露
- Wenyang Xiao:机构信息未在 arXiv HTML 中可靠披露
- Ziyang Cheng:机构信息未在 arXiv HTML 中可靠披露
- Lixin Zhang:机构信息未在 arXiv HTML 中可靠披露
- Zhen Liu:机构信息未在 arXiv HTML 中可靠披露
- Miao He:机构信息未在 arXiv HTML 中可靠披露
- Ronghua Wu:机构信息未在 arXiv HTML 中可靠披露
- Qunshan Gu:机构信息未在 arXiv HTML 中可靠披露
- Yanfeng Wang:机构信息未在 arXiv HTML 中可靠披露
- Yu Wang:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
该任务输入为含罕见术语、缩写口语读法与符号公式的英语科学语音提问,输出要求可听懂的语音回答并在多轮中按听众水平持续解释前沿概念,难点在于缩写映射与符号verbalization极易失真且多轮易丢失证据。构建链先从17个公开科学基准筛选文本并做发音校准得到待合成语料,该语料经Qwen3-TTS合成与ASR回译加人工核验后保留1980条知识问答,平均时长12.74 s。同一语料链进一步从论文语料抽取213个主题生成概念、机制、里程碑、特点与应用五方面渐进对话,形成知识与对话两套评测语料。评测链将单轮解耦为识别转写、感知概念关联、知识推理作答与语音生成发音分别打分,其阶段得分再输入双智能体模拟四档专业度用户的多轮追问以检验事实一致性。与通用语音对话评测相比,该工作把科学表达规范与听众适配作为显式诊断维度,使术语错误与发音退化的权衡可被定位,具有明确领域针对性。在S3-Knowledge评测下,Whisper-large-v3的术语EER在Hard条件下为30.56%,高于Base条件下的8.35%。其结论适用边界受限于合成英语朗读查询与受控对话流程,对真实口音、自发重叠与中文科学口语的外推尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
23. 未知发射时刻下把被动定位留作 ToA:用边一致 ADMM 分给每个接收器算
标签:#声源定位 | #信号处理 | #形式化分析 | #麦克风阵列
评分:6.8/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 0.8/1.5 | 清晰度 0.8/1 | 影响力 0.7/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Anton Tolstonogov:机构信息未在 arXiv HTML 中可靠披露
- David Cabecinhas:机构信息未在 arXiv HTML 中可靠披露
- Pedro Batista:机构信息未在 arXiv HTML 中可靠披露
- Antonio Pascoal:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
被动声源定位输入为各接收站已知位置与带噪到达时刻戳,输出为目标位置与未知发射时刻,难点在于无发射同步参考且若先做差分会引入跨节点相关噪声与双曲耦合。方法链分三步:先将最小二乘目标保持在ToA域并为每节点维护位置与时刻局部副本,再用边变量分布式交替方向乘子法施加邻居一致性约束,最后交替执行闭式局部最小化、边变量平均与对偶上升直至残差门限。局部闭式更新以上一步共识量与对偶量为输入,直接输出下一轮局部估计并送入边平均,从而避免嵌套数值求解。与先做到达时间差预处理再解双曲方程的路线相比,该机制省去配对通信与相关噪声建模,使子问题仅依赖单节点量测与邻居共识量。原文未提供可核对的关键定量结果。结论适用边界受限于单目标可分辨、时钟已同步、目标远离接收站且图连通的二维八节点仿真,尚未验证三维、异步、多源混叠与真实海试。原文未披露训练、推理或部署成本。
🔗 开源资源
- 代码相关资源:https://github.com/bioniwulf/playground-distributed-localization-admm — 链接可访问(HTTP 200)
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
24. 不用传专家编号的量化扩容:UniStream 如何做 48 kHz 因果流式通用音频编码
英文题目:UniStream: Multi-Expert Residual Vector Quantization for 48 kHz Causal Streaming Audio Coding
标签:#音频编码 | #向量量化 | #混合专家模型 | #严格因果 | #流式处理
评分:6.7/10 | 创新 1.3/2 | 技术严谨 1.2/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.1/1.5
排名:前50% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Mingyu Zhao:Tsinghua Shenzhen International Graduate School, Tsinghua University, Shenzhen, China
- Zhiyong Wu:Tsinghua Shenzhen International Graduate School, Tsinghua University, Shenzhen, China
📌 核心摘要
输入为48 kHz单声道通用音频,输出为可流式传输的离散码流与重建波形,难点在于单一共享残差码本难以同时刻画语音共振峰、音乐谐波与环境纹理,且因果约束限制了上下文利用。因果卷积编码器先将波形下采样320倍映射为150 Hz的256维连续隐表示,接着多专家残差向量量化模块以前层累积重建为路由依据逐层精化残差并叠加得到量化隐表示,然后因果解码器由量化隐表示重建波形,训练期另有流匹配网络以量化表示为条件预测指向连续隐表示的速度场以正则化隐空间且推理时完全移除。与已有专家量化相比,路由仅依赖编解码双方均可复现的历史重建状态,解码端无需额外传输专家标识即可复现专家选择与加权,从而在增加5.5M参数下扩展量化容量且不增加码流开销。在LibriSpeech测试集评测设置下,UniStream-Top1的语音Mel-D指标为8.21,低于EnCodec的13.07。该结论适用边界限于客观指标与固定测试子集,未经主观听音验证,且音乐谐波重建仍弱于同类参考系统。部署时在A100硬件上推理开销对应实时率为0.144,延迟下界约6.7ms,在CPU上约为1.05。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
25. 拒答之后仍可被插话:全双工语音模型生成中安全的松动
英文题目:DuplexJail: Safety Alignment Breaks Under Spoken Interruption in Full-Duplex Models
标签:#全双工语音交互 | #评测协议 | #音频安全 | #语音
评分:6.6/10 | 创新 1.5/2 | 技术严谨 1/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Jaechul Roh:机构信息未在 arXiv HTML 中可靠披露
- Deepak Chandran:机构信息未在 arXiv HTML 中可靠披露
- Amir Houmansadr:机构信息未在 arXiv HTML 中可靠披露
- Andrea Fanelli:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
全双工语音模型需在持续监听用户音频的同时生成语音,输入为有害请求语音叠加后续打断语音,输出为完整流式应答,难点在于初始拒答后仍可能被实时到达的用户语音转向。DuplexJail先以IndexTTS2合成固定且与请求无关的三条打断语音并做峰值归一化重采样,再按有害请求结束后的固定延迟或流式文本中拒答线索触发经用户声道注入,使打断与模型发声重叠,最后对整段应答经Whisper-Large-v3转写并用HarmBench-Llama-2-13B判有害性,上一步的时序信号直接决定下一步语音与文本的竞争关系。与改写文本或优化后缀不同,该方法不编辑助手词元而利用听说并发的信道竞争,具有音频原生性。在AdvBench基准下,PersonaPlex-RL引导补全1.0s固定延迟条件的整段攻击成功率指标为48.7±0.4%,高于基线条件的9.4±0.6%。该结论适用边界受限于模型与提示措辞,对FLM-Audio与BayLing-Duplex效果减弱且尚未验证真实人声与噪声外推。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
26. 把互联网视频先验搬进声道核磁:Arti-JEPA 何时帮得上音素,何时帮不上
标签:#静默语音接口 | #自监督学习 | #领域适应 | #言语障碍
评分:6.6/10 | 创新 1.4/2 | 技术严谨 1.2/1.5 | 实验充分 1.1/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 0/1.5 | 可复现 0.4/0.5 | 工程/实践 1/1.5
排名:前50% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Hong Nguyen:机构信息未在 arXiv HTML 中可靠披露
- Sean Foley:机构信息未在 arXiv HTML 中可靠披露
- Christina Hagedorn:机构信息未在 arXiv HTML 中可靠披露
- Yijing Lu:机构信息未在 arXiv HTML 中可靠披露
- Sudarsana Reddy Kadiri:机构信息未在 arXiv HTML 中可靠披露
- Dani Byrd:机构信息未在 arXiv HTML 中可靠披露
- Shrikanth Narayanan:organization= Ming Hsieh Department of Electrical and Computer Engineering, University of Southern California, city=Los Angeles, state=CA, country=USA;organization=Department of English, College of Staten Island, City University of New York, city=New York, state=NY, country=USA;organization=Department of Linguistics, University of Potsdam, country=Germany;organization=Department of Linguistics, University of Southern California, city=Los Angeles, state=CA, country=USA
📌 核心摘要
输入为静音中矢状面实时磁共振视频,输出为逐帧音素身份与流利与否及术前术后发音区分,难点在于标注稀缺、音素仅持续数十毫秒且单切片灰度低分辨率与自然视频差异大。方法先复用V-JEPA 2 ViT-L先验并复制灰度通道以适配预训练块嵌入,将约62小时无标注声道视频按50帧率与256像素网格切分为时空管块。接着在掩码潜变量预测目标下继续自监督训练转向构音流形,并以崩溃监控在留出说话人上跟踪表征统计以避免常数坍缩。最后冻结编码器并缓存时空嵌入,仅训练轻量注意力及双向长短时记忆探针完成帧级与片段级解码,前一步的冻结表征直接作为后一步探针的输入。与像素重建的VideoMAE相比,联合嵌入预测只要求预测指数滑动平均编码器的潜向量,丢弃不可预测的光度细节而保留可预测的运动动力学,因而更适配低对比构音运动。在Annot-16训练、USC LSS跨域测试的帧级音素识别任务下,Arti-JEPA的帧级指标Cohen κ为0.352,高于V-JEPA 2的0.156。该结论适用边界在于长时失流利类型划分与大范围切除后重建尚未验证,类型分类召回坍缩且仅三例声门切除患者受限。训练成本受限于单块V100 32GB硬件,有效批量128与26875次更新远小于八卡并行的1024批量与72000次更新,且浮点精度与激活检查点亦受限。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
27. 词探针的高分是记住了发音,还是记住了词本身
标签:#音频分类 | #统计分析 | #可解释性 | #语音
评分:6.6/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 1/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:前50% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Robin Huo:机构信息未在 arXiv HTML 中可靠披露
- Ewan Dunbar:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
输入为连续语音帧级自监督表示,输出为帧级词身份,难点在于词身份可由局部音素序列唯一确定,故高词分类精度未必证明模型学到超越语音形式的词汇表征。本文先对 HuBERT 与 wav2vec 2.0 表示做零均值单位方差标准化,再以岭回归从独热音素、二音素或三音素标签预测表示并相减得到残差表示,最后用五折交叉验证线性 Softmax 探针分别检验音素与词身份可解码性。标准化输出进入残差化以匹配分布并暴露可线性去除的音素分量,残差化输出再进入词探针以检验超越局部音素的词信息是否残留。相对全局余弦相似度方法,该线性残差化允许信息分布在子空间而不被无关维度淹没,并可直接用于下游词发现流水线。在LibriSpeech dev-clean语料评测设置下,音素残差化方法的标准化编辑距离NED指标为.463,低于原始表示基线的.508。结论适用边界仅限英语朗读语音后期变换器层,对语义句法是否编码未做区分,对更长上下文与跨语言外推尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
- 模型相关资源:https://github.com/facebookresearch/fairseq/blob/main/examples/hubert/README.md — 链接可访问(HTTP 200)
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
28. 有方向选择却更多样:爱尔兰传统曲调如何用新曲抵消走红曲的集中
标签:#音乐理解 | #统计分析 | #音乐 | #音乐信息检索
评分:6.5/10 | 创新 1.6/2 | 技术严谨 1.2/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:前50% | 文档类型:应用研究 | arXiv 原文
👥 作者与机构
- John M. McBride:机构信息未在 arXiv HTML 中可靠披露
- Armand. M. Leroi:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
输入是The Session平台2012年12月至2026年3月每周曲目收藏动态,输出是对每首曲调相对适应度与曲库多样性演化的解释,难点在于区分随机漂变、依频选择与曲调固有差异并处理稀疏新增与移除缺失。 方法链分三步推进:先将每周新增收藏建模为对上一周分布的多项抽样,比较中性、频率依赖与每曲固定适应度假设,其输出的每曲适应度偏移进入下一步。 再用饱和项修正每用户每曲只能收藏一次的上限以得到可靠适应度估计,并以社会声望与旋律特征回归解释其来源。 最后用熵与活跃曲目数追踪多样性,并以双曲集合共现相对随机组装零模型检验连锁搭载效应。 与频率依赖模型相比,每曲定向选择模型以压倒性优势拟合数据,表明曲调成败主要源于其自身特性,且社会变量与旋律变量贡献基本非重叠。 在5折交叉验证设置下,样本内指标R2为0.42,高于交叉验证指标R2的0.29。 结论适用边界仅限于该在线社区的重构收藏行为,不能外推至真实口传学习或跨文化传统,且对适应度时变与网络结构的检验尚不充分。 原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
29. 不追求逼真、追求可控:用功率谱模板与小规模搜索做语音翻译鲁棒训练
标签:#语音翻译 | #数据增强 | #鲁棒性 | #环境声
评分:6.5/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 1/1.5 | 清晰度 0.7/1 | 影响力 0.9/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5
排名:前50% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Niramay M. Patel:机构信息未在 arXiv HTML 中可靠披露
- Bibek Behera:机构信息未在 arXiv HTML 中可靠披露
- Raksha Sharma:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
语音到文本翻译需将含噪语音映射为目标语言文本,难点在于交通轰鸣、瞬态事件与人声干扰在频谱包络与时变特性上差异显著,训练分布难以覆盖部署时的多样声学环境。本文提出NOPE-HYPE结构化仿真工作流,首先以Welch平均估计各环境的功率谱密度模板并做覆盖最优原型约简,选出k=3或k=4个代表性环境以聚焦后续拟合与调优。其次可控模拟器SIM承接选定原型目标,经傅里叶域幅度匹配与随机相位合成平稳背景床并做校准,再叠加慢变包络动力学、瞬态事件率与人声干扰及混响控制,并按采样信噪比与干净语音混合生成训练数据。然后在咖啡馆、洗衣房与汽车三原型模板上做9配置乘3模板的27轮结构化超参扫描,按鲁棒目标选出跨语言稳定的默认配置cfg03与cfg06供复用。与仅匹配粗粒度频谱颜色的高斯或粉色噪声不同,该链条显式分离平稳谱结构、包络动力学、瞬态与混响控制,使各因素可独立归因与复用。在50小时训练与5小时测试的英语到印地语语料评测设置下,SIM噪声训练的BLEU为48.996,高于均衡真实环境噪声训练的48.959。该结论适用边界受限于所用DEMAND子集、两对语言与中等微调预算,跨采集设备与强混响的外推尚未验证,原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
30. 流式多说话人识别要在单实例省内存与多实例保重叠之间选边
标签:#语音识别 | #模型融合 | #说话人分离标注 | #流式处理 | #模型比较
评分:6.5/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5
排名:前50% | 文档类型:系统技术报告 | arXiv 原文
👥 作者与机构
- Taejin Park:机构信息未在 arXiv HTML 中可靠披露
- Ivan Medennikov:机构信息未在 arXiv HTML 中可靠披露
- Kunal Dhawan:机构信息未在 arXiv HTML 中可靠披露
- Weiqing Wang:机构信息未在 arXiv HTML 中可靠披露
- Jagadeesh Balam:机构信息未在 arXiv HTML 中可靠披露
- Boris Ginsburg:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
流式多说话人识别以连续重叠语音流为输入,需在线输出多路词序列及其说话人归属,难点在于重叠语音分离、词级说话人对齐错位以及长对话上下文保持与低延迟约束。该框架以流式ASR底座与流式分离标注底座为共同起点,先由分离标注器输出说话人活动与到达序说话人缓存,为后续识别提供条件信号。接着掩蔽输入分支将说话人掩码作用于声学特征以并行解码各说话人,而词级串行输出训练分支则通过说话人核将缓存嵌入编码器状态以维持无限时长监督,并输出串行词与说话人标记。为解决短切训练与长时标注的标签错位,排列不变动态时间规整同时对齐词序列与说话人置换并结合说话人频率代价选出最优排列,使短时训练可泛化到长流推理。在四数据集平均评测设置下,SSA在真实分离标注条件的cpWER为23.36,高于oracle分离标注条件的16.18。上述结论适用边界限于一至四人英语会议与电话对话的CH109、Mixer6与AMI评测,尚未验证大规模多说话人、强噪声与非英语场景的外推。训练成本涉及单节点8×NVIDIA Tesla A100 GPU的两阶段训练,流式推理延迟为1.04s,多实例条件解码会随说话人数增加内存与计算量。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
31. 把谱面与演奏对齐成文本:MuNo-SP 如何让模型听见弹了什么与怎么弹
英文题目:Unifying Score and Performance for Fine-Grained Music Understanding in Audio-Language Models
标签:#音乐理解 | #数据集构建 | #音乐 | #数据集
评分:6.5/10 | 创新 1.4/2 | 技术严谨 1.2/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.1/0.5 | 工程/实践 1/1.5
排名:前50% | 文档类型:数据集与基准 | arXiv 原文
👥 作者与机构
- Milan Liessens Dujardin:机构信息未在 arXiv HTML 中可靠披露
- Song-Ze Yu:机构信息未在 arXiv HTML 中可靠披露
- Kevin Miao:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
本文面向古典钢琴录音与对齐乐谱的细粒度理解,输入为音频演奏与乐谱结构,输出为带时间戳的长篇听觉分析与可听问答,难点在于同时还原音高和声内容与力度分句踏板等实现方式。数据工厂先以多演奏共识清洗公共乐谱并保留溯源,输出干净乐谱进入对齐环节。接着保留原始演奏并经转换轨迹传播精化后的 score-performance 对应,再接入人工标注的音符级对齐,形成统一时序。然后将富时间结构转为统一文本表示并用大模型做曲式切分搭建脚手架,最终生成长分析并蒸馏为问答。与ABC与MIDI-as-text相比,该表示显式保留声部归属记谱分组反复展开与踏板,避免把分解伴奏与旋律压成单线,因而更可解释且显著小于带时间戳的乐谱。在MuSP-Bench去除识别题后四百余题的评测设置下,MuNo-SP的准确率为80.5%,高于最强基线的54.5%。结论适用边界受限于西方古典钢琴与高置信度对齐曲目,未验证音色录音声学外推与新音频语言模型训练效果。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
32. 词与笑声同序列解码:面向双语非言语声的源自适应数据整理
英文题目:Source-Adaptive Data Curation for Bilingual NVV-Aware ASR
标签:#语音识别 | #数据集构建 | #多语言 | #数据增强
评分:6.3/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5
排名:前50% | 文档类型:系统技术报告 | arXiv 原文
👥 作者与机构
- Yuang Cao:机构信息未在 arXiv HTML 中可靠披露
- Qirui Zhan:机构信息未在 arXiv HTML 中可靠披露
- Jingbin Hu:机构信息未在 arXiv HTML 中可靠披露
- Ziyu Zhang:机构信息未在 arXiv HTML 中可靠披露
- Yunxiang Chen:机构信息未在 arXiv HTML 中可靠披露
- Houdun Liu:机构信息未在 arXiv HTML 中可靠披露
- Shuo Feng:机构信息未在 arXiv HTML 中可靠披露
- Bengu Wu:机构信息未在 arXiv HTML 中可靠披露
- Lei Xie:机构信息未在 arXiv HTML 中可靠披露
- Liumeng Xue:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
面向中英双语非言语发声感知识别需从波形直接预测交织词与16类行内标签的序列,难点在于细粒度事件易混淆且须相对转写定位,而中英发音风格与标注分布差异进一步加剧跨源泛化难度。方法先以词汇重映射改造Whisper-medium,将16类标签复用未用词条表示为原子标记,与词共享解码空间实现单序列自回归联合生成并关闭时间戳预测。其统一输出格式进入公开语料提纯,先做标签归一统一异构标注,再经噪声与变速扩增增加多样性并由多模态大模型做接受拒绝过滤得到干净监督。提纯后的可控监督再与影视媒体挖掘互补,经增强去噪与端点切分获得词级脚手架后由生成式标注插入修正标签形成自发样本,三路连同无标签语音负例混合训练。与外挂事件分类器或后对齐方案不同,该设计将识别与相对定位内化为解码过程,并按来源适配数据策略以兼顾可控性与自发多样性。在官方终测1946句双语评测协议下,提议系统的双语FinalScore分数从基线原始公开数据的33.32升至53.61。英文词错误上升与呼吸喘息等细粒度类别偏弱构成适用边界,该英文退化在更广泛域外推中尚未验证,而训练成本受限于8卡RTX 4090全参数微调与bfloat16精度对应硬件配置。
🔗 开源资源
- 第三方资源:https://nvvspeech-challenge.github.io — 链接可访问(HTTP 200)
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
33. 冻住一半时域滤波器:Orukeet 用拟合 Gabor 核约束多语识别器
标签:#语音识别 | #信号处理 | #多语言 | #语音
评分:6.1/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 0.8/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5
排名:前50% | 文档类型:模型报告 | arXiv 原文
👥 作者与机构
- Nathan Roll:机构信息未在 arXiv HTML 中可靠披露
- Irene Yi:机构信息未在 arXiv HTML 中可靠披露
- Büşra Marşan:机构信息未在 arXiv HTML 中可靠披露
- Vianney Grenez:机构信息未在 arXiv HTML 中可靠披露
- Gabriel Stein:机构信息未在 arXiv HTML 中可靠披露
- Momcilo Mrkaic:机构信息未在 arXiv HTML 中可靠披露
- Pavle Padjin:机构信息未在 arXiv HTML 中可靠披露
- Vladimir Zeljkovic:机构信息未在 arXiv HTML 中可靠披露
- Calbert Graham:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
多语言语音识别需将多语种声学语音转写为带大小写与标点的文字,难点在于口音、领域与低资源语言泛化及大模型适应的稳定性。该方法先对多语言适应后Parakeet TDT 0.6B v3编码器中24层共24576个九抽头时域深度卷积核逐个拟合加博尔函数并计算归一化平方误差排序,输出全局误差排名。接着将误差最小的12288个核替换为纯解析拟合函数且不带偏置或可学习残差,并全程冻结为普通卷积权重送入后续训练。最后冻结上述抽头而训练其余网络,以换能器损失、块与卷积输出教师匹配及词符时长蒸馏做恢复,再经多语言多口音适应补偿扰动。与可学习前端或全量微调不同,结构约束直接来自已学滤波器形态并以原架构原算子推理,保持张量形状与算子数量不变。在FLEURS多语言基准下,Orukeet的混合词错误率(Word Error Rate,WER)为9.85%,低于Parakeet的11.01%。其适用边界受限于最终适应与选点均使用LibriSpeech test-other共2939条录音,且法语与希腊语出现退化,向重叠训练样本外的外推尚未验证。训练成本为单块40 GB A100硬件上以BF16完成4035次与168次更新,推理开销未增加。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
34. 不用教师也能学轨迹跳转:自蒸馏一致性轨迹的快速语音增强
英文题目:Teacher-Free Self-Distilled Consistency Trajectory Learning for Fast Speech Enhancement
标签:#语音增强 | #知识蒸馏 | #语音 | #高效推理
评分:6.1/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 0.8/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5
排名:前50% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Shuubham Ojha:机构信息未在 arXiv HTML 中可靠披露
- Carol Espy-Wilson:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
语音增强需将含噪复数谱观测映射为干净语音,薛定谔桥虽以干净端与含噪端固定边际消除先验失配,但多步逆向去噪延迟大。第一阶段仅在目标时间等于源时间处回归训练边界去噪器,为轨迹学习提供干净估计起点。第二阶段以与学生同构的指数滑动平均副本单步去噪再经桥均值重投影生成中间桥状态,学生直接学习源到目标的快捷映射并保留回归锚定。第三阶段在快捷与回归目标上叠加多分辨率短时傅里叶变换波形感知损失微调,推理时按几何网格链式执行两步快捷跳转。与依赖外部预训练教师提供轨迹目标的SBCTM不同,该自蒸馏以自身历史生成监督,省去完整教师训练并解除质量上限绑定,且不用可微PESQ直优评测指标。在VoiceBank+DEMAND评测设置下,本方法的PESQ为3.01,低于SBCTM的3.54。该结论适用边界受限于16kHz受控加噪语料,尚未验证跨库与真实混响低信噪泛化。训练成本为单张NVIDIA RTX 3090上三阶段每轮分别约需19.3分钟、45.2分钟和64.6分钟,推理开销仅为2次网络评估。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
35. 不对概率取平均,对名次取平均:用排序聚合绕开跨模态置信度量纲
英文题目:Robust Rank Aggregation for Multimodal Speech-Based Alzheimer’s Disease Detection
标签:#病理语音评估 | #模型集成 | #语音 | #多模态学习 | #语音生物标志物
评分:6.0/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 0.5/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5
排名:前50% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Zemin Jin:机构信息未在 arXiv HTML 中可靠披露
- Tomoko Matsui:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
阿尔茨海默病语音检测以自发语音波形及其转录文本为输入,输出受试者是否患病的二分类标签,难点在于小样本下声学与语言线索互补但异构分类器后验概率尺度不可比,直接平均会扭曲置信度排序。该方法先用冻结HuBERT-large与RoBERTa-base分别抽取声韵律与词汇语义嵌入,并训练多正则化逻辑回归得到后验概率。接着将每个测试后验映射为其在训练集留一法外折预测分布中的百分位并平均后以0.5阈值判决,从而保留排序而不受单调变换影响。最后仅当随机森林在手工停顿与内容特征上高置信且与排名预测分歧时才覆盖结果,实现可解释的残差修正。与直接平均概率相比,该机制以归一化排名聚合消除尺度失配,并用高置信门限限制手工分支的干预,避免不可靠校正损害集成。在ADReSSo2021基准下,置信门控校正后F1指标为89.86%,从训练队列外折参考的88.57%升至89.86%。该结论的适用边界受限于仅在ADReSS2020与ADReSSo2021两个英语图片描述小数据集上验证,尚未验证向其他语言与采集条件的推广。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
36. 整句向量不够用:把发音按音素对齐后再判母语口音
英文题目:Phoneme-Aware Pronunciation Representations for L2-English L1-Background Accent Identification
标签:#语言识别 | #迁移学习 | #语音 | #语音学与音系
评分:5.9/10 | 创新 1.2/2 | 技术严谨 1.1/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.7/1.5
排名:前50% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Yangyang Qu:EURECOM, Sophia Antipolis, France
- Massimiliano Todisco:EURECOM, Sophia Antipolis, France
- Nicholas Evans:EURECOM, Sophia Antipolis, France
📌 核心摘要
该任务输入为未见说话人的第二语言英语朗读语音,输出为六类第一语言背景标签,难点在于口音标签易与说话人音色纠缠且口音线索呈音素依赖的局部性,全局向量易将其抹平。所提音素感知发音表示PAID先用冻结Whisper-small编码器提取帧级声学特征,同时用离线强制对齐由转录得到音素区间与音素标识。接着将区间内帧特征均值池化为声学单元并经投影,该输出与可学习音素嵌入拼接形成音素条件发音单元,不使用词或句级文本表示。最后经掩码均值池化聚合为话语向量并由线性分类器预测标签,仅更新投影、音素嵌入与分类器。与全局表征相比,其关键差异是分类器同时看到发音声学实现与意图实现哪个英语音素,而非仅看到混合向量,因而保留局部发音证据。在L2-ARCTIC四折说话人无关协议下,PAID的准确率为81.41%,高于Whisper-Utt的77.12%。该结论适用边界受限于训练与评测时均需转录以做强制对齐的朗读英语,且仅在二十四人单语料上验证,尚未验证自发语音与跨语料外推。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
37. 证据分散且多解:用分角色辩论与淘汰赛留下更站得住的关系判断
英文题目:Who Are They to Each Other? Multi-Agent Reasoning for Speaker Relationship Inference
标签:#音频理解 | #模型集成 | #人类参与评测 | #语音 | #大语言模型
评分:5.6/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:前50% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Yaohan Guan:机构信息未在 arXiv HTML 中可靠披露
- Yen-Ju Lu:机构信息未在 arXiv HTML 中可靠披露
- Yuzhe Wang:机构信息未在 arXiv HTML 中可靠披露
- Junhyeok Lee:机构信息未在 arXiv HTML 中可靠披露
- Jesus Villalba:机构信息未在 arXiv HTML 中可靠披露
- Laureano Moro Velazquez:机构信息未在 arXiv HTML 中可靠披露
- Thomas Thebaud:机构信息未在 arXiv HTML 中可靠披露
- Najim Dehak:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
说话人关系推断以双人自然对话的文本与音频为输入,先判熟人对陌生人二分类,再在熟人内部分朋友、家人、浪漫伴侣、同事等细粒度类型,难点在于线索微弱分散于多轮与词汇声学双通道且容许多种合理解释。本文提出免训练的多智能体竞争框架Multi-Agent Compete,以并行假设与对抗裁决组织推理。第一步由三个智能体独立给出关系判断与证据,保留多个可辩护假设进入淘汰赛。第二步由法官对三路输出做两两比较并按胜负淘汰最弱一路,再将淘汰结果与比较摘要广播给幸存者。第三步两名幸存者结合广播信息修订答案,法官再做最终一对一比较并取胜者修订输出为预测。在文本模态二分类任务测试集下,Multi-Agent Compete的Macro F1为62.5%,高于CortexDebate的62.0%。与鼓励过早共识的同质化辩论不同,该设计以维持多假设竞争延迟收敛,更适配社会线索的歧义性。其结论适用边界受限于单一英文Seamless Interaction基准与高度不平衡类别,纯音频下增益不稳定构成失败条件,多轮法官调用则带来额外推理开销。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
38. 从单人情绪标签转向多人声音互动场:耦合只在共同在场时出现
标签:#语音交互 | #统计分析 | #语音 | #韵律
评分:4.9/10 | 创新 1.4/2 | 技术严谨 1/1.5 | 实验充分 0.7/1.5 | 清晰度 0.7/1 | 影响力 0.7/1.5 | 开源 0/1.5 | 可复现 0.1/0.5 | 工程/实践 0.3/1.5
排名:后 50% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Cy Gorman:机构信息未在 arXiv HTML 中可靠披露
- Yihang Yao:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
本文任务是从四人会议头戴麦克风语音建模关系层面情感组织,输入为重采样至16kHz的60秒无重叠窗口多通道语音与发声活动掩膜,输出为交互场是否构成方向性表达耦合的判断,难点在于短时序列易致自回归滞后选择尺寸膨胀且个体能量同步会混淆关系动态。方法分三步:先用WavLM-Base+连续隐状态保留韵律副语言信息并构造跨层激活离散度表达性指标与能量等对齐代理,输出逐帧表达序列进入下一步。接着按重叠共现与独占发声划分交互机制并在机制连续片段内对表达性做能量残差化以剥离响度混淆,输出净化后片段进入检验。最后在片段上做多说话人条件向量自回归Granger因果检验并用循环移位零假设校准超额拒绝与方向性支持得分,得到机制与尺度条件化的耦合证据。与趋同式具身同步研究将耦合操作化为特征相似不同,本文以场涌现与方向性为对象并以独占语音下机制崩塌作为关系性证据,具有交互结构可证伪性意义。在AMI会议语料60秒窗口评测下,Window-BH校正下微观重叠Tier A的方向性支持得分DSS=+1窗口占比为23.9%,高于Global-FDR校正条件的21.7%。结论适用边界仅限正式四人AMI会议内亚秒级声音互动,宏观尺度效应暂稳且跨语料外推尚未验证,原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。