共分析 26 篇论文
⚡ 今日概览
✅ 筛选入选 26 篇 → 🔬 深度分析完成
🏷️ 标签说明:本期使用新版受控 taxonomy;站点标签页暂时兼容展示历史标签与新标签。
🏷️ 热门方向
| 方向 | 数量 | 分布 |
|---|---|---|
| #病理语音评估 | 3 篇 | ███ |
| #语音识别 | 3 篇 | ███ |
| #口语意图与槽位识别 | 2 篇 | ██ |
| #音频问答 | 2 篇 | ██ |
| #全双工语音交互 | 1 篇 | █ |
| #强制对齐 | 1 篇 | █ |
| #目标说话人提取 | 1 篇 | █ |
| #符号音乐生成 | 1 篇 | █ |
📊 论文评分排行榜(26 篇,按分数降序)
📋 论文列表
🖼️ 有图的论文会在这里展示首张原论文图;点击图片可打开 arXiv 原图。
🥇 先判断有没有需求,再补全没说出口的那一半:ODU 把需求理解做成显式考题
标签:#口语意图与槽位识别 | #基准设计 | #基准测试 | #音视频 | #语音
评分:8.4/10 | 创新 1.5/2 | 技术严谨 1/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 1.5/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5
排名:前25% | 文档类型:数据集与基准 | arXiv 原文
👥 作者与机构
- Qi Chen:机构信息未在 arXiv HTML 中可靠披露
- Yunfei Chu:机构信息未在 arXiv HTML 中可靠披露
- Haolin He:机构信息未在 arXiv HTML 中可靠披露
- Yifan Yang:机构信息未在 arXiv HTML 中可靠披露
- Zihan Liu:机构信息未在 arXiv HTML 中可靠披露
- Yuxuan Wang:机构信息未在 arXiv HTML 中可靠披露
- Ziyang Ma:机构信息未在 arXiv HTML 中可靠披露
- Ruiyang Xu:机构信息未在 arXiv HTML 中可靠披露
- Meng Gao:机构信息未在 arXiv HTML 中可靠披露
- Yinsong Yan:机构信息未在 arXiv HTML 中可靠披露
- Ling Wang:机构信息未在 arXiv HTML 中可靠披露
- Hui Wang:机构信息未在 arXiv HTML 中可靠披露
- Wen Huang:机构信息未在 arXiv HTML 中可靠披露
- Yiheng Chen:机构信息未在 arXiv HTML 中可靠披露
- Guanrou Yang:机构信息未在 arXiv HTML 中可靠披露
- Qiuqiang Kong:机构信息未在 arXiv HTML 中可靠披露
- Jin Xu:机构信息未在 arXiv HTML 中可靠披露
- Xie Chen:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
全方位需求理解以包含末轮用户片段的多轮音视频或纯音频交互流为输入,输出需求存在性及其时段、转写、消解后的结构化意图、必需上下文与用户画像,难点在于口语欠指定、指示省略依赖视觉声学与对话历史,而请求形措辞又可能来自非用户或非助手对象。构建链先按挑战驱动分类抽取难度目标与日常种子以界定覆盖空间,其输出进入智能体流水线由粗到细生成因果脚本并经纯文本筛查保留需上下文才能还原的样本,再分别合成音视频与组织演员表演录制,最后基于媒体重建标注并经自动校验与人工审核冻结原子关键点。相较以往只评回复质量或封闭标签意图的基准,该工作把需求存在性与开放式语义恢复作为显式目标,并用证据通道标签诊断口语请求与多模态上下文的覆盖差异。在ODU-Bench音视频场景评测下,Gemini 3.1 Pro的Avg.得分为72.6%,高于Gemini 3.7 Flash的Avg.得分69.6%。其适用边界在于日常短交互与中英表演数据,跨长时程与野外噪声的泛化能力尚未验证。结论限于2078个日常短交互与中英双语表演数据,未验证长时程主动交互与真实野外噪声下的外推能力。原文未披露训练、推理或部署成本。
🔗 开源资源
代码相关资源:https://huggingface.co/datasets/qc316/odubench — 链接可访问(HTTP 200)
数据相关资源:https://huggingface.co/datasets/qc316/odubench — 链接可访问(HTTP 200)
演示资源:https://odubench.github.io — 链接可访问(HTTP 200)
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🥈 把二次方的强制对齐压进终端设备:原地计算与可解释剪枝
标签:#强制对齐 | #形式化分析 | #长音频处理 | #端侧运行 | #高效推理
评分:8.1/10 | 创新 1.4/2 | 技术严谨 1.1/1.5 | 实验充分 1.2/1.5 | 清晰度 0.7/1 | 影响力 1.1/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1.1/1.5
排名:前25% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Lawry Sorenson:机构信息未在 arXiv HTML 中可靠披露
- Michael Crandall:机构信息未在 arXiv HTML 中可靠披露
- Eric K. Ringger:机构信息未在 arXiv HTML 中可靠披露
- Stephen D. Richardson:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
强制对齐需以联结时序分类声学logits与已知字符序列为输入,输出字符级起止时间,难点是标准Viterbi需二次时间与空间,小时级长音频即内存溢出而无法端侧运行。该方法分两步:先用可双向递推的Hirschberg-Viterbi分治求中点最优切分再递归求解,将内存降至线性且保持精确解一致;再把对齐建模为两端固定的音素时长随机游走,经中心极限定理得到字符位置正态先验,并用并界校正与转写精确率召回率下界平移得到随长度增长的对角剪枝窗。与ctc-seg固定窗和Kaldi基于数据的波束剪枝不同,其窗口宽度由可解释的转写精度与对齐置信度决定,剪枝尺度随输入一致缩放而非固定阈值。在Buckeye测试集下,HV+VAD剪枝方法的Exact准确率为100%,高于Kaldi的Exact准确率67.5%。在三小时输入条件下,该实现在单核CPU硬件上以兆字节级内存完成精确对齐,剪枝后高精度转写仅需数十秒且长输入再加速约2倍。该方法适用于长音频离线挖掘与端侧处理,但在可变语速与低精度转写下窗口可能失效,且当前仅求单条最优路径。原文未披露训练成本。
🔗 开源资源
代码相关资源:https://github.com/byu-matrix-lab/hirschberg-viterbi — 链接可访问(HTTP 200)
数据相关资源:https://churchofjesuschrist.org/study/general-conference — 暂时无法访问
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🥉 不用判别器猜分数:并行建模谐波与可微感知损失如何分工
标签:#语音增强 | #注意力机制 | #状态空间模型 | #语音 | #单通道
评分:8.1/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 1.2/1.5 | 开源 1/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5
排名:前25% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Shang-Fu Chen:机构信息未在 arXiv HTML 中可靠披露
- Szu-Wei Fu:机构信息未在 arXiv HTML 中可靠披露
- Sung-Feng Huang:机构信息未在 arXiv HTML 中可靠披露
- Rong Chao:机构信息未在 arXiv HTML 中可靠披露
- Wen-Huang Cheng:机构信息未在 arXiv HTML 中可靠披露
- Yu Tsao:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
单通道语音增强需从含噪波形恢复目标语音的幅度与相位,浊音谐波在噪声下易被抹除而感知质量又与均方误差不对齐。本文提出HAMMER,先由密集编码器将压缩幅度谱与相位谱映射为紧凑时频特征,再堆叠4个时频谐波感知模块沿时间轴与频率轴交替做并行上下文建模与局部周期增强,最后经幅度与相位双解码器重构波形并以可微感知损失直接优化。与顺序堆叠注意力与状态空间模型的已有混合方案不同,该设计让全局交互与选择性长程传播在同一深度互补融合,并显式注入自相关周期先验。该优化以软化感知干扰聚合的Soft-PESQ损失与约束线性预测谱失真的对数似然比损失联合监督,全程无需度量判别器。在VoiceBank+DEMAND测试集评测下,HAMMER的PESQ为3.69,高于Mamba-Former的PESQ 3.64,且COVL为4.41,推理时感知对比拉伸可进一步将PESQ推至3.79。结论目前仅在该英文小规模受控噪声基准上验证,对真实混响、低信噪比与跨语言泛化的外推尚未证明。其适用边界受限于该单一英文受控噪声场景,跨语言与真实混响外推尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
- 代码相关资源:https://github.com/shangfuu/HAMMER.git → https://github.com/shangfuu/HAMMER — 链接可访问(HTTP 200)
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
4. 用声明式许可与两阶段自动标注把互联网档案馆做成可复现的音乐描述资源
标签:#音频字幕生成 | #数据集构建 | #数据集 | #音乐
评分:7.9/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 1.2/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5
排名:前25% | 文档类型:数据集与基准 | arXiv 原文
👥 作者与机构
- Paraskevas Stamatiadis:机构信息未在 arXiv HTML 中可靠披露
- Bernardo V Miranda:机构信息未在 arXiv HTML 中可靠披露
- Clémentine Berger:机构信息未在 arXiv HTML 中可靠披露
- Gaël Richard:机构信息未在 arXiv HTML 中可靠披露
- Mathieu Fontaine:机构信息未在 arXiv HTML 中可靠披露
- Slim Essid:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
音乐字幕数据同时受标注成本高、版权限制严、可公开音频规模小三重制约,大模型可复现研究尤其缺乏大规模开放许可的音乐与文本配对。本文构建互联网档案馆音乐数据集(Internet Archive Music Dataset,IAMD),输入为互联网档案馆(Internet Archive,IA)用户声明为知识共享许可的音频条目,输出为30秒无重叠片段音频与两至三句自然语言字幕配对,规模约34.8k小时、4.1M片段、源自548k文件,为目前已知最大公开音乐字幕数据集。构建链分三段:先按媒体类型加知识共享过滤、大语言模型(Large Language Model,LLM)音乐性打分过滤、格式优选加10分钟时长过滤、文件名加时长启发式去重、MusicBrainz模糊匹配加国际标准音乐作品编码(International Standard Musical Work Code,ISWC)风险标记得到候选文件,再切分为30秒片段并按能量阈值去静音,接着用轻量音乐理解模型TinyMU生成基础字幕初稿,最后用自监督表示MATPAC++线性探针的乐器与流派情绪标签和IA条目文本元数据经聚合大语言模型改写为终稿。与JamendoMaxCaps只做标签插补而不回写修正字幕不同,本文把带概率的分类标签直接作为纠错证据注入聚合提示。在1500个30秒片段的参考无关评测中,IAMD的CLAP对齐流畅度分数(CLAP-aligned FLEUR Score,CAF-Score)为55.61%,高于同条件JamendoMaxCaps的52.29%;在10秒裁剪比较中仍落后人工标注MusicCaps约5.74个百分点。该结论仅适用于自动指标与小样本主观打分,未验证对文本到音乐生成的下游增益,原文未披露完整训练推理成本,细节与运行时统计依赖伴随网页。
🔗 开源资源
代码相关资源:https://github.com/bvm810/IAMD — 链接可访问(HTTP 200)
数据相关资源:https://adasp.telecom-paris.fr/s/iamd → https://adasp.telecom-paris.fr/rc/demos_companion-pages/internet_archive_music_dataset/ — 链接可访问(HTTP 200)
复现相关资源:https://adasp.telecom-paris.fr/s/iamd → https://adasp.telecom-paris.fr/rc/demos_companion-pages/internet_archive_music_dataset/ — 链接可访问(HTTP 200)
第三方资源:https://github.com/inseong00/CAF-Score — 链接可访问(HTTP 200)
第三方资源:https://hf.co/laion/clap-htsat-unfused → https://huggingface.co/laion/clap-htsat-unfused — 暂时无法访问
第三方资源:https://musicbrainz.org/ — 链接可访问(HTTP 200)
第三方资源:https://archive.org/about — 暂时无法访问
第三方资源:https://eur-lex.europa.eu/eli/dir/2019/790/oj — 链接可访问(HTTP 200)
第三方资源:https://freemusicarchive.org/ — 链接可访问(HTTP 200)
第三方资源:https://www.jamendo.com — 链接可访问(HTTP 200)
第三方资源:https://freesound.org/ — 链接可访问(HTTP 200)
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
5. 小参数做音频问答:Samsone 用裁词表与减层数换端侧可运行
英文题目:Samsone: A Family of Open Small Audio Language Models for On-Device Inference
标签:#音频问答 | #模型剪枝 | #端侧运行 | #音频大模型 | #开源工具
评分:7.9/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5
排名:前25% | 文档类型:模型报告 | arXiv 原文
👥 作者与机构
- Piotr Masztalski:机构信息未在 arXiv HTML 中可靠披露
- Michał K. Grzeszczyk:机构信息未在 arXiv HTML 中可靠披露
- Olaf Sikorski:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
音频问答(Audio Question Answering,AQA)要求模型联合理解环境声、音乐与语音并生成开放文本答案,难点是在百兆参数下同时保持细粒度听觉 grounding 与复杂推理。Samsone采用音频编码器加模态投影器加语言解码器的标准音频语言模型架构:Whisper-Tiny编码器输出帧级嵌入并平均池化为每条音频50个token,经双线性加GeLU加残差加层归一化的非线性投影器映射到文本嵌入维度,再与SmolLM2分词嵌入拼接并以可学习SEP token分隔模态边界,由SmolLM2自回归生成答案。与Pengi和Mellow的关键差异是800万AudioSkillsXL加100万ReasonAQA的数据混合、ReasonAQA选择题选项随机重排去偏、词表缩减与深度裁剪的尺寸优化,以及单阶段全量微调。在MMAU Test平均准确率为61.33%,高于Mellow的53.34%,方向为越高越好;在MMAU-Pro为37.57%,高于Mellow的27.50%。该结论适用于英文短音频问答、字幕与蕴含任务,在长时、空间与多音频复杂知识上仍落后于数十亿参数大模型。训练为单卡100轮、每轮200000样本,端侧在Galaxy S25 Ultra CPU上生成速度为39至125 tokens每秒。
🔗 开源资源
代码相关资源:https://github.com/SamsungLabs/samsone — 链接可访问(HTTP 200)
第三方资源:https://github.com/soham97/mellow — 链接可访问(HTTP 200)
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
6. 把声纹溯源改成查字典:在音频文本共享空间里检索没见过的合成系统
英文题目:Towards Zero-Shot Attribution of Synthetic Speech via Audio-Text Contrastive Retrieval
标签:#音频检索 | #对比学习 | #0 样本 | #语音 | #多模态学习
评分:7.7/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1/1.5 | 清晰度 0.9/1 | 影响力 1/1.5 | 开源 1/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前25% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Cristian-Teodor Neamtu:Speech and Dialogue Research Laboratory (SpeeD), POLITEHNICA Bucharest Bitdefender
- Serban Mihalache:Speech and Dialogue Research Laboratory (SpeeD), POLITEHNICA Bucharest Bitdefender
- Stefan Smeu:Speech and Dialogue Research Laboratory (SpeeD), POLITEHNICA Bucharest Bitdefender
- Dan Oneata:Speech and Dialogue Research Laboratory (SpeeD), POLITEHNICA Bucharest Bitdefender
- Horia Cucu:Speech and Dialogue Research Laboratory (SpeeD), POLITEHNICA Bucharest Bitdefender
- Dragos Burileanu:Speech and Dialogue Research Laboratory (SpeeD), POLITEHNICA Bucharest Bitdefender
📌 核心摘要
合成语音溯源任务输入为待测音频片段,输出为生成该片段的语音合成系统身份与声码器架构等属性画像,实际难点在于新文本转语音系统不断涌现使闭集分类无法命名训练未见系统。方法第一步为系统取证建档,对每个模型用三种前沿大模型交叉核对公开文档生成十一维结构化事实表,其输出作为统一信源进入下一步。第二步为自然语言渲染与增强,将事实表渲染为技术取证等五种风格描述并前置语言系属头,再经句子丢弃与属性短提示扩增形成候选描述库。第三步为跨模态对比对齐与检索,冻结的音频编码器与文本编码器加可训练投影头将音频与描述映射至二百五十六维共享空间,以双向跨模态加双向模内监督对比损失训练,推理时以余弦相似度检索最匹配描述。相对固定标签分类的关键差异在于描述库即类别定义,新增系统只需写入自然语言描述而无需重训,且同一空间可统一完成系统级溯源与属性画像,具有实际部署意义。在MLAAD v9未见全量画廊评测设置下,带语言头条件的模型级Hit@1指标为44.3%,高于去除语言头条件的模型级Hit@1指标41.8%。该结论的适用边界受限于声学独特性,HiFi-GAN加常见架构加日耳曼语等高度同质组合系统级首位命中率仅约11%,易误匹配至属性相同的近邻系统。原文未披露训练、推理或部署成本。
🔗 开源资源
- 代码相关资源:https://github.com/neamtucristian26/flame — 链接可访问(HTTP 200)
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
7. 复用语音识别编码器状态做查询条件话题定位:文本之外补边界信息
英文题目:Reusing Latent Speech Representations for Query-Conditioned Topic Localization in Transcripts
标签:#音频问答 | #多模态学习 | #语音 | #长音频处理
评分:7.6/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5
排名:前25% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Steffen Freisinger:机构信息未在 arXiv HTML 中可靠披露
- Philipp Seeberger:机构信息未在 arXiv HTML 中可靠披露
- Thomas Ranzenberger:机构信息未在 arXiv HTML 中可靠披露
- Tobias Bocklet:Korbinian Riedhammer,;Technische Hochschule Nürnberg Georg Simon Ohm
- Korbinian Riedhammer:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
查询条件主题定位(query-conditioned topic localization)输入为长语音转录文本与题名式文本查询,输出为回答该查询的连续句子起止区间 \((i^{\star},j^{\star})\),难点在于长上下文易淹没边界且纯文本难以感知停顿与转场。方法链分为三步:离线阶段复用冻结 ASR 编码器第 32 层帧表示并按句级时间戳池化为声学向量,同时用冻结文本编码器得到句向量;两者经线性投影与门控融合后送入 QANet 风格上下文编码器形成可复用的上下文矩阵 \(C\);在线阶段将查询编码后与 \(C\) 送入 VSLNet 或 QMSum-Pointer 预测起止分布。与已有视频与会议定位器只用文本或另训音频编码器不同,该框架零新增音频编码开销且定位器结构不变。在Euronews测试集评估设置下,文本加音频融合VSLNet的EM指标为69.11,高于文本基线VSLNet的EM指标45.26。严格指标增益大于宽松交并比阈值,表明声学信息主要修正边界。结论在结构化新闻与半结构化讲座上成立,在自发多说话人会议 AMI 上增益微弱甚至出现回退。该结论的适用边界受限于自发会议域,跨域外推尚未验证。离线融合增加约 57M 浮点运算量,在线查询计算与存储保持不变,原文未披露训练硬件型号与训练时长。
🔗 开源资源
- 代码相关资源:https://github.com/steffrs/speech-topic-localization — 链接可访问(HTTP 200)
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
8. 训练后指纹还算数吗:跟踪同一 TTS 血统从预训练到 SFT 与 RL 的取证漂移
英文题目:GenTraceBench: A Benchmark for Tracing Audio Deepfakes Across Pre- and Post-training Stages
标签:#音频深度伪造检测 | #基准设计 | #后训练 | #语音
评分:7.5/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0.5/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5
排名:前25% | 文档类型:数据集与基准 | arXiv 原文
👥 作者与机构
- Li Wang:机构信息未在 arXiv HTML 中可靠披露
- Kunyu Feng:机构信息未在 arXiv HTML 中可靠披露
- Wan Lin:机构信息未在 arXiv HTML 中可靠披露
- Dekun Chen:机构信息未在 arXiv HTML 中可靠披露
- Qinke Ni:机构信息未在 arXiv HTML 中可靠披露
- Xueyao Zhang:机构信息未在 arXiv HTML 中可靠披露
- Lei Wang:机构信息未在 arXiv HTML 中可靠披露
- Jie Shi:机构信息未在 arXiv HTML 中可靠披露
- Haizhou Li:机构信息未在 arXiv HTML 中可靠披露
- Zhizheng Wu:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
音频深度伪造检测的实际难点是部署的往往不是发布的预训练文本到语音基座,而是经监督微调或偏好优化适配后的后代模型,旧指纹是否仍然有效未知。GenTraceBench以5种架构的基座模型为起点并控制预训练语料,再分别施加通用对齐、模态扩展与多阶段演进等后训练路径,形成16个匹配变体,随后用同一Seed-TTS文本与说话人提示合成49,728条语音并划分为1,035条训练、517条验证与1,556条测试。取证端采用在基座上训练、在 withheld 适配变体上测试的协议,评估二分类检测、闭集归因与开放集验证。相对固定生成器语料库与跨组件变异基准,该工作分离了同血缘内训练阶段漂移,并用质心偏移与类内离散度区分均值结构漂移与方差型漂移。在Wav2Vec2-BERT验证中CosyVoice2的监督微调条件随注册样本从1增加到10,等错误率从44.4%降至11.0%,而SingNet-only条件始终在45%以上。该结论的适用边界受限于中英文干净语音、5个生成器家族与3个取证骨干,单监督微调配置下失败条件包括架构相关优化超参数混杂因果,且多语言与噪声信道外推尚未验证。原文未披露训练、推理或部署成本,仅承诺将公开发布基准。
🔗 开源资源
第三方资源:https://arxiv.org/abs/2406.02430 — 链接可访问(HTTP 200)
第三方资源:https://arxiv.org/abs/2601.04656 — 链接可访问(HTTP 200)
第三方资源:https://arxiv.org/abs/2508.16332 — 链接可访问(HTTP 200)
第三方资源:https://arxiv.org/abs/2407.05361 — 链接可访问(HTTP 200)
第三方资源:https://arxiv.org/abs/2505.09325 — 链接可访问(HTTP 200)
第三方资源:https://arxiv.org/abs/2508.04195 — 链接可访问(HTTP 200)
第三方资源:https://arxiv.org/abs/2108.06209 — 链接可访问(HTTP 200)
第三方资源:https://arxiv.org/abs/2305.18290 — 链接可访问(HTTP 200)
第三方资源:https://aclanthology.org/2025.acl-long.598/ — 链接可访问(HTTP 200)
第三方资源:https://arxiv.org/abs/2508.02521 — 链接可访问(HTTP 200)
第三方资源:https://arxiv.org/abs/2507.06470 — 链接可访问(HTTP 200)
第三方资源:https://arxiv.org/abs/2509.08476 — 链接可访问(HTTP 200)
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
9. 只给一次提醒意图,让音频大模型自己决定何时开口:中断与静默建模
英文题目:I’ll Keep an Ear Out: Teaching AudioLLMs Proactive Audio Assistance
标签:#音频交互 | #SFT | #环境声 | #音频大模型 | #流式处理
评分:7.4/10 | 创新 1.5/2 | 技术严谨 1/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 1/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5
排名:前50% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Amit Kumar Singh Yadav:机构信息未在 arXiv HTML 中可靠披露
- Ritvik Shrivastava:机构信息未在 arXiv HTML 中可靠披露
- Xuan Zhang:机构信息未在 arXiv HTML 中可靠披露
- Seungwhan Moon:机构信息未在 arXiv HTML 中可靠披露
- Shashank Jain:机构信息未在 arXiv HTML 中可靠披露
- Pinar Donmez:机构信息未在 arXiv HTML 中可靠披露
- Babak Damavandi:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
主动式音频辅助(Proactive Audio Assistance)以单条自然语言守望意图与连续音频流为输入,要求模型在仅利用过去与当前上下文的因果约束下逐时刻输出打断或保持沉默,难点在于起始时刻检测、持续相关与重复提醒的区分以及重叠噪声场景下的误报控制。该方法先做反应式监督微调建立声音分类能力,再基于已知事件边界构造起始中断、持续相关中断、无关静默与历史去重静默四态主动数据并以中断与静默建模(Interrupt and Silent Modeling, ISM)做主动微调,最后在流式滚动窗口中结合对话历史做因果解码以及时触发并抑制冗余提醒。与固定类别分类器和纯提示基线相比,ISM把决策内嵌为解码首词元并用历史显式建模去重,避免了每事件查询与无记忆报警。在ESC-50五折主动评测中,PALLM相对反应式微调将中断F1提升至99.6%,同时实现完全去重。该结论限于干净孤立片段与固定起始的拼接流式协议,在重叠厨房噪声与开放意图下尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
数据相关资源:https://github.com/karolpiczak/ESC-50 — 链接可访问(HTTP 200)
数据相关资源:https://epic-kitchens.github.io/epic-sounds/ — 链接可访问(HTTP 200)
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
10. 把语义骨架和声学细节分开装:MuSeC 为何能在混合音乐上同时保真与可建模
英文题目:Rethinking Music Tokenization: A Semantic Codec toward High-Fidelity LLM Music Generation
标签:#音频编码 | #向量量化 | #音乐 | #音乐信息检索
评分:7.2/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5
排名:前50% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Huakang Chen:机构信息未在 arXiv HTML 中可靠披露
- Guobin Ma:机构信息未在 arXiv HTML 中可靠披露
- Yuepeng Jiang:机构信息未在 arXiv HTML 中可靠披露
- Dake Guo:机构信息未在 arXiv HTML 中可靠披露
- Jingbin Hu:机构信息未在 arXiv HTML 中可靠披露
- Hanke Xie:机构信息未在 arXiv HTML 中可靠披露
- Wenhao Li:机构信息未在 arXiv HTML 中可靠披露
- Lingxin Xiong:机构信息未在 arXiv HTML 中可靠披露
- Jian Zhao:机构信息未在 arXiv HTML 中可靠披露
- Zhonglin Jiang:机构信息未在 arXiv HTML 中可靠披露
- Yong Chen:机构信息未在 arXiv HTML 中可靠披露
- Lei Xie:机构信息未在 arXiv HTML 中可靠披露
- Pengcheng Zhu:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
输入为24 kHz立体声混合音乐波形,输出为可直接重建与自回归建模的离散词元,难点在于复调与人声伴奏强耦合下重建保真与语言模型可预测性难以兼得。MuSeC先以冻结LeVo BEST-RQ自监督表示第6层与k均值2048类构建语义码本提供结构骨架,再以因果卷积加滑动窗口Transformer的声学编码器与残差向量量化学习语义缺失的声学残差,随后将双流特征按25Hz帧同步拼接送入统一解码器重建波形。与语音语义约束或显式音轨分离路径不同,该设计在混合信号内实现无分离因子分解并保持重建导向。语义骨干经MARBLE多任务层探测选定,浅层峰值的和弦调式节拍归为声学内容而中深层峰值的标签体裁情感与歌词归为语义内容。在GuitarSet和弦估计任务下,MuSeC的准确率为0.365,高于XCodec-YuE的准确率0.348。该结论的适用边界目前仅限客观重建指标与首码本预测准确率,尚未验证端到端音乐生成主观评价与长时结构。训练成本涉及8张NVIDIA A100 80GB硬件上第二阶段800k步与第三阶段1M步训练的计算量。
🔗 开源资源
演示资源:https://longwaytog0.github.io/MuSeC/ — 链接可访问(HTTP 200)
第三方资源:https://github.com/Marvis-Labs/marvis-tts — 链接可访问(HTTP 200)
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
11. 在说话人移动时仍逐帧更新:以加权似然把 ILRMA 与 RCSCME 改写为在线算法
标签:#目标说话人提取 | #自适应滤波 | #麦克风阵列 | #在线推理 | #实时处理
评分:7.0/10 | 创新 1.4/2 | 技术严谨 1.2/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5
排名:前50% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Yuto Ishikawa:机构信息未在 arXiv HTML 中可靠披露
- Norihiro Takamune:机构信息未在 arXiv HTML 中可靠披露
- Tomohiko Nakamura:机构信息未在 arXiv HTML 中可靠披露
- Daichi Kitamura:机构信息未在 arXiv HTML 中可靠披露
- Hiroshi Saruwatari:机构信息未在 arXiv HTML 中可靠披露
- Yu Takahashi:机构信息未在 arXiv HTML 中可靠披露
- Kazunobu Kondo:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
输入为4通道麦克风阵列在扩散噪声下录得的含混响混合语音,输出为目标说话人的源像,难点在于扩散噪声无法被线性解混滤波完全去除,且说话人移动导致空间特性时变。第一步基于最大加权似然估计为带零点约束独立低秩矩阵分析与秩约束空间协方差矩阵估计构造带指数遗忘权重的帧级代价函数,强调近期观测帧。第二步用主化最小化与最大化等化由帧级代价导出朴素更新,其输出的解混矩阵与目标通道索引直接作为下一步在线近似的输入。第三步将涉及历史求和的中间量固定为上一帧估计并引入指数平滑得到逐帧在线更新,对秩约束空间协方差矩阵估计再做标量加速与伪逆高效计算。与每数秒更新一次解混矩阵的块批处理不同,该机制每32ms更新一次并指数遗忘旧观测,因而能跟踪移动声源并缓解单时不变矩阵失配。在静止说话人仿真评测条件下,O-RCSCME的最大单帧处理耗时指标为32ms以下,低于实时阈值的最大单帧处理耗时指标32ms。在CPU双精度下最大单帧处理耗时低于32ms移长,推理开销满足实时延迟要求。结论仅适用于单目标加扩散噪声与已知目标大致方位的场景,多说话人提取与强混响泛化尚未验证。本方法为无监督在线优化,无离线训练开销。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
12. 不用转写也能对话:用合成音视频同时练理解、判分与强化
英文题目:OmniVChat: Synthesizing, Benchmarking, and Training for Native Audio-Visual Dialogue
标签:#音视频交互 | #强化学习 | #基准测试 | #音视频
评分:7.0/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.1/1.5
排名:前50% | 文档类型:数据集与基准 | arXiv 原文
👥 作者与机构
- Haolin He:机构信息未在 arXiv HTML 中可靠披露
- Yunfei Chu:机构信息未在 arXiv HTML 中可靠披露
- Qi Chen:机构信息未在 arXiv HTML 中可靠披露
- Wen Huang:机构信息未在 arXiv HTML 中可靠披露
- Yuan Feng:机构信息未在 arXiv HTML 中可靠披露
- Muzhi Zhu:机构信息未在 arXiv HTML 中可靠披露
- Zheqi Dai:机构信息未在 arXiv HTML 中可靠披露
- Haoning Xu:机构信息未在 arXiv HTML 中可靠披露
- Dongchao Yang:机构信息未在 arXiv HTML 中可靠披露
- Chunyat Wu:机构信息未在 arXiv HTML 中可靠披露
- Zining Liang:机构信息未在 arXiv HTML 中可靠披露
- Zhengxi Liu:机构信息未在 arXiv HTML 中可靠披露
- Xiquan Li:机构信息未在 arXiv HTML 中可靠披露
- Xie Chen:机构信息未在 arXiv HTML 中可靠披露
- Xize Cheng:机构信息未在 arXiv HTML 中可靠披露
- Qize Yang:机构信息未在 arXiv HTML 中可靠披露
- Jin Xu:机构信息未在 arXiv HTML 中可靠披露
- Qiuqiang Kong:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
原生音视频对话要求模型直接同时接收用户音频与视频并返回文本,查询嵌入在语音韵律、表情、环境声与轮次行为中,无独立文本问题与外部字幕或语音识别级联,多解回复使关键词匹配难以可靠评判。OmniVChat-Studio先按子类别配置采样属性与语料生成剧本并渲染音视频,再经描述与问答校验生成参考回复与分级量表,输出合成对话进入下一步。OmniVChat-Bench接着用大语言模型判分器对合成对话执行门控计分,覆盖五大能力类的单轮与多轮实例以度量基础对话能力。OmniVChat-RL最后以同一门控正确性联合效率与风格奖励优化Qwen3-Omni-Instruct思考器,使训练信号与评测口径一致并迁移至真机录制。与语音识别加字幕级联不同,该链路保留声学与视觉线索,以实例级量表替代关键词匹配,使合成数据同时服务训练与评测。在2800个合成实例基准下,OmniVChat-RL训练后模型的子类别均值分数为0.652,高于训练前基线的子类别均值分数0.465。该结论仅适用于单轮为主的受控短对话与中文单轮真机探针,未验证多轮长程记忆、实时打断延迟与高噪声强干扰外推。原文未披露训练、推理或部署成本与硬件配置。
🔗 开源资源
第三方资源:https://qwen.ai/ — 链接可访问(HTTP 200)
第三方资源:https://ai.google.dev/gemini-api/docs/live-api — 链接可访问(HTTP 200)
第三方资源:https://seed.bytedance.com/en/SeedRealtime — 链接可访问(HTTP 200)
第三方资源:https://deepmind.google/models/model-cards/gemini-omni-flash/ — 链接可访问(HTTP 200)
第三方资源:https://www.minimax.io/blog/minimax-h3 — 链接可访问(HTTP 200)
第三方资源:https://wan.video/features — 链接可访问(HTTP 200)
第三方资源:https://openai.com/index/sora-2/ — 链接可访问(HTTP 200)
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
13. 跨语言帕金森严重程度分级:预训练语音嵌入能迁移什么,又在哪里混淆
标签:#病理语音评估 | #迁移学习 | #跨语言 | #语音
评分:6.7/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 1/1.5 | 清晰度 0.7/1 | 影响力 0.5/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:应用研究 | arXiv 原文
👥 作者与机构
- Simon Pals:机构信息未在 arXiv HTML 中可靠披露
- Cristian Tejedor-Garcia:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
帕金森病言语障碍评估任务输入为朗读语音片段,输出为健康对照、轻度与重度三分类严重度标签,难点在于标注稀缺、语言与采集条件差异大以及轻重边界模糊。该方法先做基于MDS-UPDRS语音子量表分数的标签标准化、基于Silero语音活动检测的切分与响度归一化,再用四种语音基础模型抽取帧级嵌入并平均池化为定长向量。接着训练极端随机树等浅层分类器,最后在源语言训练并在目标语言做零样本测试或追加少量目标样本重训分类头。与以往单语二分类或手工声学特征研究不同,该链条依赖冻结多语言预训练表示实现跨语言迁移,仅适配分类器而不微调编码器。在MDVR-KCL作为源语言、ItalianPVS作为目标语言的跨语言评测设置下,k-shot适配后目标语言的F1为71.02,高于零样本条件下目标语言的F1 53.69。但性能高度依赖目标数据集,PC-GITA为目标时F1仅52.88%至56.46%且重度常与轻度混淆,VAD切分与归一化可能削弱停顿与音量线索。该结论适用边界受限于三数据集朗读任务,跨采集条件与自发语音外推尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
代码相关资源:https://github.com/simon-hjp/pd-speech-embedding-severity-classification — 链接可访问(HTTP 200)
模型相关资源:https://huggingface.co/models — 链接可访问(HTTP 200)
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
14. 不抢话也不漏话:Voice-Light 用因果检查管住推测与历史
英文题目:Voice-Light: A Full-Duplex Cascaded Voice Agent with Causal Turn-Taking and Speculative Generation
标签:#全双工语音交互 | #Adapter | #轮次切换 | #流式处理 | #语音
评分:6.7/10 | 创新 1.4/2 | 技术严谨 1/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5
排名:前50% | 文档类型:系统技术报告 | arXiv 原文
👥 作者与机构
- Bertil Braun:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
Voice-Light 处理持续麦克风输入与助手播放并存的全双工语音对话,输入为 16 kHz 流式语音与播放确认,输出为可听回复与可执行工具调用,难点在于区分停顿迟疑与轮次结束并避免误打断。系统先由 Silero 语音活动检测做毫秒级声学起音反应并可逆压低播放,再由共享流式识别编码器的因果适配器提供完成与抢话证据,混合控制器据此决定取消或恢复。确认轮次后 Qwen 生成文本与类型化工具调用,Kyutai 语音合成仅合成已放行文本,且只有浏览器确认已播放的音频才写入持久历史。在1673个真实对话静音候选的锁定测试协议下,历史Voice-Light策略的EOT召回率指标为12.53%,低于Silero定时策略的EOT召回率指标95.60%。与定时基线相比该学习策略保留低误切但召回明显不足,故部署仍采用混合控制器,而36个实测轮次中位最终端点到首包服务器音频延迟为758毫秒。结论仅适用于英语单人单网络部署环境,不支持人群级延迟分布或中断准确率外推。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
15. 在低秩优化器里加旧任务曲率:CGaLore 如何让 ASR 基座模型记得住又学得进
英文题目:CGaLore: Curvature-Guided GaLore for Memory-Efficient Continual Adaptation of ASR Foundation Models
标签:#语音识别 | #持续学习 | #语音 | #多语言
评分:6.7/10 | 创新 1.4/2 | 技术严谨 1.2/1.5 | 实验充分 1.1/1.5 | 清晰度 0.7/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5
排名:前50% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Steven Vander Eeckt:机构信息未在 arXiv HTML 中可靠披露
- Hugo Van hamme:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
自动语音识别(Automatic Speech Recognition,ASR)基础模型需要在新口音或新地域上持续学习,同时不丢失英语、德语、西班牙语等多语言旧能力,难点是全参数微调优化器内存大且新旧梯度冲突。本文方法链分三步:先在初始模型上用少量旧任务语音估计每层 Kronecker 分解近似曲率(Kronecker-Factored Approximate Curvature,KFAC)的输入协方差与输出梯度协方差并常驻 CPU;再在每次更新投影基时用逆曲率对当前梯度做双边预滤并做奇异值分解,只保留新任务相关且旧任务曲率低的方向作为优化子空间;最后在该子空间内执行低维优化器更新并映射回全秩参数,同时以滑动平均累积新任务曲率。与仅取新梯度主方向的梯度低秩投影(Gradient Low-Rank Projection,GaLore)及固定低秩增量的低秩适配(Low-Rank Adaptation,LoRA)类方法不同,该机制在训练轨迹层面约束更新而非事后修正或冻结参数形式。在 L2-Arctic 口音适配中最终平均词错率(Word Error Rate,WER)为 8.72%,显著优于最强基线并基本消除 GaLore 的遗忘。结论目前仅验证短序列口音与荷兰语地域适配,未覆盖更大模型、更长任务链与跨领域外推。训练峰值显存与 GaLore 持平均为 10.56 GB,单次适配总耗时仅增加约 0.4%,曲率计算只发生在基更新时刻。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
16. 词错率低不等于意思对:用人偏好重测 WER、CER 与语义指标
英文题目:Rethinking Human-Aligned Evaluation: An Analysis of Semantic Metrics Beyond WER
标签:#语音识别 | #主观评测 | #数据集 | #模型评估 | #语音
评分:6.7/10 | 创新 1.4/2 | 技术严谨 1.1/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 1.1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5
排名:前50% | 文档类型:数据集与基准 | arXiv 原文
👥 作者与机构
- Hritika Sharma:机构信息未在 arXiv HTML 中可靠披露
- Thibault Bañeras-Roux:机构信息未在 arXiv HTML 中可靠披露
- Alessandra Pinto:机构信息未在 arXiv HTML 中可靠披露
- Petr Motlicek:机构信息未在 arXiv HTML 中可靠披露
- Hyunggu Jung:机构信息未在 arXiv HTML 中可靠披露
- Esaú Villatoro-Tello:机构信息未在 arXiv HTML 中可靠披露
- Somang Nam:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
自动语音识别转写评估的输入是参考文本与候选假设,输出是对系统优劣的排序,难点在于词面编辑距离与人类感知的意义保持并不一致。作者先从LibriSpeech test-clean抽取音频并用4种异构系统生成假设,再通过Web端并排强制选择收集人类偏好并只保留一致样本,最后对每种自动指标计算其与参考的相似度并以选择人类偏好假设的比例衡量一致率。该链条中前段负责构造有区分度的对比,后段负责把指标分数转化为可比的人类对齐度,从而暴露词级与字符级及语义表示的差异。与既有做法相比,CER与句子级语义距离SemDist以更细或更整体的视角替代WER的等权词惩罚,因而更贴近可读性与意义判断。在HATS-en共识过滤评测设置下,CER的指标一致率为86.28%,高于WER的指标一致率75.47%。结论仅适用于英语朗读语音与转写文本质量判断,未验证自发对话、噪声场景与下游任务效用。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
17. 幻灯片能帮耳朵认词吗:用合成讲稿重测多语言语音识别
标签:#音视频语音识别 | #数据集构建 | #数据集 | #基准测试 | #多语言
评分:6.5/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5
排名:前50% | 文档类型:数据集与基准 | arXiv 原文
👥 作者与机构
- Thomas Ranzenberger:机构信息未在 arXiv HTML 中可靠披露
- Steffen Freisinger:机构信息未在 arXiv HTML 中可靠披露
- Tobias Bocklet:机构信息未在 arXiv HTML 中可靠披露
- Korbinian Riedhammer:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
演讲转写以单句语音为输入并输出逐字文本,难点在于人名、术语与缩写的发音歧义,而同页幻灯片本可提供强先验。本文构建口语维基展示语料库,先将口语维基音频按词级对齐切分为发音片段并链接到最近维基章节,输出 utterance-章节映射进入下一步。接着用大语言模型做内容规划生成标题、要点与插图描述,并用扩散模型生成无文字插图后按规则模板渲染为720p幻灯片。最后用视觉模型抽取幻灯片文本为Markdown,作为可直接提示的文本上下文保留。与真实会议录像采集相比,该机制用可控合成替代难以获取的多语言演讲配对数据,意义在于低成本获得大规模对齐基准。在SWPC测试集基准下,cohere-transcribe-03-2026的平均micro-WER为10.23%,低于whisper-large-v3的平均micro-WER 10.77%。该结论仅适用于朗读式百科语音与合成幻灯片的弱耦合场景,未验证真实演讲或完整幻灯片Markdown提示能带来增益。其多模态增益尚未验证,适用边界受限于合成幻灯片条件。原文未披露训练、推理或部署成本
🔗 开源资源
- 数据相关资源:https://huggingface.co/datasets/th-nuernberg/swpc — 暂时无法访问
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
18. 只用生成误差学作曲家风格:Composer2Vec 的时间轴从哪里来
英文题目:Composer2Vec: A Continuous Embedding Space of Composer Style Learned from Symbolic Melody Generation
标签:#符号音乐生成 | #Transformer | #音乐 | #可解释性 | #模型比较
评分:6.4/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 0.9/1.5 | 清晰度 0.8/1 | 影响力 0.7/1.5 | 开源 1/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:前50% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Sakutaro Nishio:机构信息未在 arXiv HTML 中可靠披露
- Osamu Ichikawa:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
该研究输入二值钢琴卷帘旋律片段与作曲家编号(Composer ID),输出后续旋律的逐帧逐音高激活,难点在于仅以生成误差能否涌现可解释的风格历史结构。方法链分三步:先清洗 Kunst der Fuge 的 9070 个 MIDI 文件中可解析的 8972 个并切分为 277718 个片段,再用条件 Transformer 学习 124×128 作曲家嵌入,最后以主成分分析(Principal Component Analysis,PCA)、t 分布随机邻域嵌入(t-SNE)与置换检验解析该矩阵。相比分类式作曲家识别或事后风格控制,该工作将嵌入与生成联合训练,使时代邻近成为训练副产物而非监督目标。在相同协议下由同一MIDI合成音频重算嵌入的评测下,Composer2Vec的Silhouette得分为0.0110,高于MuQ‑MuLan的Silhouette得分0.0006。该嵌入第一主成分解释总方差的21.5%,在123位已知生年作曲家上其与生年相关系数为-0.884并通过2000次置换检验。结论限于西方古典旋律与单一样本库,对配器音色与和声结构尚未验证,语义算术仅在个别组合成立。原文未披露训练、推理或部署成本。
🔗 开源资源
- 数据相关资源:https://www.kunstderfuge.com/ — 链接可访问(HTTP 200)
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
19. 封闭句库里练多人模型,再用三分钟校准新用户:表面肌电语音解码的个性化路径
标签:#静默语音接口 | #迁移学习 | #生理信号 | #预训练 | #低资源
评分:6.3/10 | 创新 1/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5
排名:前50% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Chenqian Le:Department of Electrical and Computer Engineering, New York University Tandon School of Engineering, New York, NY, USA
- Beatrice Fumagalli:Department of Electrical and Computer Engineering, New York University Tandon School of Engineering, New York, NY, USA;Department of Neurology, New York University Grossman School of Medicine, New York, NY, USA
- Yasamin Esmaeili:Department of Neurology, New York University Grossman School of Medicine, New York, NY, USA
- Xupeng Chen:Department of Electrical and Computer Engineering, New York University Tandon School of Engineering, New York, NY, USA
- Tianyu He:Department of Electrical and Computer Engineering, New York University Tandon School of Engineering, New York, NY, USA
- Nikasadat Emami:Department of Electrical and Computer Engineering, New York University Tandon School of Engineering, New York, NY, USA
- Adeen Flinker:Department of Neurology, New York University Grossman School of Medicine, New York, NY, USA
- Yao Wang:Department of Electrical and Computer Engineering, New York University Tandon School of Engineering, New York, NY, USA
📌 核心摘要
静默语音接口需从表面肌电信号恢复语句字符序列,难点在于电极位置与个体生理差异导致跨受试者泛化困难且校准负担重。作者以公开发布的单受试者卷积-Transformer检查点初始化共享主干,先在非留存受试者上做多受试者预训练学习跨人表征,其输出再作为目标受试者短时校准微调的起点,经联结时序分类束搜索与语言模型解码输出文本。与直接微调检查点及零样本迁移相比,该组合的关键机制差异在于复用检查点优化起点并引入多受试者预训练与目标分布校准,其实测意义是大幅降低新用户所需校准时长。在留一受试者评测设置下,预训练加微调方法的字符错误率为21.7%,低于直接微调检查点方法的字符错误率68.0%。预训练规模从1名增至26名受试者时宏平均字符错误率持续下降,三分钟校准与约13分钟全量校准无显著差异。结论仅适用于标准化8通道采集与固定句库的闭合语料,一旦评价句从全部训练中移除则性能退化至78.6%字符错误率。其适用边界受限于闭合语料与健康成人离线评测,尚未验证开放词汇与电极偏移下的外推。原文未披露训练、推理或部署成本。
🔗 开源资源
代码相关资源:https://huggingface.co/datasets/whisperle/multisubject-semg-text-v1 — 暂时无法访问
数据相关资源:https://huggingface.co/datasets/whisperle/multisubject-semg-text-v1 — 暂时无法访问
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
20. 数字写成字还是阿拉伯数字:语音识别词错误率里被忽略的归一化代价
英文题目:The Hidden Cost of Digits: Number Normalization and WER in ASR Systems
标签:#语音识别 | #评测协议 | #多语言 | #语音
评分:6.0/10 | 创新 1/2 | 技术严谨 1.2/1.5 | 实验充分 0.8/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5
排名:前50% | 文档类型:应用研究 | arXiv 原文
👥 作者与机构
- Stanisław Kacprzak:机构信息未在 arXiv HTML 中可靠披露
- Mieszko Fraś:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
自动语音识别评测输入为系统假设转写与参考转写,输出为词错误率,难点在于现代系统输出阿拉伯数字而参考多为完整拼写,波兰语等高度屈折语言中数字形态随语境变化,直接比较会引入格式偏差。方法链分为三步,首先用语言相关数字归一器将完整拼写映射为数字形式并先于去标点执行,其次施加基础归一器统一小写标点与空白,最后在归一前后分别计算参考间差异与系统词错误率增益以分离格式影响。相对仅做小写去标点的Whisper基础归一,关键机制差异是在删除逗号冒号前先做数字逆归一化并适配波兰语逗号小数与序数屈折,从而减少时间冒号与数字序列切分歧义,恢复跨系统公平比较。在VoxPopuli英语基准评测下,Whisper-IP的WER为8.38%,低于Whisper的WER 8.46%。该结论适用于含数字的朗读与议会类语音,尚不能外推至分数缩写时间口语变体密集场景。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
21. 离线也要又快又准:Jarvis 用本地微调小模型做赛车语音指令分类
英文题目:Talk to Me, Jarvis: An Open-Source Edge-Deployable Voice Assistant Framework for Autonomous Racecars
标签:#口语意图与槽位识别 | #LoRA | #语音识别 | #端侧运行 | #开源工具
评分:6.0/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 0.7/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5
排名:前50% | 文档类型:系统技术报告 | arXiv 原文
👥 作者与机构
- Daniel Henel:机构信息未在 arXiv HTML 中可靠披露
- Frederik Werner:机构信息未在 arXiv HTML 中可靠披露
- Alexander Langmann:机构信息未在 arXiv HTML 中可靠披露
- Johannes Betz:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
赛车操作员需在不转移视觉注意力的情况下下发停止、进站与调速等高层行为指令,输入为带噪声的口语,输出为17类预定义行为命令中的一类,自然表述的无界性与可执行集合的有界性构成主要难点。系统先由基于openWakeWord的唤醒词检测监听Hey Jarvis触发,以Whisper base.en在本地完成语音转文本,再由QLoRA微调后的Mistral 7B分类器将文本映射为结构化指令,接着用Coqui TTS与VITS模型合成语音反馈并经人工口头确认后通过ROS 2送入基站做可视化、安全校验与状态验证,再经移动网络转发给赛车。相比依赖云端API的通用大模型,该方案以离线轻量模型加领域数据适配换取确定性与网络独立性,更贴合赛道实时约束。在1645条增强样本按8比2划分的测试集上,本地全量微调模型达到97.63%意图分类准确率且分类器平均推理时延为1.39 s,超过已测最强云端o3-mini的85.88%。该结论仅适用于封闭指令集与英文朗读式文本输入,对犹豫、截断语音与赛道强噪声尚未验证。原文未披露训练时长、推理资源占用与部署成本。
🔗 开源资源
第三方资源:https://github.com/dscripka/openWakeWord — 链接可访问(HTTP 200)
第三方资源:https://github.com/openai/whisper — 链接可访问(HTTP 200)
第三方资源:https://github.com/coqui-ai/TTS — 链接可访问(HTTP 200)
第三方资源:https://developers.openai.com/api/reference/overview/ → https://developers.openai.com/api/reference/overview — 链接可访问(HTTP 200)
第三方资源:https://unsloth.ai — 链接可访问(HTTP 200)
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
22. 伪标签不可靠时,如何用左右可靠笔触给不确定片段加权
英文题目:Confidence-Guided Markov Weighting for Semi-Supervised Tabla Stroke Transcription
标签:#音乐转录 | #半监督学习 | #CTC | #知识蒸馏 | #音乐
评分:6.0/10 | 创新 1.4/2 | 技术严谨 1.2/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 0.5/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Rahul Bapusaheb Kodag:机构信息未在 arXiv HTML 中可靠披露
- Vipul Arora:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
塔布拉鼓点转录需将音频映射为离散鼓点符号序列,难点在于仅有少量序列级标注而无起音时刻,且伴奏干扰强、教师伪标签存在成段连续错误。方法链分3步:冻结的联结时序分类教师先为无标注音频生成伪标签序列;笔画级置信估计模型基于教师表征与后验为每个预测鼓点打分;置信引导马尔可夫加权可替代时序分类用标注数据学得的转移矩阵与可靠左右边界对候选加权后训练学生。与可替代时序分类替换式的均匀通配符不同,该方法以双端条件桥分布区分候选序列的序列合理性,从而抑制不合理替换路径。在TID+TSD、HMR、TID-S测试集上学生模型的笔画错误率分别为18.3%、33.3%、12.7%,相对序列级联结时序分类基线降低24.0%到28.7%,相对可替代时序分类替换式降低15.9%到20.6%。该结论限于3个塔布拉评测设置与固定教师协议,未验证跨乐器与开放环境泛化。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
23. 只听静音也能分类:临床语音数据集里的捷径从何而来
英文题目:All I Hear is Noise: Investigating Clever Hans Effects in Clinical Speech Datasets
标签:#病理语音评估 | #评测协议 | #语音生物标志物 | #可解释性
评分:5.9/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:前50% | 文档类型:应用研究 | arXiv 原文
👥 作者与机构
- Melanie Jouaiti:机构信息未在 arXiv HTML 中可靠披露
- Ning Ma:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
临床语音生物标志物研究以录音判读抑郁、构音障碍、帕金森病与口吃等状态,输入为异构采集的访谈与朗读录音,输出为二分类标签,难点在于录音条件与标签的隐性相关可能被误认为病理信号。本文构建受限输入审计链:先以语音活动检测切出首秒、全长与非语音拼接段,再并行做原始与谱门降噪两种声学处理,接着用三类特征加同一分类器比较可预测性差异。该设计与既往单库病理分类研究的关键机制差异在于不追求最高精度,而是用按理不应包含足够临床信息的输入反证捷径学习存在,具有方法论警示意义。在UCLASS录音地点分类任务下,静音段的加权F1分数为0.89,高于全长语音的加权F1分数0.85。结论仅适用于所测五个公开库与所用特征分类器组合,未验证跨设备泛化失败率与真实临床部署表现。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
24. 先看听者再说话:用回应前一秒表情规划下一句怎么说
标签:#音视频语音合成 | #多模态学习 | #音视频 | #扩散模型 | #主观评测
评分:5.9/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Yunji Chu:Department of Artificial Intelligence, Sogang University, Seoul, Republic of Korea
📌 核心摘要
该工作处理会话语音生成中下一句应以何种情感与韵律说出的问题,输入为前3轮对话与目标文本及目标起始前1秒听者面部序列,输出为目标情感、效价-唤醒-支配度(Valence-Arousal-Dominance,VAD)与韵律属性及可驱动声学模型的风格表示。其方法链为交互上下文编码器先将历史与目标文本序列化为文本语义,再由表情表征加时序编码器将听者帧序列压缩为反应表示,接着目标条件门控按目标语句决定视觉注入量并经残差融合形成统一表征,最后由规划头预测风格并经适配器接入Grad-TTS与HiFi-GAN实现波形。与直接复制听者情绪或用目标说话人图像推断声线的做法不同,该机制强调听者行为是需结合语义解释的上下文证据。在261样本测试集的十种子协议下,Temporal listener的Macro-F1为0.2582,高于Text-only的Macro-F1 0.2489。20位研究者的情境适配偏好有76%判给时序系统,9%判给纯文本系统,15%无偏好,但增益置信区间包含零且准确率基本持平。合成可懂度存在严重局限,故该结论适用边界受限于互补性线索而非普适提升,跨说话人与强噪声外推尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
25. 按病因分开训练为何胜过混合训练:多语种构音障碍严重度的对照实验
标签:#病理语音评估 | #对比学习 | #弱监督学习 | #多语言
评分:5.8/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 0.5/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5
排名:前50% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Bernard Muller:机构信息未在 arXiv HTML 中可靠披露
- Antonio Armando Ortiz Barrañón:机构信息未在 arXiv HTML 中可靠披露
- LaVonne Roberts:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
多语言构音障碍严重程度估计的输入为异质病因与语言的语音,输出为对照、轻度、中度、重度四级,难点在于脑性瘫痪、帕金森病与肌萎缩侧索硬化的临床量表含义不同且音系退化模式相反,强行共享标签空间会混淆边界。方法链分三环衔接:免训练音系伪标注先由强制对齐与冻结表征计算 d-prime 轮廓并分位数映射为序数标签,扩充无标注说话人;三阶段对比 HuBERT 骨干依次学习健康与障碍二分、序数边界与跨语言对齐嵌入;冻结嵌入上训练无加权线性探针输出严重程度。前者只提供 within-corpus 序数监督,后者按病因隔离表示学习,与混合病因共享模型形成机制对照,差异在于标签空间是否尊重病因边界。在说话人无关且去泄漏的各病因 held-out 子集上,病因特异模型宏观 F1 全面超越同架构同流程混合基线,其中帕金森病相对提升约 4 成。结论仅适用于已过滤的病因加语言匹配测试池,跨语言泛化主要体现为训练覆盖而非均衡多语言评测,低吻合度伪标签与单次运行限制外推。上述结论的适用边界受限于单次训练运行与以英语SAP为主的测试构成,跨语料与非SAP场景尚未验证。原文未披露训练、推理或部署成本
🔗 开源资源
- 第三方资源:https://huggingface.co/facebook/hubert-base-ls960 — 暂时无法访问
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
26. 硬弦高频色散难学:三角拨弦条件下物理信息神经网络的第一周期验证
英文题目:Towards Physics-Informed Neural Networks for Stiff Guitar String Vibrations
标签:#音乐生成 | #端到端学习 | #音乐 | #音乐信息检索
评分:5.7/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 0.8/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0/1.5 | 可复现 0.1/0.5 | 工程/实践 1/1.5
排名:前50% | 文档类型:应用研究 | arXiv 原文
👥 作者与机构
- Xinmeng Luan:机构信息未在 arXiv HTML 中可靠披露
- Kensuke Okada:机构信息未在 arXiv HTML 中可靠披露
- Ryoya Tabata:机构信息未在 arXiv HTML 中可靠披露
- Gary Scavone:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
本文输入为拨弦位置\(x_1\)与幅值\(y\)决定的三角初始位移、零初始速度与两端简支条件,输出为刚弦横向位移场\(u(x,t)\),难点是拨弦尖点富含高频且弯曲刚度\(EI\)带来随波数增长的频散与谱偏置。方法分三步:先按弦长\(L\)与振动周期\(T_p\)无量纲化坐标并将参数压缩为\(\kappa',\sigma_0',\sigma_1'\),其归一化坐标直接作为下一步输入;再经随机傅里叶特征映射将二维坐标升至高频可表征空间;最后由多层感知机预测位移并经自动微分构造偏微分方程与定解条件残差,以因果训练与自适应权重联合优化。与有限差分时域递推相比,该框架以可微分代理替代网格递推,使正向仿真可直接用于参数反演与声音重合成。在首周期振动仿真评测设置下,\(\sigma=15\)配置的指标均方误差为\(2.7\times 10^{-9}\),低于\(\sigma=1\)配置的指标均方误差\(9.7\times 10^{-9}\)。结论受限于小振幅线性模型与首周期短时区间,尚未验证长时稳定性与22 kHz全听觉带宽外推。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。












