会议总览

ICML 2026 语音/音频论文详细分析

共分析 137 篇 ICML 2026 论文

 · 更新于 2026-09-24 · 约 460 分钟 · 229980 字 阅读 →
会议总览

ICLR 2026 语音/音频论文详细分析

共分析 133 篇 ICLR 2026 论文

 · 更新于 2026-09-24 · 约 406 分钟 · 203008 字 阅读 →
论文解读

先学发音再学音色:用合成语音开路、真人语音纠偏的低资源适配

针对缅甸语和老挝语缺少人工标注配对数据的问题,该研究先用固定音色合成语音建立文本到语音的对应,再用真人录音加双识别器一致性加权恢复目标音色控制,证据显示内容准确率得到保持而相似度被拉回,但逆序训练仍在发音准确率上占优且一致性只是不可靠程度的代理指标。

 · 约 18 分钟 · 8807 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-09-24

共分析 62 篇语音/AI 论文

 · 约 112 分钟 · 55814 字 阅读 →
论文解读

约旦方言低资源语音转写:用自监督预训练加噪声学生训练吃掉未标注语音

针对约旦方言标注语音稀缺问题,论文用 Wav2Vec 2.0 自监督表示做起点,再以五轮噪声学生训练迭代利用未标注与增强语音,在 12.5 小时标注加五批各 2.5 小时未标注条件下把词错误率降到 51%,代价是多轮大模型迭代需要双卡 83 小时级训练开销。

 · 更新于 2026-09-24 · 约 17 分钟 · 8017 字 阅读 →
论文解读

长尾之下适度再平衡:平方根采样为何优于自然与均匀采样

针对 16 类非言语发声联合转写任务,该工作用跨数据集标签归一加平方根采样后接均匀微调,在官方评测得到 63.86 分排名第四,代价是第二阶段在本地验证集上从 66.25 分回落到 58.91 分且多数类别 F1 下降。

 · 更新于 2026-09-24 · 约 18 分钟 · 8547 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-09-23

共分析 42 篇语音/AI 论文

 · 更新于 2026-09-24 · 约 77 分钟 · 38502 字 阅读 →
论文解读

声音不够时让文字来帮忙:用异构图把语言知识传给语音表示

针对 Yemba 等低资源语言声学表示难学的问题,该工作用异构图把声学节点和语言节点放在同一张图里做消息传递,并在 Google Commands 缩减集和 Yemba 孤立词数据上用 SVM 和聚类指标验证跨模态表示优于 MFCC 基线和单模态 GCN,但推理依赖预训练声学模型且未做到句子级。

 · 更新于 2026-09-24 · 约 18 分钟 · 8920 字 阅读 →
论文解读

把对齐做成链路预测:异构图如何把文本知识搬进语音词表示

针对低资源下语音文本对齐需要大编码器和大量平行数据的问题,该文把词级对齐建模为异构图上的链路预测,用 GraphSAGE 消息传递把固定文本表示传给语音节点,在 TIMIT 和 Yemba 上以轻量图训练达到可比 SAMU-XLSR 的富集与检索效果,代价是跨模态检索仍受初始声学质量制约且句子级与下游任务未验证。

 · 更新于 2026-09-24 · 约 18 分钟 · 8776 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-09-22

共分析 29 篇语音/AI 论文

 · 更新于 2026-09-24 · 约 54 分钟 · 26987 字 阅读 →
论文解读

封闭句库里练多人模型,再用三分钟校准新用户:表面肌电语音解码的个性化路径

针对 27 人、每人不足半小时数据的封闭 50 句表面肌电解码任务,论文用已发布单被试检查点初始化、多被试预训练再加目标被试微调达到 21.7% 字符错误率和 31.9% 词错误率,而 3 分钟校准与约 13 分钟全量校准无显著差异,但评估句一旦从所有训练数据中移除则退化到 78.6% 字符错误率。

 · 更新于 2026-09-24 · 约 23 分钟 · 11142 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-09-21

共分析 26 篇语音/AI 论文

 · 更新于 2026-09-24 · 约 51 分钟 · 25432 字 阅读 →
论文解读

放宽切分、收紧词典:用格子上的条件随机场做日语读音选择

针对日语无切分与多音字难题,该研究用词典格子约束候选、用字符级语境打分选择路径,并用大模型标注约两百多万句训练,常用汉字读音基准上报告 99.62% 目标词准确率,代价是专有名词与数字归一化仍需外挂模块。

 · 更新于 2026-09-24 · 约 19 分钟 · 9505 字 阅读 →
论文解读

野外波斯语音不够用:用韵律完整切分与双模型互认造出 2400 小时语料

针对波斯语缺少大规模高保真语音数据的问题,PersianVox 用声学轮次感知的韵律切分与 CTC/RNN-T 双自动语音识别一致过滤从网络音频构造语料,最强证据是 SCOREQ 在 564 句人工平均意见分上皮尔逊相关达 0.6658 优于 DNSMOS 且修复后 SCOREQ 均值从 3.04 升至 4.03,代价是从 6179.66 小时原料仅保留 …

 · 更新于 2026-09-24 · 约 19 分钟 · 9295 字 阅读 →
论文解读

泰卢固语先出声再作答:VākQA 如何把语音、转写与评测分开检验

针对泰卢固语语音事实问答缺少基准与评测不可靠问题,VākQA 用 2001 对真人 quiz 语音与双语转写先校准自动评测再测问答,发现 Gemini 作答与做裁判均领先但仍受语言、模态与级联误差影响且文化域最敏感。

 · 更新于 2026-09-24 · 约 20 分钟 · 9667 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-09-18

共分析 36 篇语音/AI 论文

 · 更新于 2026-09-24 · 约 67 分钟 · 33126 字 阅读 →
论文解读

数据不够时别先加模型:无人机声音分类里方法缩放胜过模型缩放

在 3100 段 31 类无人机音频上,论文系统比较卷积与 Transformer 架构加全量微调与四种参数高效微调,最强证据是 EfficientNet-B7 批归一化微调加三倍增强取得最高验证精度且只训练极小比例参数,而轻量卷积在精度与训练效率上普遍优于 Transformer。

 · 更新于 2026-09-24 · 约 22 分钟 · 10986 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-09-17

共分析 29 篇语音/AI 论文

 · 更新于 2026-09-24 · 约 53 分钟 · 26180 字 阅读 →
论文解读

冻住源语言适配器再叠一层:跨语言低资源适配为何选择串行堆叠

针对 Whisper 不支持的三种低资源语言,研究比较暖初始化、注意力融合与顺序适配器堆叠三种源适配器复用方式,最强证据是最近源上的顺序堆叠在全量数据上相对全量微调降低词错误率 5-8%,在一小时数据上降低 12-26%,代价是需先在约 120 小时源语言数据上训练并冻结源适配器。

 · 更新于 2026-09-24 · 约 18 分钟 · 8808 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-09-16

共分析 59 篇语音/AI 论文

 · 更新于 2026-09-24 · 约 104 分钟 · 52022 字 阅读 →