论文解读

读稿波斯语的覆盖缺口:Neyshekar 以正式与非正式并存的长句和实体来补数据

Neyshekar 针对波斯语正式与非正式语体和命名实体覆盖不足,构建 99.02 小时朗读语料并以等时长对照证明两架构词错误率下降,但混合增益不稳定且说话人广度仍有限。

 · 更新于 2026-09-25 · 约 18 分钟 · 8804 字 阅读 →
论文解读

开放回答也要逐句打分:OpenEnded 用人工测试集约束伪标签训练

针对开放回答口语缺少准确度、流利度、韵律逐句标注的问题,OpenEnded 用 1000 条三人标注测试集加 6109 条训练与 2673 条开发伪标签支撑评估,并以冻结骨干加三头评分的 VoxPA 为更强基线,但伪标签偏向中间分且低分常与无语音绑定。

 · 更新于 2026-09-25 · 约 20 分钟 · 9580 字 阅读 →
论文解读

程序化音频预训练要分开设计源与目标:结构覆盖与渲染多样收益不同

论文用可独立控制的 FormulaBank 把程序化规模拆成公式类覆盖 C 与类内渲染多样 I,在 FDSL 与 AudioMAE 对照中显示两者收益不同且依赖学习形式,匹配的 AudioMAE 实验显示程序化音频偏好 10–25% 低掩码而 AudioSet-28K 偏好 50–75% 掩码,代价是结论限于全量微调与特定模型流程。

 · 更新于 2026-09-25 · 约 18 分钟 · 8587 字 阅读 →
论文解读

亲缘线索稀疏且跨库易失效时,用卷积加变换器做选择性聚合

论文针对日常录音下声音亲缘验证线索稀疏且跨库泛化难的问题,选择卷积局部编码加变换器长程聚合与注意力池化的两阶段度量学习路线,在自建普通话非受控库 ARKIN 上报告 CONVTRAP-TN 优于三元组基线,但从 KAN-AV 跨库到 ARKIN 时性能大幅下降且少量微调难以恢复。

 · 更新于 2026-09-25 · 约 18 分钟 · 8800 字 阅读 →
论文解读

英语向二十八语的反向补位:CVSS-X 以合成并行语音扩大翻译方向

CVSS-X 把同一批英语真人录音经机器翻译转写为二十八种目标语言文本再用多语合成配音,构造每语言约二十四万对的英到多语并行语音,同管线复测显示其合成可懂度可用但自然度低于只合成英语的 CVSS,代价是受制于翻译质量与众包录音瑕疵。

 · 更新于 2026-09-25 · 约 17 分钟 · 8477 字 阅读 →
每日研究速递

icmc-2026 论文深度解读

共收录 60 篇 icmc-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-25 · 约 123 分钟 · 61526 字 阅读 →
每日研究速递

jep-2026 论文深度解读

共收录 118 篇 jep-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-25 · 约 238 分钟 · 118878 字 阅读 →
每日研究速递

speechprosody-2026 论文深度解读

共收录 188 篇 speechprosody-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-25 · 约 360 分钟 · 180081 字 阅读 →
论文解读

记住同一条船:UniqueShip 用船舶身份隔离重测水下舰船分类

针对随机切分让同一艘船同时出现在训练与测试导致虚高的问题,UniqueShip 按 MMSI 隔离船舶、按天隔离背景构建 2460 小时船舶音频与 4218 艘船的基准,最强 Swin 加 Mel 基线在无泄漏下准确率为 0.665,而引入泄漏可抬高 0.08-0.21,且船数翻倍增益 2.4-2.6 点约为时长翻倍 0.8-1.3 点的两到三倍。

 · 更新于 2026-09-25 · 约 19 分钟 · 9357 字 阅读 →
论文解读

不用录音棚如何得到可控的管乐四重奏:ChoraleWind 的规则表情与物理建模链路

针对管乐谱到音频缺少可控可复现数据的问题,论文用 311 首四部圣咏的 MEI 编码加规则表情模型加物理建模合成构建对齐的多轨数据,最强证据是 86 小时隔离音轨与 640000 种组合的完全对齐标注,代价是合成音色不及真实录音且不追求数据驱动最优音质。

 · 更新于 2026-09-25 · 约 21 分钟 · 10332 字 阅读 →
论文解读

八类法语口音为何难分:小而偏的训练集与人类听辨上限共同设限

该文把 CFPR 扩展为八类口音评测基准并做 87 人听辨实验,再用冻结的 MMS-LID-256 训练八分类器,报告在 CFPR 上整体准确率 40.98% 而人类多数投票为 70.4%,代价是中部与东部分类互相混淆且增强后大类反而下降。

 · 更新于 2026-09-25 · 约 20 分钟 · 9907 字 阅读 →
论文解读

不重建声音本身:在潜空间里预测被遮住的法语语音

针对法语语音自监督编码问题,论文用 data2vec 2.0 式师生预测潜表示并引入 10 万小时 INA 电视广播音频,语音多任务上达到或超过 LeBenchmark 基线,但 114k 小时在大模型上在 CommonVoice 验证集未继续降低词错误率。

 · 更新于 2026-09-25 · 约 18 分钟 · 8768 字 阅读 →
论文解读

赢球和输球听得出来吗:用赛后采访捕捉自发情感的语音数据集

该工作把网球赛后发布会视频加工成带说话人角色、转写和词级对齐的自发情感语音语料,并用预训练声学与文本模型做维度回归、离散分类和文本情感三组基准,显示胜者效价与优势感更高、败者悲伤主导更集中,但两组文本多呈积极且 arousal 差异小。

 · 更新于 2026-09-25 · 约 19 分钟 · 9424 字 阅读 →
论文解读

少资源语言先补数据质量:LELD 用混合转写把捷克语等三语 ASR 做上去

针对捷克语、爱沙尼亚语和希腊语自动语音识别性能落后问题,论文用统一预处理加三阶段混合转写构建每语 1500 小时转写语料,以独立 5 小时测试集上标准化词错误率降至 3.38%-5.54% 为证据,代价是高度依赖母语者校验与语言归一化且未公开可下载资源。

 · 更新于 2026-09-25 · 约 17 分钟 · 8083 字 阅读 →
每日研究速递

nime-2026 论文深度解读

共收录 160 篇 nime-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-25 · 约 332 分钟 · 166159 字 阅读 →
论文解读

先吸气还是先想好说什么:用儿童与成人对比判断呼吸与韵律的方向

该研究以呼吸组为单位比较纯语言模型与加入呼吸的模型,报告吸气深度显著预测短语划分与基频变化且成人效应更强,支持交际需求驱动呼吸而非肺容量约束决定韵律,代价是音高重置几乎无呼吸效应且儿童数据剔除比例更高。

 · 更新于 2026-09-25 · 约 18 分钟 · 8994 字 阅读 →
论文解读

强匿名反而练不出好模型?VoxTubeS 用七个对齐版本标定隐私与可用的边界

论文以 129 万条英语 VoxTube 语音为共同源集,用嵌入变换、隐空间转换与负引导合成三族七种方法生成内容对齐的匿名语料,并以每版独立训练说话人验证模型与会话级链接实验,报告了强抑制压缩说话人空间而高效用版本残留可链接线索的权衡。

 · 更新于 2026-09-25 · 约 9 分钟 · 4502 字 阅读 →
论文解读

链接有了不等于能复现:NIME 开放实践的寻址缺口与够用型归档

论文以 NIME 2009-2025 论文库的链接普查与一个历史羽管键琴增强界面的版本化归档为证据,说明分享意愿上升但寻址与长期保存仍脆弱,并提出够用型开放方法与统一项目链接字段,代价是文档仍不完整且模块化归档需手工维护。

 · 更新于 2026-09-25 · 约 20 分钟 · 9725 字 阅读 →
论文解读

只用 5 到 10 分钟实录,如何扩出 19 小时还带逐采样标注的引擎声

该文用转角域重采样加阶次跟踪从实录提取随转速和扭矩变化的谐波指纹,再驱动谐波加噪声合成器生成带四通道嵌入标注的音频,证据是 8 个子集上阶次结构随工况对应且基线网络可收敛,代价是高阶细节为参数化改动而非逐频复刻。

 · 更新于 2026-09-25 · 约 22 分钟 · 10873 字 阅读 →
论文解读

粗框也要贴边、对时也要对帧:声画同步实例编辑的空间与时间分工

AVI-Edit 以 Wan2.2 为视频骨干,用精度因子引导的掩膜精修器管空间边界、用分离生成混音返工的音频智能体管时间对齐,在 AVISET 与 AvED-Bench 上报告了质量与同步优势,代价是多实例只能串行逐个处理。

 · 更新于 2026-09-25 · 约 20 分钟 · 9981 字 阅读 →