共分析 59 篇论文
⚡ 今日概览
✅ 筛选入选 59 篇 → 🔬 深度分析完成
🏷️ 标签说明:本期使用新版受控 taxonomy;站点标签页暂时兼容展示历史标签与新标签。
🏷️ 热门方向
| 方向 | 数量 | 分布 |
|---|---|---|
| #语音识别 | 8 篇 | ████████ |
| #音频分类 | 7 篇 | ███████ |
| #文本到语音 | 5 篇 | █████ |
| #病理语音评估 | 3 篇 | ███ |
| #口语理解 | 2 篇 | ██ |
| #语音质量评估 | 2 篇 | ██ |
| #轮次切换 | 2 篇 | ██ |
| #音乐检索 | 2 篇 | ██ |
📊 论文评分排行榜(59 篇,按分数降序)
📋 论文列表
🖼️ 有图的论文会在这里展示首张原论文图;点击图片可打开 arXiv 原图。
🥇 不存更多指纹,只在查询时多算一步:POLARIS 的显著性地标与查询侧扩展
英文题目:POLARIS: Training-Free Audio Fingerprinting with Saliency-Based Landmarks and Delaunay Grouping
标签:#音频指纹 | #时频分析 | #音乐 | #鲁棒性 | #基准测试
评分:8.8/10 | 创新 1.4/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 1.5/1.5 | 可复现 0.5/0.5 | 工程/实践 1.2/1.5
排名:前25% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Jiheng Li:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
音频指纹需将受压缩、噪声、滤波、混响与声学重录污染的短查询映射回参考曲目并估计偏移,而全局音高节奏不变时局部峰点漂移与三角剖分翻转仍是主要失效源。POLARIS先由对数幅度谱经细尺度平滑与宽背景相减得到对比,再按邻域对比能量归一化并融合幅度项形成显著场,取局部极大并经速率控制输出地标。随后在归一化时频平面做Delaunay三角剖分,将每个三角面量化为含绝对频率与相对偏移的哈希并以时差投票检索,查询不自信时再对二跳邻居生成临时指纹二次匹配。相对固定目标区域与直接幅度峰值,该设计以局部背景自适应抑制伪峰,并以查询侧扩展吸收拓扑变化而不膨胀参考索引。在SD-RR基准下,POLARIS-A的准确率为84.61%,高于NMFP的准确率74.33%。在Apple M2 Max硬件上自适应模式的推理开销约为0.30 s每查询,参考载荷与免训练基线相当且小于神经方法,免训练故训练成本为零。结论适用边界限于闭集、无全局变调变速及单一笔记本加手机与少量场景,开放集、大库与多设备外推尚未验证。
🔗 开源资源
- 代码相关资源:https://github.com/JihengLi/POLARIS.git → https://github.com/JihengLi/POLARIS — 链接可访问(HTTP 200)
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🥈 给定时转录本后一次标全词时间戳与说话人:非自回归标注为何更快更准
英文题目:Word Timestamps and Speaker Attribution with a Non-Autoregressive LLM
标签:#强制对齐 | #说话人分离标注 | #Transformer | #大语言模型
评分:8.4/10 | 创新 1.4/2 | 技术严谨 1.2/1.5 | 实验充分 1.3/1.5 | 清晰度 0.8/1 | 影响力 1.2/1.5 | 开源 1/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5
排名:前25% | 文档类型:模型报告 | arXiv 原文
👥 作者与机构
- Zvi Kons:机构信息未在 arXiv HTML 中可靠披露
- Avihu Dekel:机构信息未在 arXiv HTML 中可靠披露
- Hagai Aronowitz:机构信息未在 arXiv HTML 中可靠披露
- Vishal Sunder:机构信息未在 arXiv HTML 中可靠披露
- Ron Hoory:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
本文处理给定语音与文本转录后同时补齐单词级时间与说话人归属的标注问题,难点在于长音频下标签需全局单调对齐且对识别错误鲁棒。方法链分为三步:冻结的编码器先将语音变为声学向量并经查询投影映射到语言空间,转录文本在每词后插入占位符后与声学序列拼接,双向大语言模型(Large Language Model,LLM)单遍将占位符改写为说话人编号或起止时间。与逐词元自回归生成时间标签相比,并行改写避免了额外解码步与非单调输出,并保留全句双向上下文,时间戳经四词元编码而说话人标签经单词元编码以适配原词表语义。在16个英语与多语言测试集上时间对齐平均误差低至25.8 ms并全面领先外部基线,标注单遍速度达到1454倍实时而同类自回归模型仅为48.3倍。该结论限于已知转录的后标注场景,重叠语音与双任务联合建模尚未验证。训练成本为在32卡H100硬件上训练约4天且仅更新投影与低秩适配参数,推理开销仅为单遍语言模型解码而无需逐词元自回归展开。
🔗 开源资源
模型相关资源:https://huggingface.co/ibm-granite/granite-speech-4.1-2b-plus — 链接可访问(HTTP 200)
模型相关资源:https://huggingface.co/ibm-granite/granite-speech-4.1-2b-nar — 链接可访问(HTTP 200)
模型相关资源:https://huggingface.co/ibm-granite/granite-4.0-1b-base — 链接可访问(HTTP 200)
模型相关资源:https://huggingface.co/microsoft/VibeVoice-ASR-HF — 链接可访问(HTTP 200)
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🥉 读稿波斯语的覆盖缺口:Neyshekar 以正式与非正式并存的长句和实体来补数据
英文题目:Neyshekar: An Open Persian Read-Speech Corpus for Automatic Speech Recognition
标签:#语音识别 | #数据集构建 | #数据集 | #语音
评分:8.3/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 1.3/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 1.5/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5
排名:前25% | 文档类型:数据集与基准 | arXiv 原文
👥 作者与机构
- Ahmad Amirivojdan:机构信息未在 arXiv HTML 中可靠披露
- Farzad Nadiri:机构信息未在 arXiv HTML 中可靠披露
- Abolfazl Alizadeh:机构信息未在 arXiv HTML 中可靠披露
- Shaghayegh Yaraghi:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
波斯语自动语音识别(Automatic Speech Recognition,ASR)需将Perso-Arabic书写语音转写为文本,难点在于正式语与非正式语的音系形态分化、短元音省略导致的同形异音歧义以及命名实体稀疏。Neyshekar先以人工短语、同形异义词上下文与大语言模型生成文本组建提示池并经shekar规范化与逐句审核,再经网页端朗读采集与六准则人工验收得到有效录音,接着按说话人不重叠划分并附文本不重叠子集与自动语域实体标注,最后用两种架构的受控微调验证语料效用。相比直接复用众包朗读,其机制差异在于显式控制语域比例与实体密度并延长单句长度,同时提供可审计的说话人标识与成对自助法不确定性估计。在约32小时等时长训练下,Neyshekar训练的Whisper small在内部测试集词错率(Word Error Rate,WER)比Common Voice训练降低9.46个百分点,并在独立PSRB公开样本上保持约8个百分点的增益。结论仅适用于朗读波斯语适配,对区域口音、自发对话与远场鲁棒性尚未验证,且混合语料收益随架构变化。原文未披露训练、推理或部署成本。
🔗 开源资源
代码相关资源:https://github.com/amirivojdan/neyshekar — 链接可访问(HTTP 200)
数据相关资源:https://doi.org/10.5281/zenodo.18073632 → https://zenodo.org/records/22697896 — 链接可访问(HTTP 200)
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
4. 在时域里做混叠抵消:OLAC 如何对齐 MDCT 重叠实现无缝有损无损切换
英文题目:OLAC: An Overlapped Lossless Audio Codec in the Time-Domain with MDCT Compatibility
标签:#音频编码 | #信号处理 | #实时处理 | #开源工具
评分:8.2/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5
排名:前25% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Jean-Marc Valin:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
无损音频编码需在固定带宽无线传输中与有损变换编码逐帧互换,现有时域预测编码器无法覆盖改进离散余弦变换的时域混叠消除重叠与量化噪声突变。所提重叠无损音频编码器先以提升结构实现的可逆时域混叠消除窗处理重叠区并施加可逆预加重,输出的整数域重叠信号直接进入后续编码。接着前向线性预测以Burg谱估计选阶并用反射系数递进预测去相关,量化后的直接型系数与信号经位宽缩放后产生残差。再将残差经交织映射后送入至多两段的Golomb-Rice编码,并对立体声在残差域做左右声道预测,形成完整流水线。与整数离散余弦变换方案的关键差异在于仅保留旋转窗而省略DCT-IV,从而保持时域编码简洁并与Opus的CELT模式共享重叠与滤波器状态。在28首立体声48 kHz 16位共105分钟语料的评测设置下,OLAC在20 ms帧的压缩率为56.8%,低于FLAC -8的压缩率57.6%。结论仅适用于与CELT相同Vorbis窗和预加重的切换场景,未验证其他变换编码器、24位以外泛化与丢包抖动鲁棒性。原文未披露训练成本,仅给出预测器复杂度量级估计。
🔗 开源资源
- 代码相关资源:https://github.com/AOMediaCodec/oac/tree/jmvalin/olac_icassp/olac — 链接可访问(HTTP 200)
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
5. 答对不等于用对线索:CLASH 用配对语音审计讽刺检测的词与调依赖
英文题目:CLASH: Counterfactual Auditing of Lexical and Prosodic Reliance in Spoken Sarcasm Detection
标签:#口语理解 | #评测协议 | #韵律 | #音频大模型
评分:8.1/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5
排名:前25% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Qiyang Sun:机构信息未在 arXiv HTML 中可靠披露
- Xudong Li:机构信息未在 arXiv HTML 中可靠披露
- Yupei Li:机构信息未在 arXiv HTML 中可靠披露
- Jiabin Xue:机构信息未在 arXiv HTML 中可靠披露
- Yuhang Dai:机构信息未在 arXiv HTML 中可靠披露
- Jiaming Li:机构信息未在 arXiv HTML 中可靠披露
- Bjorn W. Schuller:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
口语讽刺检测需判断字面与意图是否相反,输入为目标话语及可选上下文,输出为讽刺二分类,难点是词汇内容与韵律高度纠缠。受控词汇声学分离框架对同一话语构造原始与三种变换语音,再用固定检测器打分并做配对比较,最后经时长加权与聚类自助法检验稳健性。词汇保留分支压平基频与能量起伏而保留时序,韵律保留分支用声码器替换谱包络而保留基频,近似中性分支叠加两者。与已有消融只看加音频是否有益不同,该设计引入中性参照并分离分数敏感性、区域下曲线面积判别力与二值决策。在CMMA语料的目标-only评测条件下,Qwen3-Omni词汇保留条件的AUROC为.688,高于韵律保留条件的AUROC .549。结论仅适用于所测检测器与变换链路,跨语料的上下文与交互效应并不一致。其适用边界受限于不完美解耦与语料特异结构,跨场景外推尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
- 代码相关资源:https://github.com/glam-imperial/clash — 链接可访问(HTTP 200)
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
6. 全上下文能听准却不能边听边写:缓存感知与解码时浅融合如何让泰语流式识别可用
英文题目:Typhoon ASR Streaming: Steerable Low-Latency Thai Speech Recognition with Real-Time Shallow Fusion
标签:#语音识别 | #模型融合 | #流式处理 | #高效推理
评分:7.7/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 1/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5
排名:前25% | 文档类型:系统技术报告 | arXiv 原文
👥 作者与机构
- Warit Sirichotedumrong:Typhoon Team, SCB DataX, Bangkok, Thailand
- Tanawin Samutsin:Typhoon Team, SCB DataX, Bangkok, Thailand
- Shah Faisal Wani:Typhoon Team, SCB DataX, Bangkok, Thailand
- Sittipong Sripaisarnmongkol:Typhoon Team, SCB DataX, Bangkok, Thailand
- Kunat Pipatanakul:Typhoon Team, SCB DataX, Bangkok, Thailand
📌 核心摘要
开放泰语自动语音识别(Automatic Speech Recognition, ASR)长期被离线全上下文模型主导,需读入整句音频后转写,无法满足直播字幕与语音智能体的低延迟需求,且泰语无词空格、多书面形式并存使规范化与领域词汇控制更困难。本文构建可操控流式系统,方法链为缓存感知编码器将音频分块增量编码并跨块传递缓存,预测网络与联合网络逐帧提出候选词元,浅融合层用外部语言模型与短语增强树重排候选,最后贪心解码输出规范化泰语文本。与离线Whisper式自回归模型及强制流式化的全上下文基线相比,该设计用因果卷积与分块有限上下文注意力替代双向注意力,并把词汇控制推迟到解码时加权。在TVSpeech与GigaSpeech2-Thai评测中,0.6B流式模型在1040 ms前视下字符错误率(Character Error Rate, CER)为14.1%和9.3%,相对强制流式化全上下文基线的62.8%和39.8%实现约4.5倍和4.3倍下降,同时关键词召回率从16.6%提升至20.7%且CER基本不变。结论边界在于操控仅重排已有候选,声学模型未听出的声音无法找回,且关键词增益主要在代码切换集上验证。训练成本为115M模型在4卡H100上约8.6小时,0.6B模型两阶段共约71小时,推理在单卡H100上远快于实时且融合开销不足3%。
🔗 开源资源
代码相关资源:https://warit-s.github.io/typhoon-asr-streaming/ — 链接可访问(HTTP 200)
模型相关资源:https://warit-s.github.io/typhoon-asr-streaming/ — 链接可访问(HTTP 200)
演示资源:https://warit-s.github.io/typhoon-asr-streaming/ — 链接可访问(HTTP 200)
复现相关资源:https://warit-s.github.io/typhoon-asr-streaming/ — 链接可访问(HTTP 200)
模型相关资源:https://huggingface.co/typhoon-ai/typhoon-asr-streaming-115m — 链接可访问(HTTP 200)
模型相关资源:https://huggingface.co/typhoon-ai/typhoon-asr-streaming-nemotron-0 — 链接不可用(HTTP 401)
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
7. 开放回答也要逐句打分:OpenEnded 用人工测试集约束伪标签训练
标签:#语音属性识别 | #数据标注 | #数据集 | #音频大模型
评分:7.7/10 | 创新 1.3/2 | 技术严谨 1/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5
排名:前25% | 文档类型:数据集与基准 | arXiv 原文
👥 作者与机构
- Yu-Wen Chen:Department of Computer Science, Columbia University, USA
- Eric Zhou:Department of Computer Science, Columbia University, USA
- Evelyn Ding:Department of Computer Science, Columbia University, USA
- Tianyi Shen:Department of Computer Science, Columbia University, USA
- Zhou Yu:Department of Computer Science, Columbia University, USA
- Julia Hirschberg:Department of Computer Science, Columbia University, USA
📌 核心摘要
该任务输入为汉语母语者面对聊天机器人问题的自由回答录音,输出为准确性、流利度和韵律三维 1 至 5 分的 utterance 级评分,难点在于无目标文本可对齐且内容规划与发音同时增加认知负荷。方法链由三步构成:先经命名实体识别与大模型转录审查做隐私过滤并截留 10 至 45 秒音频,再由三名标注者独立打分加分歧合议构建高质量测试集,最后用音频语言模型 audio language model / ALM 联合预测三维分数与解释以伪标注训练集与开发集。与依赖目标文本计算发音优度 Goodness-of-Pronunciation / GOP 的读句评估相比,该机制差异在于完全抛弃强制对齐而直接从声学与语言知识做整体判断,因而可迁移到真实开放问答。在 OpenEnded 测试集以 Pearson 相关系数 Pearson correlation coefficient / PCC 衡量时,融合 Speechocean 预训练的 VoxPASO 在流利度上达到 0.703,明显高于伪标签源模型的 0.451。该结论仅适用于中等水平汉语母语成人英语练习场景,对儿童、低资源口音及强噪声的泛化尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
代码相关资源:https://github.com/yuwchen/OpenEnded — 链接可访问(HTTP 200)
数据相关资源:https://github.com/yuwchen/OpenEnded — 链接可访问(HTTP 200)
第三方资源:https://pypi.org/project/lexical-diversity/ — 链接可访问(HTTP 200)
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
8. 干净环境练出的抢话预测,到鸡尾酒会为何失灵:音频敏感、视觉更稳
英文题目:Audio-Visual Turn-taking Prediction in Cocktail Party Scenarios
标签:#轮次切换 | #领域适应 | #多模态学习 | #鲁棒性
评分:7.7/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5
排名:前25% | 文档类型:应用研究 | arXiv 原文
👥 作者与机构
- Long-Vu Hoang:机构信息未在 arXiv HTML 中可靠披露
- Naomi Harte:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
本文研究鸡尾酒会场景下的预测性轮次切换预测,输入为双人对话的双通道音频与人脸视频,输出为给定时刻未来200 ms内是转换发言还是维持发言,难点在于重叠语音、低信噪比、快速打断以及发音与表情偏移。方法链第一步负责表征抽取,用对比预测编码提取音频特征并用OpenFace提取人脸视频特征,对齐至50 Hz后做滑窗切分,其输出进入时序建模。第二步负责未来语音活动建模,用语音活动投影架构预测未来2秒内双人语音活动分布,并以当前帧语音活动检测辅助稳定训练,其预测分布进入跨域训练。第三步负责域适应,先在干净Candor语料预训练再在AVCocktail鸡尾酒会语料微调,以检验从安静视频会议到高重叠噪声场景的适应能力。相对已有安静环境评估,关键机制差异在于把音频主导的预测放在多并发对话与真实噪声下做压力测试,并分离音频、视频与多模态三条路径的泛化曲线,具有揭示视觉鲁棒性的实际意义。在跨域评测设置下,MM-VAP在AVCocktail上的加权F1为56.61%,低于其在Candor上的加权F1 82.57%。结论仅适用于英语双人片段、句子级自动标签与50 Hz阈值判决流程,对多人同时竞争发言、语义型回声与更长上下文尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
- 代码相关资源:https://github.com/lggvu/mm-turn-taking — 链接可访问(HTTP 200)
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
9. 干净语音上失灵的无参考分数:从评测崩塌到奖励作弊
标签:#语音质量评估 | #评测协议 | #偏好优化 | #语音合成
评分:7.6/10 | 创新 1.6/2 | 技术严谨 1.2/1.5 | 实验充分 1.3/1.5 | 清晰度 0.8/1 | 影响力 1.2/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5
排名:前25% | 文档类型:数据集与基准 | arXiv 原文
👥 作者与机构
- Antonis Asonitis:机构信息未在 arXiv HTML 中可靠披露
- Juan Pablo Zuluaga Gomez:机构信息未在 arXiv HTML 中可靠披露
- Francesco Verdini:机构信息未在 arXiv HTML 中可靠披露
- Aref Farhadipour:机构信息未在 arXiv HTML 中可靠披露
- Marzieh Razavi:机构信息未在 arXiv HTML 中可靠披露
- Pierre-Edouard Honnet:机构信息未在 arXiv HTML 中可靠披露
- Vijeta Avijeet:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
输入为同文本跨系统的两段合成语音,输出为哪段更受听众偏好,难点在于干净现代文本到语音在无明显缺陷时人类自身一致性大幅下降。方法链分四步:先构建六语料成对偏好基准并估计人类上限,再用统一成对准确率评测33种无参考分与韵律和信号特征,接着以注入退化与时长匹配等干预分离灵敏度与跨样本排序能力,最后把单分与组合分别用作策略优化奖励并以独立裁判检验。相对已有编解码失真验证的关键差异是引入质量梯度加可靠性上限加奖励闭环,揭示退化检测与干净偏好是两种任务。在TTS-HP语料基准下,UTMOSv2的准确率为0.528,低于人类上限的准确率0.764。结论仅适用于英语为主的干净合成偏好且组合必须域内校准,跨语料迁移与零样本通用自然度均未成立。该结论的适用边界受限于英语为主的干净合成偏好,跨语料迁移尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
- 复现相关资源:https://www.mabyduck.com — 链接可访问(HTTP 200)
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
10. 程序化音频预训练要分开设计源与目标:结构覆盖与渲染多样收益不同
英文题目:Rethinking Procedural Audio Pre-training: Source Scaling and Objective Adaptation
标签:#音频分类 | #自监督学习 | #预训练 | #数据集
评分:7.6/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 1/1.5 | 可复现 0.3/0.5 | 工程/实践 0.6/1.5
排名:前25% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Jiajun Peng:机构信息未在 arXiv HTML 中可靠披露
- Fengrui Liu:机构信息未在 arXiv HTML 中可靠披露
- Xinyu Liu:机构信息未在 arXiv HTML 中可靠披露
- Feng Liu:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
程序化音频预训练以合成片段为输入,以可迁移音频表示为输出,难点在于样本量增长可能来自新生成结构或旧结构的新渲染,二者学习信号并不等同。该研究先用基于AudioPG的FormulaBank将公式类别覆盖度C与类内渲染多样性I正交控制生成预训练数据,再分别送入公式驱动监督学习FDSL与掩码自编码器AudioMAE进行预训练,最后在ESC-50、UrbanSound8K、FSD50K、Speech Commands v2、AudioSet-20K上全微调评估迁移效果。与沿用自然音频经验不同,程序化数据呈现更低的频谱块多样性与更强的时序可预测性,因而需要源感知掩码配置以匹配预测难度。在ESC-50评测任务下,AudioMAE在固定C=224时渲染多样性I=1000条件的准确率为82.75,高于渲染多样性I=16条件的准确率66.50。匹配对照显示FormulaBank最优掩码为10%-25%,而AudioSet-28K为50%-75%。结论仅适用于受控合成源与所测掩码自编码器及分类类下游任务,向开放自然音频分布与检测定位类任务外推尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
- 代码相关资源:https://github.com/Cross-Innovation-Lab/Formula-Bank — 链接可访问(HTTP 200)
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
11. 先规划后演奏:StepAudio 3 Music 用单码本与 ABC 计划平衡长曲连贯与音质
标签:#音乐生成 | #自回归模型 | #流匹配 | #混合专家模型 | #音乐
评分:7.6/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1.2/1.5 | 开源 0.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5
排名:前25% | 文档类型:系统技术报告 | arXiv 原文
👥 作者与机构
- Chengli Feng:StepFun ACE The Chinese University of Hong Kong University of California San Diego
- Zhiyue Wu:StepFun ACE The Chinese University of Hong Kong University of California San Diego
- Jiahao Song:StepFun ACE The Chinese University of Hong Kong University of California San Diego
- Zheqi Dai:StepFun ACE The Chinese University of Hong Kong University of California San Diego
- Boyang Wang:StepFun ACE The Chinese University of Hong Kong University of California San Diego
- Ruibin Yuan:StepFun ACE The Chinese University of Hong Kong University of California San Diego
- Junming Gong:StepFun ACE The Chinese University of Hong Kong University of California San Diego
- Wenxiao Zhao:StepFun ACE The Chinese University of Hong Kong University of California San Diego
- Jing Guo:StepFun ACE The Chinese University of Hong Kong University of California San Diego
- Gang Yu:StepFun ACE The Chinese University of Hong Kong University of California San Diego
- Xiangyu Zhang:StepFun ACE The Chinese University of Hong Kong University of California San Diego
- Xuerui Yang:StepFun ACE The Chinese University of Hong Kong University of California San Diego
- Chao Yan:StepFun ACE The Chinese University of Hong Kong University of California San Diego
📌 核心摘要
StepAudio 3 Music处理开放域文本提示与歌词到最长5分30秒完整歌曲的生成,需同时兼顾长程曲式连贯与高保真人声伴奏合成。系统先由混合专家自回归模型输出可读的ABC编排计划,将和弦速度节拍调性小节与旋律组织为显式上下文,再以该计划为条件预测50赫兹65536表项单码本离散音乐序列。随后流匹配扩散变换器将该离散序列映射为连续变分自编码器隐变量并解码为48千赫兹波形,编解码器固定而语言模型专注序列组织。与直接以声学重建最优为目标的表示不同,该链条把音乐组织与声学渲染解耦,使语言模型获得更密集可预测的监督并保留长序列结构能力。在339条歌词到歌曲条件的评测设置下,StepAudio 3 Music的内容欣赏度Content Enjoyment得分为7.7086,高于Suno V5.5的内容欣赏度Content Enjoyment得分7.5646。该结论仅适用于带词人声生成的整体听感与文本对齐,不保证音符级符号依从,也不覆盖纯器乐、翻唱与干声混音任务的横向比较。其适用边界受限于整体听感与文本对齐评测,音符级依从与长尾场景尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
- 演示资源:https://stepaudiollm.github.io/step-audio-3-music → https://stepaudiollm.github.io/step-audio-3-music/ — 链接可访问(HTTP 200)
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
12. 去掉提示词文本:用合成同说话人提示做微调的跨语言克隆
英文题目:Cross-Lingual F5-TTS 2: A Simplified Framework for Language-Agnostic Voice Cloning
标签:#语音克隆 | #SFT | #跨语言 | #0 样本 | #数据增强
评分:7.5/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 1/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5
排名:前25% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Qingyu Liu:机构信息未在 arXiv HTML 中可靠披露
- Rixi Xu:机构信息未在 arXiv HTML 中可靠披露
- Yushen Chen:机构信息未在 arXiv HTML 中可靠披露
- Zhikang Niu:机构信息未在 arXiv HTML 中可靠披露
- Haitao Li:机构信息未在 arXiv HTML 中可靠披露
- Pengcheng Zhu:机构信息未在 arXiv HTML 中可靠披露
- Bowen Zhang:机构信息未在 arXiv HTML 中可靠披露
- Jian Zhao:机构信息未在 arXiv HTML 中可靠披露
- Yunting Yang:机构信息未在 arXiv HTML 中可靠披露
- Qinyuan Cheng:机构信息未在 arXiv HTML 中可靠披露
- Xipeng Qiu:机构信息未在 arXiv HTML 中可靠披露
- Berrak Sisman:机构信息未在 arXiv HTML 中可靠披露
- Kai Yu:机构信息未在 arXiv HTML 中可靠披露
- Xie Chen:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
零样本语音合成在跨语言音色克隆时面临提示转录缺失问题:F5-TTS的文本条件与基于文本长度比的时长估计同时依赖提示转录,输入为无转录的多语言提示语音与目标文本,输出为保留音色的目标语音,难点在于缺失转录时文本布局错位与语速误估。第一步用冻结预训练F5-TTS为每条真实语音合成同说话人提示,并与真实目标拼接成填充式训练对,为转录无关微调提供配对监督。第二步以上一步的配对布局为基础,用按提示与目标时长比确定数量的可学习提示词加句末标记填充原提示转录槽位,使目标文本保持预训练位置并衔接声学建模。第三步以适配后的文本条件为前提,用经静音增强训练的音节级语速预测器由提示音频与目标文本估计目标时长,直接决定生成梅尔长度。与依赖 MMS 强制对齐切分真实语音的 Cross-Lingual F5-TTS 不同,该框架无需对齐器且保留预训练声学能力。在LibriSpeech-PC test-clean测试集下,Cross-Lingual F5-TTS 2的WER为2.014%,低于F5-TTS的WER 2.205%。在 LibriSpeech-PC test-clean 上新方法词错率为 2.014%,说话人相似度 SIM-o 为 0.687,同时优于 F5-TTS 与 Cross-Lingual F5-TTS。16 组跨语言组合中 14 组 SIM-o 更高。该结论适用边界受限于英语与中文训练语音与推理侧八种提示语言验证,含静音填充条件的鲁棒性测试尚未验证更长静音与噪声场景,训练成本为在八卡NVIDIA A100硬件上微调100K步。
🔗 开源资源
模型相关资源:https://huggingface.co/QingyuLiu1/Cross-Lingual_F5-TTS_2 — 链接可访问(HTTP 200)
演示资源:https://qingyuliu0521.github.io/Cross-Lingual_F5-TTS_2_demo/ — 链接可访问(HTTP 200)
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
13. 不让大模型直接说时间戳:用冻结语义加帧级定位做声音事件接地
标签:#音频事件检测 | #多模态学习 | #音频大模型 | #音频问答
评分:7.5/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.3/1.5 | 清晰度 0.9/1 | 影响力 1.1/1.5 | 开源 0.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5
排名:前25% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Yanfeng Shi:机构信息未在 arXiv HTML 中可靠披露
- Yan Song:机构信息未在 arXiv HTML 中可靠披露
- Junhui Li:机构信息未在 arXiv HTML 中可靠披露
- Tinggan Huang:机构信息未在 arXiv HTML 中可靠披露
- Wu Guo:机构信息未在 arXiv HTML 中可靠披露
- Haoyu Song:机构信息未在 arXiv HTML 中可靠披露
- Ian McLoughlin:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
时间音频定位需根据自然语言查询在长录音中输出目标事件起止区间,难点在于查询语义理解与帧级声学证据精确对齐难以兼得。所提框架先将音频与提示送入冻结大音频语言模型并取倒数第二层文本隐状态作为上下文感知查询表示,再用冻结预训练音频编码器提取帧级特征并以上采样对齐时序辅以卷积神经网络分支补充细节,接着以交叉注意力实现每帧自适应检索词元语义并融合后经Conformer时序解码输出帧级分数再平滑合并为区间。与直接生成时间戳词元的已有范式不同,该方法将语义建模与帧级活动建模解耦并保留词元级对应,避免隐式对齐从而提升定位精度与可靠性。在DESED测试集下,Ours (Qwen3-Omni)的mIoU为77.8,高于DASM的mIoU 73.9。该结论限于10秒窗口拼接编码与有监督区间标注条件,对多事件计数和未见描述泛化尚未充分验证。原文未披露训练、推理或部署成本。
🔗 开源资源
- 演示资源:https://saber5203.github.io/frame-level-grounding/ — 链接可访问(HTTP 200)
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
14. 以重建代替配对:SongCraft 用条件密度统一歌曲生成与细粒度编辑
英文题目:SongCraft: Unified Song Generation and Editing with Reconstructive Learning
标签:#歌唱生成 | #流匹配 | #音乐 | #变分自编码器
评分:7.4/10 | 创新 1.6/2 | 技术严谨 1.2/1.5 | 实验充分 1.3/1.5 | 清晰度 0.8/1 | 影响力 1.2/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5
排名:前50% | 文档类型:模型报告 | arXiv 原文
👥 作者与机构
- Haohe Liu:Meta AI
- Varun Nagaraja:Meta AI
- Gael Le Lan:Meta AI
- Xinhao Mei:Meta AI
- Zhaoheng Ni:Meta AI
- Vikas Chandra:Meta AI
- Abdelrahman Mohamed:Meta AI
- Yangyang Shi:Meta AI
📌 核心摘要
歌曲生成需从文本描述与歌词输出带人声和伴奏的立体声歌曲,难点在于可懂度、音乐结构与可编辑性难以兼得。本文提出SongCraft,先用变分自编码器(Variational Autoencoder,VAE)压缩音频,再由扩散变换器(Diffusion Transformer,DiT)学习潜在流匹配,接着以词级音素对齐与节拍条件提供稀疏生成控制,最后以稠密属性加残差编码实现重构与编辑。与噪声注入再生或配对编辑数据方法不同,该框架以修改单一可解释属性实现确定性编辑,无需调噪或人工掩膜。在内部英文歌曲评测中,SongCraft在词错误率上显著优于5个开源基线,同时主观整体质量与文本依从性领先。该模型还对VAE潜在空间做表征对齐以获得语义潜变量,并以概率切换稀疏生成与稠密重构两种训练模式,使残差编码器只补足混响与伴奏质感等未显式建模信息。在歌曲生成评测下,SongCraft的WERs为0.133,低于Levo的WERs 0.193。该结论限于30秒片段与英文流行歌曲,未验证长时结构与跨语言外推。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
15. 在可解码潜空间里做进化推断:祖先鸟声如何被生成出来
英文题目:Generating the Unheard: Phylogeny-Guided Latent Generation for Ancestral Sound Reconstruction
标签:#音频生成 | #变分自编码器 | #生物声学 | #环境声
评分:7.3/10 | 创新 1.6/2 | 技术严谨 1.2/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 0.5/1.5 | 开源 1/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Tianyi Xu:University of Wisconsin–Madison
- Shrinaath Narasimhan:University of Wisconsin–Madison
- Evan Gorstein:University of Wisconsin–Madison
- Santiago Perea:University of Wisconsin–Madison
- Yunyi Shen:Massachusetts Institute of Technology
- Claudia Solís-Lemus:University of Wisconsin–Madison
📌 核心摘要
祖先声音重建的输入是带分支长度的有根系统发育树与现存物种的5秒录音片段集合,输出是每个内部祖先节点的全新波形,难点在于高维声学表征不可解码且直接进化推断易偏离数据流形。该方法先将录音编码为冻结变分自编码器潜变量并学习与谱系距离对齐的低维性状投影,再在性状空间做布朗运动后验采样并经修剪均值与残差扰动恢复多样性。随后用锚定逆提升将性状分量与最近真实片段的声纹零空间拼接以恢复可解码潜变量,最后经解码器与声码器合成波形。与检索基线只能复制现存片段以及原始潜空间布朗运动只能产生噪声谱图相比,该管线始终停留在可解码流形并保留谱系几何。在Tyrannidae评测设置下,Full Method的指标Tree–Emb. Corr.为0.4859,高于Raw Latent BM的Tree–Emb. Corr.为0.3205。结论限于约20物种规模与间接嵌入评价,未经人耳听辨与大型辐射分支验证。原文给出单卡训练与推理耗时但未披露货币成本。
🔗 开源资源
- 数据相关资源:https://xeno-canto.org — 链接可访问(HTTP 200)
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
16. 让离散 token 同时对准识别目标与对齐严重程度:DSI 的三步做法
英文题目:Differentiable and Severity-invariant Discrete Tokens for Dysarthric Speech Recognition
标签:#语音识别 | #向量量化 | #端到端学习 | #正则化 | #言语障碍
评分:7.3/10 | 创新 1.4/2 | 技术严谨 1.1/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 0.5/1.5 | 开源 1/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5
排名:前50% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Huimeng Wang:The Chinese University of Hong Kong, Hong Kong SAR, China Institute of Software, Chinese Academy of Sciences, Beijing, China National Research Council Canada, Canada
- Xurong Xie:The Chinese University of Hong Kong, Hong Kong SAR, China Institute of Software, Chinese Academy of Sciences, Beijing, China National Research Council Canada, Canada
- Mengzhe Geng:The Chinese University of Hong Kong, Hong Kong SAR, China Institute of Software, Chinese Academy of Sciences, Beijing, China National Research Council Canada, Canada
- Haoning Xu:The Chinese University of Hong Kong, Hong Kong SAR, China Institute of Software, Chinese Academy of Sciences, Beijing, China National Research Council Canada, Canada
- Jiajun Deng:The Chinese University of Hong Kong, Hong Kong SAR, China Institute of Software, Chinese Academy of Sciences, Beijing, China National Research Council Canada, Canada
- Youjun Chen:The Chinese University of Hong Kong, Hong Kong SAR, China Institute of Software, Chinese Academy of Sciences, Beijing, China National Research Council Canada, Canada
- Chengxi Deng:The Chinese University of Hong Kong, Hong Kong SAR, China Institute of Software, Chinese Academy of Sciences, Beijing, China National Research Council Canada, Canada
- Xunying Liu:The Chinese University of Hong Kong, Hong Kong SAR, China Institute of Software, Chinese Academy of Sciences, Beijing, China National Research Council Canada, Canada
📌 核心摘要
构音障碍语音识别以声学信号为输入、以文字转写为输出,难点在于数据稀缺、与正常语音失配大以及按严重度划分的说话人异质性极强。所提可微分且严重度不变离散 token 方法先用可微分 K 均值量化器得到初始 token,再经迭代伪标签更新精炼 HuBERT 编码器与码本,然后将前端与 Conformer 后端端到端联合优化以学习面向识别的离散表示,最后加入严重度不变正则约束内容平行的健康与障碍 utterance 级 token 分布趋同。与传统 K 均值离散 token 的关键机制差异在于用 Gumbel-Softmax 松弛实现梯度回传,并显式最小化障碍与健康分布的 \(KL\) 散度而非仅靠声学聚类。在 UASpeech 上该方法词错误率为 22.07%,相对连续基线降低 0.78% 绝对误差,相对传统离散基线降低 2.22% 绝对误差;在 TORGO 上为 7.88%,对应降低 1.06% 和 1.78% 绝对误差,均通过 MAPSSWE 显著性检验。结论主要适用于孤立词与小词汇量障碍任务,对自发连续语音、未见病因与跨语言泛化尚未验证。后续实验采用未压缩 token 以保精度,在效率对比评测下其在单个 NVIDIA A40 硬件上的训练成本为 UASpeech 2.67小时、TORGO 1.78小时,推理开销对应实时率为 UASpeech 0.60、TORGO 1.13。
🔗 开源资源
模型相关资源:https://huggingface.co/facebook/hubert-large-ls960-ft — 暂时无法访问(HTTP 429)
模型相关资源:https://huggingface.co/Qwen/Qwen2.5-0.5B-Instruct — 链接可访问(HTTP 200)
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
17. 采样标注连成巨网时,按边切分为何必然泄漏
标签:#音乐检索 | #数据集构建 | #音乐 | #数据集
评分:7.2/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 0.7/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5
排名:前50% | 文档类型:数据集与基准 | arXiv 原文
👥 作者与机构
- R. Oguz Araz:机构信息未在 arXiv HTML 中可靠披露
- Xavier Lizarraga:机构信息未在 arXiv HTML 中可靠披露
- Xavier Serra:机构信息未在 arXiv HTML 中可靠披露
- Dmitry Bogdanov:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
采样识别(Sample Identification)要求从目标曲目中定位其借用的源曲目片段并建立配对,输入为商业发行录音,输出为源与目标曲目对,难点在于变换多样、标注不完备且曲目间复用关系高度交织。本文先将采样标注构建为以曲目为节点且以采样方向为边的采样图,并去除简单环转为有向无环结构,其输出的规范化图直接作为连通分支抽取的输入。接着在忽略边方向下抽取连通分支并将其分为孤立对、孤立链、树与复杂类型,该分类输出定位了集中半数标注的巨型分支并为针对性修剪提供目标。最后修剪巨型分支中的多父节点以拆分为小分支并保留其后代分支,再以分支为隔离单元按比例分配训练验证与测试划分,与直接按边随机划分相比避免了同一曲目落入多侧,具有明确的泄漏控制语义。原文未提供可核对的关键定量结果。结论仅在观测到的不完备图上成立,缺失标注与多父节点后代仍可能带来残余泄漏,外推到完整采样关系时需谨慎。该判断的适用边界受限于观测图的不完备性,伪断开分支间的残余关联属于尚未验证的外推范围。原文未披露训练、推理或部署成本。
🔗 开源资源
代码相关资源:https://zenodo.org/records/22679688 — 链接可访问(HTTP 200)
数据相关资源:https://mtg.github.io/whosampled-130k-dataset/ — 链接可访问(HTTP 200)
第三方资源:https://networkx.org/en/ — 链接可访问(HTTP 200)
第三方资源:https://www.whosampled.com/ — 链接不可用(HTTP 403)
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
18. 长音频直接写病历:端到端 SOAP 生成的轻重模型对照
标签:#口语理解 | #端到端学习 | #长音频处理 | #医疗音频
评分:7.1/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 1/1.5 | 清晰度 0.7/1 | 影响力 0.9/1.5 | 开源 1/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5
排名:前50% | 文档类型:系统技术报告 | arXiv 原文
👥 作者与机构
- Ziyu Zhang:机构信息未在 arXiv HTML 中可靠披露
- Mingchen Shao:机构信息未在 arXiv HTML 中可靠披露
- Wenjie Tian:机构信息未在 arXiv HTML 中可靠披露
- Tianlun Zuo:机构信息未在 arXiv HTML 中可靠披露
- Longhao Li:机构信息未在 arXiv HTML 中可靠披露
- Lei Xie:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
输入为平均约 9 分钟、最长 47 分钟的医患对话长音频,输出为结构化病历 SOAP(Subjective / Objective / Assessment and Plan),难点在于长时依赖漂移、医学概念漏检与格式幻觉。该工作构建约 141 万样本多任务语料做领域预训练建立跨模态对齐,再用监督微调(Supervised Fine-Tuning, SFT)强制 SOAP 结构,接着用生成式奖励策略优化(Generative Reward Policy Optimization, GRPO)按概念 F1、ROUGE-2、格式与长度惩罚四维奖励校正事实,最后用在线偏好蒸馏(Online Preference Distillation, OPD)把思维链(Chain-of-Thought, CoT)推理压缩到单遍解码。与级联式自动语音识别加大型语言模型的关键机制差异是省去中间转写,直接在声学特征上联合优化概念召回与摘要连贯,避免转写误差累积。在开发集与测试集上重量模型概念 F1 达到 0.5167,轻量模型为 0.4082,重量模型相对最强级联基线 0.2860 领先约 0.2307。该结论仅适用于合成主导的 BeTraC 数据与固定提示贪婪解码,真实口音、噪声与超长推理的外推尚未验证。原文未披露训练时长、推理延迟与部署成本。
🔗 开源资源
数据相关资源:https://huggingface.co/datasets/yfyeung/medical — 链接可访问(HTTP 200)
数据相关资源:https://huggingface.co/datasets/Hani89/medical_asr_recording_dataset — 链接可访问(HTTP 200)
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
19. 在实测参数的琴弦上学运弓:隐式摩擦、修正的最小弓压与监督天花板的可测边界
标签:#音乐生成 | #RNN | #模型比较 | #统计分析
评分:7.1/10 | 创新 1.6/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5
排名:前50% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Homayoon Beigi:机构信息未在 arXiv HTML 中可靠披露
- Grace Conneely:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
本文任务输入为运弓行程位置、振荡标签、黏着占比、频率振幅误差及上一拍蛙端力与弓速,输出为蛙端法向力增量与弓速增量,难点在于黏滑摩擦强非线性下维持弓携带琴弦大半周期的亥姆霍兹振荡窄带稳定。有限差分琴弦仿真先以隐式解析斯崔贝克摩擦生成稳态振动并输出黏着占比与滑移诊断。穷举扫描弓力弓速与弓桥距离再形成可演奏性映射并拟合最大与最小弓力边界。映射派生的最近亥姆霍兹标签随后训练控制器并转入完整运弓闭环评估以检验保持与恢复能力。与查表规则及前馈基线相比,门控循环结构以跨步隐状态记忆接触漂移并实现听果调因的反馈调节,具有应对中途扰动与接触漂移的实际意义。在四弦四起点闭环评测下,门控循环架构的亥姆霍兹分数为81.3±9.8,高于前馈架构的亥姆霍兹分数75.1±13.2。结论适用边界受限于单偏振刚性终端、固定弓弦接触比、无琴体、无换弓与刚性止弦,弦上扰动与长训练窗口外推尚未验证。在硬件实测中门控循环架构单步推理开销的计算量为1258次乘加且延迟为53.3微秒,而训练成本在长窗口下单次拟合达3216秒,相对单步有限差分控制步占比不足百分之一。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
20. 同一首歌,不同找法:用指令把音乐检索的七种关系拆开诊断
英文题目:MUUNRiver-Bench: Diagnosing Relation-Dependent Music Retrieval with Multimodal Instructions
标签:#音乐检索 | #基准设计 | #音乐 | #基准测试
评分:7.1/10 | 创新 1.6/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5
排名:前50% | 文档类型:数据集与基准 | arXiv 原文
👥 作者与机构
- Zhancheng Guo:机构信息未在 arXiv HTML 中可靠披露
- Congren Dai:机构信息未在 arXiv HTML 中可靠披露
- Shangda Wu:机构信息未在 arXiv HTML 中可靠披露
- Jianhuai Hu:机构信息未在 arXiv HTML 中可靠披露
- Danni Zhao:机构信息未在 arXiv HTML 中可靠披露
- Xiaobing Li:机构信息未在 arXiv HTML 中可靠披露
- Maosong Sun:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
指令引导的音乐检索以参考音频为证据、以自然语言指令为关系选择器,要求在风格、歌词、旋律与音色等互斥的相关性定义下输出矛盾排序,同一表征必须在保持与变化之间切换。方法链先由专家先验扩展体裁层级并生成风格提示与多语歌词,再经Suno合成渲染与改写构造3440首候选池,随后对采样源分别施加跨体裁改写、翻唱重编、人声音色迁移、干声分离与片段裁剪,形成七种查询目标对并经专家审核筛选。相对已有音频到音频或文本到音乐评测,该框架把融合模态查询作为一等评测对象,使同一协议能诊断默认相似偏好并探索性检验文本条件能力。冻结编码器诊断显示声学表征偏向局部同一性而文本对齐表征偏向语义关系,导致跨关系名次反转。在MUUNRiver-Bench片段溯源任务评测下,MERT-95M的mAP为0.93,高于CLaMP3的mAP 0.24。结论仅适用于合成分布内构造定义的诊断关系,无法证明自然曲库中的泛化排序或指令措辞的因果效应。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
21. 声调看不见的合成器:DunDun 给约鲁巴语 TTS 补一条声调轴
英文题目:Tone on a Budget: A Reference-Free Metric for Lexical Tone in Massively Multilingual Text-to-Speech
标签:#文本到语音 | #评测协议 | #语音 | #多语言 | #韵律
评分:7.0/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5
排名:前50% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Moses Daudu:机构信息未在 arXiv HTML 中可靠披露
- Adeola Enitan Bamidele:机构信息未在 arXiv HTML 中可靠披露
- Honor-Jesus Bezaleel:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
约鲁巴语(Yoruba)等声调语言完全依靠基频曲线的细微起伏决定词义区分,而常用字符错误率(Character Error Rate,CER)经由去声调的自动语音识别(Automatic Speech Recognition,ASR)转写计算,对平调化合成几乎失明。本文提出 DunDun,先从输入文本的变音符号直接读取高(High,H)/中(Mid,M)/低(Low,L)金标序列,再经强制对齐(Forced Alignment)定位声调承载单元并取基频(Fundamental Frequency,F0)残差做三分类,形成与覆盖率配对的参考无关声调精度。与基于 ASR 转写或专家标注的已有声调错误率不同,该链路完全不依赖声调标注语料与识别文本,阈值一次冻结后可按检查点节奏评分自由生成。在27话语探针评测设置下,零样本检查点的DunDun准确率为0.5674,低于5小时微调检查点的DunDun准确率0.628,且覆盖率始终高于0.94而原生锚点为0.596。该结论仅适用于变音符号可靠的正字法与单一声调语言验证,且量程在锚点附近停止区分系统优劣。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
22. 一边听一边说还要实时写字:给全双工语音对话模型加一个并行流式识别头
英文题目:Enabling Streaming User Transcription in Full-Duplex Speech-to-Speech Models
标签:#语音识别 | #多任务学习 | #全双工语音交互 | #流式处理
评分:7.0/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0.5/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5
排名:前50% | 文档类型:系统技术报告 | arXiv 原文
👥 作者与机构
- Ke Hu:机构信息未在 arXiv HTML 中可靠披露
- Nourchene Ferchichi:机构信息未在 arXiv HTML 中可靠披露
- Edresson Casanova:机构信息未在 arXiv HTML 中可靠披露
- Ankita Pasad:机构信息未在 arXiv HTML 中可靠披露
- Elena Rastorgueva:机构信息未在 arXiv HTML 中可靠披露
- Chen Chen:机构信息未在 arXiv HTML 中可靠披露
- Nithin Rao Koluguri:机构信息未在 arXiv HTML 中可靠披露
- Piotr Zelasko:机构信息未在 arXiv HTML 中可靠披露
- Yifan Peng:机构信息未在 arXiv HTML 中可靠披露
- Hainan Xu:机构信息未在 arXiv HTML 中可靠披露
- Zhehuai Chen:机构信息未在 arXiv HTML 中可靠披露
- Boris Ginsburg:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
全双工语音对话需要同时监听用户语音并生成智能体语音,但已有SALM-Duplex类架构仅输出智能体文本,缺失可用于对话记录、质量监测与无障碍场景的流式用户转写能力。该工作以连续用户音频嵌入加历史用户与智能体词元为输入,先由流式编码器输出80 ms级声学表示,再经解码器大语言模型共享隐状态并行预测用户转写与智能体回复,最后将智能体文本送入流式语音合成。为兼顾转写准确与及时响应,模型对用户文本施加秒级延迟约束并对智能体文本施加更短延迟,同时采用词首对齐与填充符填充无文本帧以实现逐帧预测。与把转写与推理混入同一文本通道的做法不同,该设计用独立嵌入层与预测头解耦两种角色并一次前向完成双通道输出。在HuggingFace Open ASR Leaderboard基准下,本方法的WER为10.21%,低于专用FastConformer-80ms基线的WER 11.71%,同时轮次切换精确率与召回率基本保持不变。该结论仅适用于英文朗读与会议类评测及约60组内部多轮对话集,未验证高重叠、强噪声与多语言外推。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
23. 不用固定槽打分:对整条时间线做全局归一化后再检索音频时刻
英文题目:Segmental Posterior Decoding for Audio Moment Retrieval
标签:#音频检索 | #统计分析 | #长音频处理 | #多模态学习
评分:7.0/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5
排名:前50% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Seungdeok Choi:机构信息未在 arXiv HTML 中可靠披露
- Seongmin Choi:机构信息未在 arXiv HTML 中可靠披露
- Inhan Choi:机构信息未在 arXiv HTML 中可靠披露
- Junho Kim:机构信息未在 arXiv HTML 中可靠披露
- Jeong-gyu Ban:机构信息未在 arXiv HTML 中可靠披露
- Yong-Hwa Park:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
音频时刻检索以长音频与自由文本查询为输入,需输出与查询语义匹配的起止时间段,难点在于长时线上存在大量重叠且互斥的候选解释,局部置信难以表达相对合理性。该方法先由查询条件化编码器生成音频记忆,再用帧级头输出起始、结束与背景(Background)分数并组合成片段势函数,接着通过半马尔可夫前向-后向推理计算全分割空间上的配分函数与片段边缘后验,最后以边缘后验为检索分数经非极大值抑制(Non-Maximum Suppression)输出。与固定槽位检测变换器按槽位置信排序不同,该机制对同一候选聚合所有包含它的分割假设,并用全局归一化引入竞争解释的抑制。在CASTELLA开发测试集1347条查询上,相比同一网络的检测变换器结构基线,该方法将R1@0.7提升10.39个百分点至41.15%,平均精度(mean Average Precision,mAP)提升9.40个百分点至34.68%,零样本迁移到UnAV-100仍保持优势。该结论目前仅在两个以环境声为主的基准上验证,对多事件密集重叠、极长音频与开放词汇查询的外推尚未证明。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
24. 长文本朗读为何跳字胡言:用对齐头检测回滚的局部约束推理
标签:#文本到语音 | #注意力机制 | #语音克隆 | #长音频处理
评分:7.0/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1.2/1.5 | 开源 0/1.5 | 可复现 0.1/0.5 | 工程/实践 1/1.5
排名:前50% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Rongxiang Wang:机构信息未在 arXiv HTML 中可靠披露
- Berkin Durmus:机构信息未在 arXiv HTML 中可靠披露
- Aysegul Orhon:机构信息未在 arXiv HTML 中可靠披露
- Eduardo Pacheco:机构信息未在 arXiv HTML 中可靠披露
- Atila Orhon:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
长文本到语音合成以长文本提示与长参考音频为输入并输出连续语音,难点在于自回归神经声码语言模型随长度增加注意力错位,导致十词以上整段漏读跳过与二十词以上长幻觉且均值方差剧增。所提局部注意力约束推理(Localized Attention-Constrained Inference,LACI)先持续监视对齐头的文本读取位置与覆盖计数以在数秒音频内检出跳过与幻觉,再回滚到故障起点并重设随机种子,最后仅在越过原故障点的试用期内施加硬注意力掩码以强制单调对齐。与全程开启掩码的注意力约束推理(Attention-Constrained Inference,ACI)不同,LACI只在检出后介入并支持多次重试,从而避免污染原本正确的生成。检测器将文本分箱统计对齐头各箱驻留步数,以覆盖不足判跳过、以久不推进判幻觉并在读完末箱后终止生成。在 AppTek Call Center 数据集上 Qwen3-TTS-0.6B 超过 1500 词提示的最坏词错率(Word Error Rate,WER)从 35.2% 降至 3.4%,并在 120 秒参考音频下将灾难性失败率从 26% 压到 1% 以下。该结论在 Qwen3-TTS-1.7B 上成立,但在 VoxCPM2 超过 1300 词时修复不完全。该适用边界受限于模型自身连贯性而非检测缺口,其超长残余失败尚未验证更大规模训练下的外推。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
25. 边说边想边办事:Realtime-Venus 如何把全双工对话与异步委派放在同一时间线上
英文题目:Realtime-Venus: A full-duplex interaction system with asynchronous delegation
标签:#全双工语音交互 | #自回归模型 | #音视频 | #流式处理
评分:6.8/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.1/0.5 | 工程/实践 1.2/1.5
排名:前50% | 文档类型:系统技术报告 | arXiv 原文
👥 作者与机构
- Ruixiang Zhao:机构信息未在 arXiv HTML 中可靠披露
- Hualei Wang:机构信息未在 arXiv HTML 中可靠披露
- Renhe Sun:机构信息未在 arXiv HTML 中可靠披露
- Enzhi Zhou:机构信息未在 arXiv HTML 中可靠披露
- Jincenzi Wu:机构信息未在 arXiv HTML 中可靠披露
- Xujie Song:机构信息未在 arXiv HTML 中可靠披露
- Kexin Shi:机构信息未在 arXiv HTML 中可靠披露
- Zihang Liu:机构信息未在 arXiv HTML 中可靠披露
- Pengcheng Zhu:机构信息未在 arXiv HTML 中可靠披露
- Jiayi Zhou:机构信息未在 arXiv HTML 中可靠披露
- Baoyue Zhang:机构信息未在 arXiv HTML 中可靠披露
- Changhao Zhang:机构信息未在 arXiv HTML 中可靠披露
- Zitong Wang:机构信息未在 arXiv HTML 中可靠披露
- Jinhong Wang:机构信息未在 arXiv HTML 中可靠披露
- Tong Niu:机构信息未在 arXiv HTML 中可靠披露
- Jingjing Liu:机构信息未在 arXiv HTML 中可靠披露
- Junan Lin:机构信息未在 arXiv HTML 中可靠披露
- Haolin He:机构信息未在 arXiv HTML 中可靠披露
- Hengshuo Chu:机构信息未在 arXiv HTML 中可靠披露
- Yuhui Chen:机构信息未在 arXiv HTML 中可靠披露
- Jian Liu:机构信息未在 arXiv HTML 中可靠披露
- Yuge Huang:机构信息未在 arXiv HTML 中可靠披露
- Junliang Xing:机构信息未在 arXiv HTML 中可靠披露
- Yuntao Wang:机构信息未在 arXiv HTML 中可靠披露
- Weiqiang Wang:机构信息未在 arXiv HTML 中可靠披露
- Chun Yu:机构信息未在 arXiv HTML 中可靠披露
- Yuanchun Shi:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
全双工交互的输入是持续到达的音频与视频流及重叠语音,输出是即时语音回复与说听控制决策,实际难点在于长时视觉记忆与外部工具执行时间尺度不同,还需在播放与推理期间持续感知打断与意图变化。方法分三步衔接:先以一秒块共享时钟把用户音频、视觉帧、助手语音与后台回送结果序列化为统一因果时间线,为后续判断提供对齐上下文;再由前端大模型在该时间线上联合预测交互控制、前景讲文本与私有委托请求,其委托文本进入后台队列而不直接播放;最后由Realtime-Venus-Harness按请求边界快照固定证据并异步调度多模态问答与工具执行,再把制备好的可讲回复送回同一会话 timeline 择机播报。与仅做语音活动检测打断或同步阻塞式工具调用不同,该双环把委托内容隐藏于播放之外并允许执行期间继续感知与说话,其实质意义是把耗时推理与实时交互解耦以保持对话连续性。在MMAU基准下,Realtime-Venus-Audio的准确率为78.0%,高于MiniCPM-o 4.5的准确率76.9%。该结论限于短窗评测与自建委托判定,复杂多步工具与长时意图漂移尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
26. 听不见还硬说:用冻结声学裁判在训练时管住语音大模型的插入幻觉
标签:#语音识别 | #强化学习 | #CTC | #会议转录 | #鲁棒性
评分:6.8/10 | 创新 1.5/2 | 技术严谨 1/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5
排名:前50% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Tingzhen Xiong:机构信息未在 arXiv HTML 中可靠披露
- Rilin Chen:机构信息未在 arXiv HTML 中可靠披露
- Weiwei Li:机构信息未在 arXiv HTML 中可靠披露
- Wentao Zhang:机构信息未在 arXiv HTML 中可靠披露
- Qicong Xie:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
自动语音识别(Automatic Speech Recognition,ASR)以音频为输入并输出转写文本,远场混响与重叠语音削弱声学证据时大语言模型仍会凭先验补全出流畅但无依据的插入词。该方法对每条音频采样8个候选并用截断词错率(Word Error Rate,WER)打分,同时由冻结的字符级声学裁判计算对齐适配分,两项各自在组内做中位数与中位数绝对偏差稳健Z归一化后加权融合,最后用组相对策略优化(Group Relative Policy Optimization,GRPO)更新语音大模型低秩适配器,推理时仅单次贪婪解码。与进度匹配的纯WER基线相比,关键差异是引入与策略优化解耦且推理无关的声学一致性约束,使弱证据下的克制在训练期被强化而非在推理期重打分。在AMI远场会议语料评测条件下,μ=0.6方法的WER为34.71%,低于纯WER基线μ=0的WER 35.89%,近场插入错误减少28.3%而远场减少22.3%且会议级聚类自助区间显著。反事实探针显示不可懂但能量保留音频上的输出长度坍缩85%至90%,表明抑制跟踪可懂度而非语音能量。训练仅用LibriSpeech加噪语音而远场混响未见于训练,基线插入率随六级难度梯度单调上升。结论边界是仅验证一种7B策略与一种0.3B裁判及单一会议语料,裁判在远场区判别力下降而训练未覆盖混响,原文未披露训练与推理耗时成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
27. 打开语音输出反而答错:用更强的纯文本策略把交错生成拉回来
英文题目:Reducing the Output-Mode Gap in Speech Language Models via Joint-Output On-Policy Distillation
标签:#音频问答 | #知识蒸馏 | #语音 | #语音大模型
评分:6.8/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Daxin Tan:机构信息未在 arXiv HTML 中可靠披露
- Dehua Tao:机构信息未在 arXiv HTML 中可靠披露
- Chengxi Deng:机构信息未在 arXiv HTML 中可靠披露
- Hanlin Zhang:机构信息未在 arXiv HTML 中可靠披露
- Xiao Chen:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
交错式语音大模型以语音输入同时生成文本与声学token,声学历史进入后续文本上下文,使语音到文本与语音模式的内部文本答案准确率显著低于纯语音到文本模式,形成输出模式差距。联合输出在策略蒸馏先从初始学生采样联合轨迹以暴露真实声学条件下的文本预测位置,再将每步学生前缀投影为纯文本历史送入冻结语音到文本教师,经文本词表归一化得到保留相对偏好的软目标。随后学生在完整交错历史下预测文本分布并以交叉熵对齐教师目标,同时以冻结联合模式参考约束声学与控制token预测以保持语音生成行为。与直接在联合轨迹或独立语音到文本回答上做监督微调不同,该方法在学生真实声学前缀上提供教师反馈,并将文本监督限制在文本词表内。在Spoken-MQA基准下,JO-OPD-Soft的输出模式差距指标为16.26,低于Base的输出模式差距指标42.87。该结论的适用边界受限于两款交错架构与数学问答及短推理任务,尚未验证分离式思考说话架构、长程对话与多语言泛化,原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
28. 背景一换就错:为每个音频样本挑出可信特征
英文题目:Sample-Conditioned Representation Selection for Audio Few-Shot Learning
标签:#音频分类 | #对比学习 | #少样本 | #鲁棒性
评分:6.8/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:前50% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Fengrui Liu:机构信息未在 arXiv HTML 中可靠披露
- Ningxin Shen:机构信息未在 arXiv HTML 中可靠披露
- Yi Li:机构信息未在 arXiv HTML 中可靠披露
- Yiwei Fu:机构信息未在 arXiv HTML 中可靠披露
- Feng Liu:机构信息未在 arXiv HTML 中可靠披露
- Jiangmeng Li:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
少样本音频分类需从每类极少支撑样本中识别新前景类别,而前景与背景共现偏移会使冻结表示中部分通道失效且可靠坐标难以事先确定。本文先训练并冻结源编码器与源分类头,再为每个输入独立预测固定预算掩码,最后在掩码表示上拟合全新情节线性头完成分类。训练时选择器以可微Gumbel Top-k松弛学习打分,前景分类损失保留类别信息,跨背景对比损失拉近同前景不同背景表示。推理时支撑与查询样本各取确定性Top-k掩码以保持坐标对齐,情节线性头仅在掩码支撑表示上拟合后预测掩码查询。与全局子集或全表示复用相比,该逐样本选择能随输入切换保留坐标并以跨背景对比监督压制背景敏感通道。在SpurAudio数据集5-way 5-shot与ResNet12骨干的OOD评测中,方法以68.161%超过匹配的无选择对照63.259%,同时IID准确率亦保持领先。该结论目前仅在SpurAudio的受控共现偏移、两款卷积骨干与1-shot和5-shot协议下得到验证,未证明可外推至开放噪声、域偏移或大规模预训练表示。原文未披露训练、推理或部署成本。
🔗 开源资源
- 代码相关资源:https://github.com/Cross-Innovation-Lab/SAMPLESELECT/ — 链接可访问(HTTP 200)
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
29. 语音大模型越靠近语言端病理线索为何越弱:编码器解码器与生成的分层核对
标签:#病理语音评估 | #模型融合 | #多语言 | #跨语言 | #音频大模型
评分:6.6/10 | 创新 1.3/2 | 技术严谨 1.1/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 1/1.5 | 可复现 0.1/0.5 | 工程/实践 0.5/1.5
排名:前50% | 文档类型:应用研究 | arXiv 原文
👥 作者与机构
- Sarthak Giri:机构信息未在 arXiv HTML 中可靠披露
- Zi Haur Pang:机构信息未在 arXiv HTML 中可靠披露
- Tatsuya Kawahara:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
本文处理以语音判断帕金森病(Parkinson’s Disease, PD)的二分类任务,输入为捷克语、德语、西班牙语的元音、朗读与轮替运动语料,输出为话语级患病概率,难点在于病理相关的嗓音与韵律异常细微且跨语言迁移困难。方法链分为三步:先冻结语音大模型并分层抽取音频编码器与大语言模型解码器隐状态,再对每层做时间均值池化后训练任务专用逻辑回归探针以定位信息在层间与编解码阶段的分布。最后用样本自适应的压缩激励模块对冻结编码器各层加权融合,输出融合表示用于分类。与已有零样本提示工作不同,本文不依赖生成文本而直接探测内部表示,并用可学习的层权重替代穷举式最优层搜索,避免单层选择泛化不足与均值池化忽略层间差异。在多语言合并评测下,Qwen2-Audio编码器的AUC为0.911,高于解码器的AUC 0.858。该结论在留一语言外推与小规模病理语料范围内成立,尚未在更大更多样队列与真实临床部署条件下验证。原文未披露训练、推理或部署成本。
🔗 开源资源
- 模型相关资源:https://huggingface.co/fixie-ai/ultravox-v0_5-llama-3_2-1b — 链接可访问(HTTP 200)
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
30. 先想明白再开口:用数据清洗、蒸馏与偏好对齐修好上下文语音合成
标签:#文本到语音 | #偏好优化 | #数据清洗 | #知识蒸馏
评分:6.6/10 | 创新 1.4/2 | 技术严谨 1/1.5 | 实验充分 1/1.5 | 清晰度 0.7/1 | 影响力 1/1.5 | 开源 0.2/1.5 | 可复现 0.1/0.5 | 工程/实践 1.2/1.5
排名:前50% | 文档类型:系统技术报告 | arXiv 原文
👥 作者与机构
- Jingbin Hu:机构信息未在 arXiv HTML 中可靠披露
- Luyu Wang:机构信息未在 arXiv HTML 中可靠披露
- Wenjie Tian:机构信息未在 arXiv HTML 中可靠披露
- Kangxiang Xia:机构信息未在 arXiv HTML 中可靠披露
- Qirui Zhan:机构信息未在 arXiv HTML 中可靠披露
- Haoyu Zhang:机构信息未在 arXiv HTML 中可靠披露
- Yunxiang Chen:机构信息未在 arXiv HTML 中可靠披露
- Houdun Liu:机构信息未在 arXiv HTML 中可靠披露
- Lei Xie:机构信息未在 arXiv HTML 中可靠披露
- Liumeng Xue:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
上下文感知指令跟随语音合成要求模型以多轮对话历史为输入,先生成思维链推理再合成目标语音,难点在于电影域噪声大、标注错配多且多模态条件方差高。该工作构建三段方法链:清洗阶段输出高保真预训练语料并继续预训练基座,蒸馏阶段由教师模型生成风格化语音并经音色转换与多模型过滤得到学生监督数据,偏好优化阶段用多候选采样与级联筛选构造高置信偏好对并以直接偏好优化加监督锚定对齐全链一致性。与单向量风格压缩和单轮显式指令范式不同,该框架把思维链显式作为推理产物与合成条件,使上下文理解与韵律执行可分别诊断与优化。在自建500样本中英文测试集上,最终系统词错率由官方基线的3.47降至2.71,说话人相似度与主观一致性同步提升。该结论仅在挑战赛电影对话分布与自建评测协议下成立,对开放域对话、长历史与未见说话人的外推尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
演示资源:https://hujingbin1.github.io/CoT-TTS-Demo-Page/ — 链接可访问(HTTP 200)
第三方资源:https://qwen.ai/blog?id=qwen3.5 — 链接可访问(HTTP 200)
第三方资源:https://ai.google.dev/gemini-api/docs/models/gemini-3.1-pro-preview?hl=zh-cn — 链接可访问(HTTP 200)
第三方资源:https://github.com/BytedanceSpeech/seed-tts-eval — 链接可访问(HTTP 200)
第三方资源:https://github.com/sarulab-speech/UTMOSv2 — 链接可访问(HTTP 200)
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
31. 不只数出多少词:CCMAN 用词间不稳定捕捉流畅性任务中的认知衰退
标签:#病理语音评估 | #多模态学习 | #语音生物标志物 | #可解释性
评分:6.6/10 | 创新 1.4/2 | 技术严谨 1.1/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5
排名:前50% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Madhurananda Pahar:机构信息未在 arXiv HTML 中可靠披露
- Caitlin Illingworth:机构信息未在 arXiv HTML 中可靠披露
- Dorota Braun:机构信息未在 arXiv HTML 中可靠披露
- Daniel Blackburn:机构信息未在 arXiv HTML 中可靠披露
- Heidi Christensen:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
输入为经CognoMemory虚拟代理采集的60秒语义动物命名与音位字母P流畅性录音,输出为健康对照、轻度认知障碍与痴呆的二分类或三分类标签,难点在于静态词数与均值聚合无法刻画检索中的时序失稳,且老年人真实临床语音自动识别词错误率约20%。方法先以Sentence-BERT、Wav2Vec2.0、spaCy及停顿与语义漂移特征构造词级多模态表示并投影至256维共享空间,其输出进入双向跨模态注意力与门控融合以形成统一序列。接着用Transformer编码器加掩码均值池化得到序列表示并拼接全局漂移均值、漂移方差与停顿方差,再经64维归一化投影头与分类头输出诊断。相对聚合基线,关键机制差异在于显式建模语义声学对齐离散度与漂移方差而非均值偏移,具有刻画整体失稳与渐进性检索 effort 的实际意义。在音位流畅性二分类任务下,CCMAN的Macro F1为0.77±0.02,高于LLM基线的Macro F1 0.72±0.03。该结论适用于50岁以上单语英语远程采集场景,对MCI严重程度分级、纵向追踪与跨语种外推尚未验证。原文未披露训练、推理或部署成本
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
32. 只标一个单日单点,靠无标注声音把时频框撑到新天新点:MAST 的三段做法
标签:#音频事件检测 | #半监督学习 | #自监督学习 | #对比学习 | #生物声学监测
评分:6.6/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 0.6/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5
排名:前50% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Tianyi Xu:机构信息未在 arXiv HTML 中可靠披露
- Daniel Pimentel-Alarcón:机构信息未在 arXiv HTML 中可靠披露
- Zuzana Buřivalová:机构信息未在 arXiv HTML 中可靠披露
- Claudia Solís-Lemus:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
被动声学监测的输入是长时野外录音转换的对数梅尔频谱,输出是任意动物声音的时频包围盒,难点在于标注稀缺且背景随日期站点剧烈漂移。本文方法链分三步:先在无标注频谱上做掩码重建预训练以学习域内声学表示,编码器初始化自 AudioSet 检查点后再在域内数据上继续预训练;再将编码器迁移为轻量检测器并以音频感知适配器恢复多尺度定位能力,同时用盒级对比损失拉开事件与背景,得到种子检测器;最后以两阶段自训练在无标注池上生成伪盒做探索再用专家标注做精修。与通用 AudioSet 预训练迁移相比,域内预训练与适配显著提升了分布外泛化。在雨林跨站点评测上自训练后 F1 达到 0.5715 且 mAP 达到 0.3921,较最强基线 AudioMAE 提升约 0.24 F1 和 0.22 mAP;在鸟类域跨站点上 F1 为 0.6434 且 mAP 为 0.4414,较 AudioMAE 提升约 0.10 F1 和 0.12 mAP。适用边界是二分类检测而不区分物种,且依赖种子检测器质量与域内验证阈值,仅验证雨林与地中海鸟类两域。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
33. 瓶颈不断搬家:从 CosyVoice 到 Qwen-Audio-3.0-TTS 的接口契约与分阶段对齐
标签:#文本到语音 | #自回归模型 | #流匹配 | #语音 | #流式处理
评分:6.6/10 | 创新 1.4/2 | 技术严谨 1.2/1.5 | 实验充分 0.7/1.5 | 清晰度 0.8/1 | 影响力 1.2/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5
排名:前50% | 文档类型:综述 | arXiv 原文
👥 作者与机构
- Qian Chen:机构信息未在 arXiv HTML 中可靠披露
- Xiangang Li:机构信息未在 arXiv HTML 中可靠披露
- Xiang Lv:机构信息未在 arXiv HTML 中可靠披露
- Han Zhao:机构信息未在 arXiv HTML 中可靠披露
- Tianyu Zhao:Alibaba Token Foundry;Equal contribution; alphabetical by last name.
📌 核心摘要
本文是 CosyVoice 到 Qwen-Audio-3.0-TTS 的技术回顾,输入为文本与参考语音提示,输出为高保真目标语音,难点在于内容正确性、音色保真、韵律自然度、延迟与鲁棒性难以在同一模块中兼顾。方法主线保持规划器加渲染器分解:自回归语言模型(autoregressive language model,LM)先由文本规划离散语义计划,再由流匹配(flow matching,FM)声学渲染器重建连续声学特征并经声码器成波。演化主线是重写两者接口契约:监督语义表征替代声学码本,有限标量量化(finite scalar quantization,FSQ)与因果分块实现可流式供给,多任务监督与可微奖励使计划可被优化,隐状态 conditioning 与分阶段联合训练最终打通梯度。与直接扩大模型或码率的做法不同,该路线把表征归属可用性与梯度可达性作为可设计变量,使低帧率下仍保留语义规划与声学重建的协同。在 SEED-TTS-Eval 上,Qwen-Audio-3.0-TTS 的 12.5 Hz 大码本变体中文内容错误率降至 1.23%,优于同表 25 Hz 参考基线的 1.45%。该结论的适用边界受限于原文引用的表内消融与跨版本同表对比,尚未验证统一数据与评测栈下的纵向因果外推,流式长尾与降质提示下的失败条件仍需独立评估。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
34. 不覆盖旧参数:为每个域追加冻结专家的全阶增量音频分类
英文题目:Parameter isolation with domain-specific experts for incremental audio classification
标签:#音频分类 | #持续学习 | #模型融合 | #生成模型
评分:6.5/10 | 创新 1.4/2 | 技术严谨 1.2/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Jongyeon Park:机构信息未在 arXiv HTML 中可靠披露
- Do-Hyeon Lim:机构信息未在 arXiv HTML 中可靠披露
- Sang-won Park:机构信息未在 arXiv HTML 中可靠披露
- Hong Kook Kim:机构信息未在 arXiv HTML 中可靠披露
- Kyungdeuk Ko:机构信息未在 arXiv HTML 中可靠披露
- Hyeongcheol Geum:机构信息未在 arXiv HTML 中可靠披露
- Jeong Eun Lim:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
面向域不可知音频分类,输入为时变声学条件下的音频帧,输出为10类声音事件标签,难点是新域到达时旧域原始音频不可回访且推理时无域标签。所提全阶增量学习Full-order Incremental Learning / FoIL为每个域训练并冻结专用专家,新专家拼接历史专家形成累积表示。基于冻结专家的批量归一化Batch Normalization / BN统计做无数据生成回放DeepInversion / DI,重建旧域样本以约束新子网络继承旧知识。再用两层多层感知机Multi-Layer Perceptron / MLP从历史拼接特征预测新专家缺失特征,使旧域样本也能获得完整分类器输入。最后在拼接特征上训练基于余弦相似度的原型分类器实现域不可知推理。在DCASE 2026 Challenge Task 7开发测试集上,单系统FoIL微观准确率78.38%对应原文77.58%口径下相对挑战基线45.50%提升约32个百分点,宏观准确率77.92%相对基线53.15%提升约24.77个百分点;四系统集成FoIL-Ensemble达到78.38%微观与78.92%宏观,为全部参赛提交中最佳。该结论的适用边界受限于仅3个域短序列验证,跨大偏移域时生成质量下降与新旧域权衡表明存在失败条件,长序列参数膨胀等外推范围尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
35. 标注预算只有 500 段时,主动学习如何在生物声学中选出值得标注的样本
标签:#音频分类 | #基准设计 | #生物声学监测 | #数据集
评分:6.5/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.1/0.5 | 工程/实践 1.2/1.5
排名:前50% | 文档类型:数据集与基准 | arXiv 原文
👥 作者与机构
- Ben McEwen:University of Amsterdam, Amsterdam, Netherlands
- Rupa Kurinchi-Vendhan:Massachusetts Institute of Technology, Cambridge, Massachusetts, USA
- Shiqi Zhang:机构信息未在 arXiv HTML 中可靠披露
- Lukas Rauch:机构信息未在 arXiv HTML 中可靠披露
- Marek Herde:机构信息未在 arXiv HTML 中可靠披露
- Sara Beery:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
被动声学监测产生海量无标注录音,任务是输入5秒片段嵌入并输出多标签物种与鲸叫类型,难点是类别极不均衡与稀疏罕见事件加跨站点时段偏移。方法链先将BirdSet三个陆地声景子集与南极海洋库统一切分为5秒多标签片段并用冻结PerchV2输出1536维嵌入,该嵌入进入下一步固定分类器。接着固定两层多层感知机分类头与BaseAL循环只允许改动采集函数预热函数与批量大小,最后以宏平均精度均值mAP的学习曲线下面积在持留测试集上排名。与随机采样相比,冠军 ADU-MMR 在 4 个子集、预算 500 样本、5 次重复平均下得分 0.507 对 0.401,相对提升 26.4%,其中最稀疏的 High Sierra Nevada 子集相对提升 67.1%,海洋 ATBFL 子集仅提升 8.0%,显示覆盖加自适应不确定性的混合策略具有实际意义。与纯不确定性Margin与纯多样性CoreSet不同,冠军以覆盖为基础自适应引入不确定性并去除批量冗余,因而在稀疏子集增益更大。该结论仅适用于同源切分与固定嵌入下的训练效率,未验证新站点迁移与端到端微调。原文披露了采样耗时与相对计算成本等代价,冠军方案因批量减半使相对成本达到基线的 2.0 倍,而第二名仅 1.1 倍且分差在标准差范围内。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
36. 把笑声叹息放进指定位置:连续隐变量、长尾补数据与多指标选样的可控语音
标签:#文本到语音 | #自回归模型 | #扩散模型 | #数据增强 | #多语言
评分:6.4/10 | 创新 1.1/2 | 技术严谨 1.2/1.5 | 实验充分 1.1/1.5 | 清晰度 0.7/1 | 影响力 0.9/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.1/1.5
排名:前50% | 文档类型:系统技术报告 | arXiv 原文
👥 作者与机构
- Ziyu Zhang:机构信息未在 arXiv HTML 中可靠披露
- Yun Chen:机构信息未在 arXiv HTML 中可靠披露
- Taihui Wang:机构信息未在 arXiv HTML 中可靠披露
- Hanzhao Li:机构信息未在 arXiv HTML 中可靠披露
- Qicong Xie:机构信息未在 arXiv HTML 中可靠披露
- Rilin Chen:机构信息未在 arXiv HTML 中可靠披露
- Zhixian Zhao:机构信息未在 arXiv HTML 中可靠披露
- Lei Xie:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
该任务输入为带16类非言语发声标记的中英文本,输出为在指定位置自然实现对应事件的语音,难点在于事件声学差异大且训练分布高度长尾。方法先以支持连续声学隐变量的DiTAR为骨干,将16类标签注册为专用单标记文本嵌入并改造停止预测以区分句中发声中断与句尾边界,再在10万小时双语语料上预训练获得通用合成与事件覆盖。接着用商业TTS针对弱类别合成增强并经词频感知重采样进入持续监督微调,推理时先在开发集上搜索语言模型引导尺度与噪声注入尺度,再用Best-of-N多指标加权从5个候选中选优。相对基于离散编解码标记的方法,连续隐变量更好地保留发声细节,而专用标记使文本前缀经因果自注意力直接约束分片生成。在修订后官方协议评测下,本系统的双语加权得分为62.786,高于官方基线的得分61.431。结论仅适用于挑战定义的标记集与评测流程,对未见事件与自发交互的外推尚未验证。原文未披露训练、推理与部署成本,推理侧需5倍生成开销。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
37. 不看画质看物理:PIVOT 用可测量的声视约束验算生成视频
英文题目:PIVOT: Physics-Grounded Verification for AI-Generated Audio-Video Detection
标签:#音频深度伪造检测 | #基准设计 | #音视频 | #基准测试
评分:6.4/10 | 创新 1.4/2 | 技术严谨 1/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5
排名:前50% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Bo Zheng:机构信息未在 arXiv HTML 中可靠披露
- Kangran Zhao:机构信息未在 arXiv HTML 中可靠披露
- Xiaoyu Zhang:机构信息未在 arXiv HTML 中可靠披露
- Weinan Guan:机构信息未在 arXiv HTML 中可靠披露
- Zhiheng Li:机构信息未在 arXiv HTML 中可靠披露
- Yize Chen:机构信息未在 arXiv HTML 中可靠披露
- Haizhou Li:机构信息未在 arXiv HTML 中可靠披露
- Qingshan Liu:机构信息未在 arXiv HTML 中可靠披露
- Siwei Lyu:机构信息未在 arXiv HTML 中可靠披露
- Baoyuan Wu:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
输入为含同步声音的短视频片段,输出为真实或生成二分类及按物理定律与时间窗组织的证据,难点在于外观与同步感易被模仿而物理细节仍难完全自洽。方法为字幕生成、物理量估计、定律选择、一致性验证四步流水线:字幕只做事实描述而不判真伪;物理量估计从视频恢复轨迹几何并从音频恢复事件级声学量;定律选择仅凭字幕与可用字段名挑选约3条可验证定律;一致性验证对每条适用约束判支持或违反或不确定并经3次独立运行多数投票。与固定物理特征全局打分及直接用大模型看真实感不同,该框架要求先显式写出适用条件、所需字段与可检查的操作约束,再核查压缩量表。在PhysForensics-Bench测试集Real加Veo子任务上准确率为72.16%,F1为65.82%,高于Gemini 3.1 Pro直接音视频检查的57.22%和63.44%。结论限于9类短时力学与声学事件及Veo 3.1 Fast与Seedance 2.0两种生成器,对渐变变形与小目标弱观测场景失效,且未做跨新生成器纵向验证。原文未披露训练推理成本与解码参数。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
38. 语音问答记住了不该记的事实:切断声学理解与隐私记忆的四种遗忘路径
英文题目:Machine Unlearning for Speech Question Answering in Large Audio-Language Models
标签:#音频问答 | #SFT | #隐私保护 | #音频大模型 | #语音
评分:6.3/10 | 创新 1.4/2 | 技术严谨 1/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Zhe Liu:Meta Platforms, Inc. Menlo Park, USA
📌 核心摘要
语音问答输入为口语问题音频加文本指令、输出为文本事实答案,难点在于声学解析与实体级事实记忆共用同一表征,隐私与非隐私问题在特征空间高度纠缠。方法链分三环:先在合成隐私与非隐私语料并集上微调大型音频语言模型得到可遗忘的部署模型,再分别以梯度上升反向推离记忆分布、以任务向量相减抵消隐私方向或以安全微调改写为拒答行为,最后用隐私泄露率与非隐私准确率加通用理解三轴验收。该文与转写遗忘的关键差异是要求切断实体到敏感事实的语义链接而非抑制音素映射,行为级拒答因此被纳入与参数级擦除同一框架比较。在F40高泄露检查点的语音问答测试集评估设置下,梯度上升15轮方法的隐私泄露率指标为9.7%,低于微调基线F40的隐私泄露率49.4%。结论仅适用于合成虚构人物与受控模板问答,近零泄露时非隐私问答必然大幅退化且未验证真实口音噪声与跨架构迁移。该适用边界受限于合成语料与受控模板,真实口音噪声与跨架构迁移等外推尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
39. 声音已很强时,脸还能帮轮流说话预测多少
英文题目:Exploring Multimodal Turn-Taking Cues in Face-to-Face Conversation using Voice Activity Projection
标签:#轮次切换 | #多模态学习 | #Transformer | #语音
评分:6.3/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Willem Berner:Lund University
- Julio Cesar Cavalcanti:KTH Royal Institute of Technology
- Kalle Åström:Lund University
- Gabriel Skantze:KTH Royal Institute of Technology
📌 核心摘要
面对面轮次切换需从双人音频与视频中预测未来2秒谁将说话,难点在于声学模糊时刻仍需依赖注视与表情等视觉线索。本文以语音活动投影为骨干,先用冻结编码器提取双通道音频表征并做说话人内自注意力与跨说话人注意力,再将视觉特征经门控与自注意力后以交叉注意力注入音频流,最后由组合器联合预测未来语音活动分布与当前语音活动。相比仅拼接视觉向量,该音频条件化交叉注意力让视觉键值先对齐语音上下文再反哺音频查询,使融合更具选择性。在Meta Seamless Interaction面对面测试集41小时上,最佳多模态模型M5相对纯音频基线将语音活动投影损失从2.166降至2.100,并将保持与切换平衡准确率从76.41%提升至78.31%,短长准确率从84.11%提升至85.26%,预保持与预切换准确率从63.90%提升至65.14%,四项差异经1000次配对自助法均显著。该结论限于干净双通道录音与会话不相交但说话人与双人组合不保证不相交的划分,在噪声单通道与未见说话人场景下尚未验证。原文未披露训练时长、推理延迟与部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
40. 不增加解码开销的领域适应:把目标域语言模型加进语音识别的参数里
英文题目:Merging the Knowledge of LLMs for Automatic Speech Recognition
标签:#语音识别 | #模型融合 | #LoRA | #领域适应 | #大语言模型
评分:6.3/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5
排名:前50% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Hayato Futami:机构信息未在 arXiv HTML 中可靠披露
- Tatsuya Kawahara:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
输入为源领域配对语音与目标领域纯文本,输出为目标领域转写文本,难点在于缺少目标领域语音文本配对且大语言模型(Large Language Model, LLM)融合在解码每步都需额外推理。方法链分三步:先在同一基座LLM上分别训练源领域语音识别适配器与源和目标领域LM适配器,再用域扩展合并将目标LM向量加权加至识别模型,或用域转移合并进一步减去源LM向量,最后以稀疏化与符号一致约束的TIES合并抑制任务干扰并直接解码。相比在对数概率层插值的浅层融合(shallow fusion, SF)与密度比(density ratio, DR),该机制把知识搬入参数空间,推理保持单模型前向。在CSJ-SPS到CSJ-APS适配上目标集字符错误率由13.9%降至13.3%,在LibriSpeech到SPGISpeech上词错误率由11.2%降至10.6%。该结论仅在同基座同LoRA结构与文本域偏移为主时成立,声学严重失配或增大合并系数会导致崩溃。合并本身不增加参数与实时率,原文未披露训练、推理或部署成本。
🔗 开源资源
- 第三方资源:https://github.com/arcee-ai/mergekit — 链接可访问(HTTP 200)
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
41. 低延迟下还要能转向:FiLM-OSN 如何保住指向性与双耳关系
英文题目:Directivity-Conditioned Low-Latency Neural Filtering for Speech Enhancement in Hearing Aids
标签:#语音增强 | #波束成形 | #助听器 | #麦克风阵列
评分:6.3/10 | 创新 1.3/2 | 技术严谨 1.1/1.5 | 实验充分 0.9/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 0.2/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Lennart Uphaus:机构信息未在 arXiv HTML 中可靠披露
- André Merboldt:机构信息未在 arXiv HTML 中可靠披露
- Markus Hofbauer:机构信息未在 arXiv HTML 中可靠披露
- Timo Gerkmann:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
该工作处理双耳助听器场景下的多说话人语音增强,输入为4通道耳后式 Behind-The-Ear混合信号,输出为遵循可调指向性衰减约束的双耳目标语音,难点在于10 ms低延迟、高混响动态场景与头影效应下的指向可控性。方法链条分为四步:短窗复数谱输入先经跨频带跨频带模块建模频谱与空间关联;可调指向向量经特征线性调制 Feature-wise Linear Modulation条件注入窄带处理;窄带状态空间模型 State-Space Model与时间卷积跟踪时变依赖并输出双耳谱估计;归一化时域损失叠加耳间相位差 Interaural Phase Difference惩罚以维持跨通道谱关系。与固定波束和长窗神经定向滤波相比,关键差异在于用Mamba替代长谱序列建模并显式约束相位而非仅逼近波形。在包含多头型与中等混响的仿真集上,所提系统在感知语音质量评估 Perceptual Evaluation of Speech Quality上达到约2.06,明显高于同延迟基线并接近长窗基线。该结论仅适用于指向中心对准某一说话人的仿真多说话人场景,未验证真实佩戴、噪声型干扰与指向连续切换下的稳定性。原文未披露训练、推理或部署成本。
🔗 开源资源
- 演示资源:https://sp-uhh.github.io/film-osn/ — 链接可访问(HTTP 200)
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
42. 声源移动后镜像全变:用位移不变代价求最优传输重心
英文题目:Acoustic Image Source Interpolation with Optimal Transport Barycenter
标签:#房间脉冲响应估计 | #信号处理 | #鲁棒性 | #空间音频
评分:6.3/10 | 创新 1.3/2 | 技术严谨 1.1/1.5 | 实验充分 0.9/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5
排名:前50% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Yuyang Liu:机构信息未在 arXiv HTML 中可靠披露
- Rumeshika Pallewela:机构信息未在 arXiv HTML 中可靠披露
- Jesper Brunnström:机构信息未在 arXiv HTML 中可靠披露
- Isabel Haasler:机构信息未在 arXiv HTML 中可靠披露
- Filip Elvander:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
本文任务是从已知物理声源位置的镜像源点云(Image Source Point Cloud,ISPC)插值新声源位置的完整点云,输入为 \(K\) 个已知点云 \(\mathcal{X}^{(k)}\) 与各已知声源到目标声源的位移距离 \(\rho^{(k)}=\|\mathbf{x}_0^{(k)}-\mathbf{y}_0\|_2\),输出为目标点云 \(\mathcal{Y}=\{\mathbf{y}_j\}_{j=1}^N\),难点在于跨点云同阶反射对应未知且观测存在散射与量化扰动。方法链首先将各点云建模为等权重离散测度并构造基于位移半径残差的传输代价 \(C_{ij}^{(k)}=(\|\mathbf{x}_i^{(k)}-\mathbf{y}_j\|_2-\rho^{(k)})^2\),其次在固定网格上求解线性规划形式的水重心(Wasserstein barycenter)以获得离散质量分布,最后在无网格模式下交替执行基于传输计划的软关联与基于加权平方距离残差的连续支撑更新,其中单点更新由基于特征值的加权平方距离近似求解器 \(\operatorname{Intp}(\cdot)\) 实现。相对最近邻关联与先估计房间几何再镜像的方法,该框架把关联与定位放在同一目标下联合优化,避免了几何误差向高阶反射累积。原文未提供可核对的关键定量结果,仅以曲线趋势说明所提初始化与多源配置更优。适用边界限于反射阶数与数量不变、无缺失虚假源且扰动较小的封闭房间,外推到复杂非镜面环境尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
43. 图注意力加什么都有用吗:LoRA 微调下语音防伪造后端的受控拆解
英文题目:Graph Attention Design Choices Matter: A Controlled Study of LoRA-Adapted Audio Anti-Spoofing
标签:#语音伪造检测 | #注意力机制 | #LoRA | #语音 | #鲁棒性
评分:6.1/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Haoyu Wang:School of Computing and Artificial Intelligence, Southwestern University of Finance and Economics, Chengdu, China MiLM Plus, Xiaomi Inc., Beijing, China School of Electronic Information, Wuhan University, Wuhan, China NERCMS, School of Computer Science, Hubei Luojia Laboratory, Wuhan University, Wuhan, China
- Jing Yang:School of Computing and Artificial Intelligence, Southwestern University of Finance and Economics, Chengdu, China MiLM Plus, Xiaomi Inc., Beijing, China School of Electronic Information, Wuhan University, Wuhan, China NERCMS, School of Computer Science, Hubei Luojia Laboratory, Wuhan University, Wuhan, China
- Chenyu Liu:School of Computing and Artificial Intelligence, Southwestern University of Finance and Economics, Chengdu, China MiLM Plus, Xiaomi Inc., Beijing, China School of Electronic Information, Wuhan University, Wuhan, China NERCMS, School of Computer Science, Hubei Luojia Laboratory, Wuhan University, Wuhan, China
- Yushan Du:School of Computing and Artificial Intelligence, Southwestern University of Finance and Economics, Chengdu, China MiLM Plus, Xiaomi Inc., Beijing, China School of Electronic Information, Wuhan University, Wuhan, China NERCMS, School of Computer Science, Hubei Luojia Laboratory, Wuhan University, Wuhan, China
- Yifan Liao:School of Computing and Artificial Intelligence, Southwestern University of Finance and Economics, Chengdu, China MiLM Plus, Xiaomi Inc., Beijing, China School of Electronic Information, Wuhan University, Wuhan, China NERCMS, School of Computer Science, Hubei Luojia Laboratory, Wuhan University, Wuhan, China
- Ningning Pan:School of Computing and Artificial Intelligence, Southwestern University of Finance and Economics, Chengdu, China MiLM Plus, Xiaomi Inc., Beijing, China School of Electronic Information, Wuhan University, Wuhan, China NERCMS, School of Computer Science, Hubei Luojia Laboratory, Wuhan University, Wuhan, China
- Gongping Huang:School of Computing and Artificial Intelligence, Southwestern University of Finance and Economics, Chengdu, China MiLM Plus, Xiaomi Inc., Beijing, China School of Electronic Information, Wuhan University, Wuhan, China NERCMS, School of Computer Science, Hubei Luojia Laboratory, Wuhan University, Wuhan, China
- Yu Zhao:School of Computing and Artificial Intelligence, Southwestern University of Finance and Economics, Chengdu, China MiLM Plus, Xiaomi Inc., Beijing, China School of Electronic Information, Wuhan University, Wuhan, China NERCMS, School of Computer Science, Hubei Luojia Laboratory, Wuhan University, Wuhan, China
- Gang Li:School of Computing and Artificial Intelligence, Southwestern University of Finance and Economics, Chengdu, China MiLM Plus, Xiaomi Inc., Beijing, China School of Electronic Information, Wuhan University, Wuhan, China NERCMS, School of Computer Science, Hubei Luojia Laboratory, Wuhan University, Wuhan, China
- Jian Luan:School of Computing and Artificial Intelligence, Southwestern University of Finance and Economics, Chengdu, China MiLM Plus, Xiaomi Inc., Beijing, China School of Electronic Information, Wuhan University, Wuhan, China NERCMS, School of Computer Science, Hubei Luojia Laboratory, Wuhan University, Wuhan, China
📌 核心摘要
语音伪造检测(speech spoofing detection)以原始波形为输入,输出真伪二分类分数,难点在于训练域的合成攻击、编解码与信道条件与测试域严重错位。该研究固定XLS-R-300M前端与LoRA适配流程,先保留AASIST2原始对称积式注意力基线路径,再并行接入3条门控残差分支分别检验非对称拼接打分、可学习温度与多温度路由,最后经可学习标量门加权求和输出节点表示。与固定温度超参搜索和整体替换后端的做法不同,该设计将打分对称性、温度可学习性与路由粒度解耦为可独立开关的残差增量,从而在相同容量预算下分离容量效应与机制效应。在5个评测集5个随机种子的统一平均等错误率(equal error rate, EER)下,可学习温度分支相对基线从10.72%降至8.99%,相对降低16.1%,而拼接打分与可学习温度联用反而升至13.46%,相对劣化25.6%,表明分支间存在强非加和交互。官方ASVspoof三集平均、可学习温度终值均值1.96、次优组合的低跨种子方差共同支撑均值与稳定性解耦的结论。结论仅适用于冻结主干加小秩适配的受限容量区间与固定图拓扑,未验证其他编码器、适配秩与图构建下的外推性。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
44. 加一段文本流,语音续写的语义缺口能补多少:匹配数据下的生成模态差
英文题目:Quantifying the Generation Modality Gap in Speech-Text Language Models
标签:#语音合成 | #流匹配 | #多模态学习 | #模型比较
评分:6.0/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:前50% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Ju-Chieh Chou:机构信息未在 arXiv HTML 中可靠披露
- Jiawei Zhou:机构信息未在 arXiv HTML 中可靠披露
- Karen Livescu:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
该研究处理口语语言模型从约 3 秒语音提示生成连贯语音延续的任务,难点在于语言内容连贯性、局部音素合理性与说话人及声学实现被耦合在一起,且纯语音与语音文本模型常用不同数据与不同指标而无法归因。方法链分为三步:先用 Mimi 将波形映射为同步的离散语义 token 序列 \(z\) 与连续表征序列 \(x\),再由因果 Transformer 输出上下文向量 \(h_m\) 并分别经离散头与条件流匹配头预测未来语音,语音文本模型另以领先 \(D=2\) 帧的内部文本流提供语言规划。延续经 Whisper 转写并用编辑距离切除提示后,以参考语言模型计算生成困惑度,同时用音素 5 元 Jensen-Shannon 散度、说话人相似度、预测平均意见分与情感嵌入分布评估语音侧。与已有内外独白或纯语音建模相比,关键差异是将纯语音、语音文本与纯文本三类变体固定在同一 OpenELM-270M 骨干与匹配数据分布上并统一以提示延续生成评价。在 C4 训练与 C4 提示的 4707 条联合非空延续子集上,语音文本转写延续的生成困惑度为 49.9,显著低于同设置纯语音模型的 228.8,而音素分布散度同为 0.47。结论仅适用于 456M 参数量级与 10k 小时量级训练,未验证更大规模与其他编解码架构下的外推。原文未披露训练、推理或部署成本。
🔗 开源资源
第三方资源:https://github.com/jjery2243542/flow-slm — 链接可访问(HTTP 200)
第三方资源:https://github.com/microsoft/UniSpeech/tree/main/downstreams/speaker_verification — 链接可访问(HTTP 200)
第三方资源:https://huggingface.co/llm-jp/Llama-Mimi-1.3B — 链接可访问(HTTP 200)
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
45. 从镜像情绪到调节情绪:ER-EDF 把感知与调节拆开做共情回复
标签:#语音对话系统 | #评测协议 | #语音情感识别 | #数据集
评分:6.0/10 | 创新 1.1/2 | 技术严谨 1/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5
排名:前50% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Hongyu Jin:机构信息未在 arXiv HTML 中可靠披露
- Wenda Zhang:机构信息未在 arXiv HTML 中可靠披露
- Runqiu Fei:机构信息未在 arXiv HTML 中可靠披露
- Gongping Huang:机构信息未在 arXiv HTML 中可靠披露
- Mike Conway:机构信息未在 arXiv HTML 中可靠披露
- Ting Dang:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
语音共情对话输入为当前语音与前K轮音频上下文,输出为口语化文本安抚回复,难点在于既要听懂效价与唤醒度,又要避免直接镜像愤怒或悲伤。所提情感调节共情对话框架Emotion Regulation Empathetic Dialogue Framework / ER-EDF先由微调的大型音频语言模型Large Audio-Language Models / LALMs识别离散情绪并映射为效价Valence与唤醒度Arousal二元组,再按负性高唤醒降级、负性低唤醒验证、正性高唤醒分享喜悦、中性维持的规则选择调节策略,最后将策略、情绪轨迹与音频上下文组装为提示并驱动冻结LALMs生成。与已有直接情绪条件生成相比,该框架在感知与生成之间插入显式调节规划层,使支持强度可随情绪加剧或缓解而调整。在MELD共情聚焦参考的人类评测设置下,ER-EDF版MiniCPM-o-2.6的人类偏好率指标为75.9%,高于基线版本的人类偏好率指标24.1%。该结论在IEMOCAP平均仅51.8%对48.2%且3个骨干仍偏好基线,Phi-4-MM在两数据集人类偏好均输给基线,未验证真实用户情绪变化与长期支持效果。其适用边界受限于表演式高强度语料与短期偏好判断,尚未验证真实交互中的情绪缓解与长期支持效果。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
46. 混合不分离直接估计合成参数:扩散先验如何压住时间抖动
标签:#音乐源分离 | #扩散模型 | #音乐 | #信号处理
评分:5.9/10 | 创新 1.4/2 | 技术严谨 1.1/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:前50% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Kengo Takemoto:机构信息未在 arXiv HTML 中可靠披露
- Tomohiko Nakamura:机构信息未在 arXiv HTML 中可靠披露
- Hiroshi Saruwatari:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
该任务从木管与弦乐重奏混合波形直接估计各声源逐帧基频(Fundamental Frequency,F0)、响度与音色特征,难点在于混合相位干涉与声源混淆使逐帧独立拟合极易产生非真实抖动。方法链分三步推进:先用预训练可微分数字信号处理(Differentiable Digital Signal Processing,DDSP)自编码器解码器搭建混合模型(DDSP Mixture Model,DDSPMM),将混合重建为各声源合成信号之和;再在孤立乐器参数上训练以乐谱音高与乐器类别为条件的去噪扩散概率模型(Denoising Diffusion Probabilistic Model,DDPM),学习残差化后参数轨迹的时序分布;最后在逆扩散每步用多尺度频谱损失修正去噪估计,使生成轨迹同时服从先验与观测混合。与无约束逐帧梯度下降相比,关键差异是以学习到的乐谱条件分数方向替代手工平滑,保留音符过渡处快变而抑制持续音区随机抖动。在URMP的Flute/Violin/Clarinet三重奏Rondeau评测任务下,Proposed的响度平均绝对误差指标为3.12 dB,低于DDSPMM的响度平均绝对误差指标7.33 dB。该结论仅在已知时间对齐乐谱、封闭6类乐器集合与12秒分段独立估计下成立,尚未验证无谱、未知乐器或跨数据集泛化,适用边界受限于该条件。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
47. 最后一层未必最好:CAL-MOS 用逐层校准让冻结骨干的多层融合更稳
英文题目:CAL-MOS: Bridging Layers with Adapters for Robust MOS Prediction Across Speech Foundation Models
标签:#语音质量评估 | #Adapter | #语音 | #模型比较 | #鲁棒性
评分:5.9/10 | 创新 1.2/2 | 技术严谨 1.3/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:前50% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Alef Iury Siqueira Ferreira:机构信息未在 arXiv HTML 中可靠披露
- Pedro Lustosa Rege Botelho:机构信息未在 arXiv HTML 中可靠披露
- Fernanda Silva:机构信息未在 arXiv HTML 中可靠披露
- Daniel Casanova:机构信息未在 arXiv HTML 中可靠披露
- Rafael Faustino:机构信息未在 arXiv HTML 中可靠披露
- Frederico Oliveira:机构信息未在 arXiv HTML 中可靠披露
- Arlindo Galvão Filho:机构信息未在 arXiv HTML 中可靠披露
- Anderson da Silva Soares:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
非侵入式语音质量评估即从语音波形直接预测平均意见分(Mean Opinion Score,MOS),难点在于失真、发音与韵律线索分布在语音基础模型(Speech Foundation Model,SFM)不同深度且随主干与数据漂移。该文先用冻结SFM抽取全部隐藏层,再经层选择或跨层聚合得到帧级表示,接着做时间掩码均值池化形成话语向量,最后由多层感知机回归头输出1到5分并优化均方误差。与直接加权求和假设各层已对齐不同,每层适配器先把表示校准到任务空间再拼接均值池化,保留主干冻结的同时缓解层间不兼容。在100轮主比较评测下,XLSR-300M最佳层选择的话语级MSE指标为0.417,低于末层探测的话语级MSE指标0.469。该校准聚合在保持主干冻结时缩小了与全量微调的差距,对多层信息兼容性较差的主干改善更明显。结论仅适用于所测英语、葡萄牙语、歌唱与中文增强等 4 种分布,跨域泛化与更强微调流水线对比尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
48. 用固定维高斯包络驯服三角基:GTFLN 的局部化、优化与稳态误差
英文题目:Gaussian-trigonometric functional link artificial neural network: design and analysis
标签:#回声消除 | #自适应滤波 | #主动降噪 | #理论分析
评分:5.8/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 1/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Jie Wang:机构信息未在 arXiv HTML 中可靠披露
- Lu Lu:机构信息未在 arXiv HTML 中可靠披露
- Yi Yu:机构信息未在 arXiv HTML 中可靠披露
- Xiaodong Li:机构信息未在 arXiv HTML 中可靠披露
- Chengshi Zheng:机构信息未在 arXiv HTML 中可靠披露
- Rodrigo C. de Lamare:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
本文处理非线性系统辨识、非线性声学回声消除与非线性有源噪声控制中的参考输入到期望输出映射问题,难点在于三角基缺乏局部化能力而核方法字典持续膨胀。作者先以零中心高斯函数为包络调制正弦与余弦基形成固定维数展开,再用最小均方误差准则更新线性权重得到滤波输出与误差,接着在能量守恒条件下对缩放参数做一阶泰勒近似并求解二次方程获得局部最优值,最后将滤波后扩展向量用于有源噪声控制形成滤波型更新。与自适应指数包络相比,高斯包络在原点无限可微且傅里叶变换指数衰减,因而属于更光滑的 Matérn 再生核希尔伯特空间并具有超指数逼近速率。在均匀输入非线性系统辨识实验4条件下,GTFLN的稳态均方误差指标为-19.19,低于AETFLN的稳态均方误差指标-17.75。该结论限于加性可分结构与高斯独立同分布假设,对强跨抽头耦合与次级通道失配尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
49. 气道狭窄听得出来吗:冻结语音基础模型加多任务聚合的筛查路径
英文题目:Listening for Airway Stenosis: A Foundation Model-Based Method for Rapid and Accessible Detection
标签:#病理语音评估 | #迁移学习 | #语音 | #语音生物标志物
评分:5.8/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 0.7/1.5 | 开源 0/1.5 | 可复现 0.1/0.5 | 工程/实践 1/1.5
排名:前50% | 文档类型:应用研究 | arXiv 原文
👥 作者与机构
- Jean Groeninger:机构信息未在 arXiv HTML 中可靠披露
- Zihao Zhao:机构信息未在 arXiv HTML 中可靠披露
- Juliana de Castilhos:机构信息未在 arXiv HTML 中可靠披露
- Sven Nebelung:机构信息未在 arXiv HTML 中可靠披露
- Daniel Truhn:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
气道狭窄早期症状非特异且确诊依赖内镜、CT与肺功能,本文研究仅用消费级设备可采集的患者语音判断患者级有无狭窄,难点在于症状异质、阴性对照多为其他疾病而非健康人且每人录音任务多样。方法为冻结编码加轻量聚合的两阶段流水线:冻结的声学基础模型(acoustic foundation model, AFM)将每段录音编码为帧序列并经时间均值池化得到任务嵌入,上一步输出的任务嵌入包进入多实例学习(multiple instance learning, MIL)模块建模任务间互补关系,最后经分类头输出患者级患病概率。与通用音频表示和手工特征相比,语音专用预训练表示更契合气流受限与共振改变。在748名参与者(134例阳性,614例混杂疾病对照)的Bridge2AI-Voice队列五折患者级划分下,WavLM中间层结合TransMIL的AUROC为0.952,准确率为0.924,明显高于手工基线。结论目前仅限单队列开发阶段估计,定位、喘鸣与严重度等细粒度表型仍弱且未经外部人群验证。原文未披露训练损失、优化器、推理阈值与部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
50. 冻住源语言适配器再叠一层:跨语言低资源适配为何选择串行堆叠
英文题目:Sequential Adapter Stacking for Cross-Lingual Low-Resource ASR
标签:#语音识别 | #Adapter | #跨语言 | #低资源
评分:5.8/10 | 创新 1.2/2 | 技术严谨 1.1/1.5 | 实验充分 0.8/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.7/1.5
排名:前50% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Thai Thi Thanh Thao Dang:机构信息未在 arXiv HTML 中可靠披露
- Mengjie Qian:机构信息未在 arXiv HTML 中可靠披露
- Kate Knill:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
大规模多语言自动语音识别(Automatic Speech Recognition,ASR)向Whisper未支持语言扩展时输入为低资源语音、输出为转写文本,难点在于预训练表示偏向高资源语言且目标标注稀缺时全量微调易破坏原有表示。本文先用编码器表示相似度、解码器词符覆盖与谱系相似度三轴度量对待选源语言排序,再在冻结Whisper主干上单语训练源语言瓶颈适配器并冻结,随后在其输出之上串联训练目标适配器并仅优化该顶层模块。相比暖初始化复用权重与注意力融合动态加权,串联堆叠(Sequential Adapter Stacking,SeqStack)以固定源条件变换加残差传递避免了注意力权重漂移。在FLEURS全量目标数据上配对最相近源语言时SeqStack相对全量微调在3个目标上词错率(Word Error Rate,WER)相对降低5%至8%,在1小时目标数据上对Assamese和Xhosa相对降低12%和26%。该结论限于Whisper Medium与3个目标语言及120小时级源适配器条件,未验证其他基座与零样本外推。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
51. 神经转码盖不住旧痕迹:从离散 RVQ 令牌中追溯传统编码器来源
英文题目:Tracing the Origins: Legacy Codec Identification in Neural Audio Transcoding
标签:#音频分类 | #Transformer | #语音 | #向量量化
评分:5.7/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 0.8/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0/1.5 | 可复现 0.1/0.5 | 工程/实践 0.5/1.5
排名:前50% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Wonje Heo:机构信息未在 arXiv HTML 中可靠披露
- Shinee Youn:机构信息未在 arXiv HTML 中可靠披露
- Yooshin Kim:机构信息未在 arXiv HTML 中可靠披露
- Chuck Chae:机构信息未在 arXiv HTML 中可靠披露
- Donghoon Shin:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
本文研究传统音频编码器经神经音频编码器转码后的来源取证问题,输入为残差向量量化 Residual Vector Quantization(RVQ)离散令牌序列,输出为源编码器类别与码率组合,难点在于非线性神经压缩将新的量化伪影非线性叠加在微弱的历史压缩痕迹之上。方法先将离散索引经预训练码本映射为连续嵌入,再由层因果模块建模码本层间因果依赖以恢复分散在层级关系中的痕迹,接着动态聚合模块估计全局与时变层权重并沿层轴加权压缩为时序特征,最后时序上下文模块捕捉长程时序签名并池化送入多层感知机 Multi-Layer Perceptron(MLP)分类。该链条中层因果输出直接作为动态权重估计的依据,加权压缩后的时序特征再进入长程时序建模,使层级解耦与时序判别前后衔接。与依赖连续波形统计或字节流的传统取证相比,该设计保留码本层级结构并在令牌域解耦叠加伪影。这种在离散令牌域直接建模层级与时序依赖的思路避免了波形重构带来的痕迹损失,因而更适配神经分发管道下的内容来源追踪需求。在 VCTK 构建的传统到神经转码评测中,固定码率下编码器识别准确率超过 97%,32 kbps 档达到 99.99%,18 类编码器加码率联合识别达到 89.34%。结论仅适用于 EnCodec 单一转码通道与封闭集语音条件,高码率下 MP3 与 Opus 细粒度区分仍困难,原文未披露训练推理成本与统计显著性。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
52. 守住信息再做取舍:残差全速率加性 U-Net 的完全重构路由
英文题目:Task-Directed Residual AddUNet:Perfect-Reconstruction Routing for Full-Rate Representations
标签:#语音识别 | #信号处理 | #形式化分析 | #语音 | #CTC
评分:5.7/10 | 创新 1.3/2 | 技术严谨 1.1/1.5 | 实验充分 0.9/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:前50% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Vikram R. Lakkavalli:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
面向语音识别 Speech Recognition 中音素与说话人、激励及信道因素纠缠而难以显式分离的问题,本文以 257 维对数幅度谱为输入,以路由后幸存表示驱动连接时序分类 Connectionist Temporal Classification(CTC)后端输出音素序列。方法链分三步推进:先将约束加性 U-Net 等价为临界采样多速率滤波器组以明确混叠抵消代价,再去掉抽取得到全速率加性合成从而解除正交镜像约束,最后固定残差路由使幸存者逐层减去被路由分量并显式保留该分量以实现结构性重建。与可逆网络约束变换本身可逆不同,该设计用表示冗余换取对任意非线性路由算子的精确可恢复性。在 TIMIT 上相同 CTC 后端下测试集音素错误率 Phone Error Rate(PER)由 28.60% 降至 25.76%,同时保持精确重建。该结论适用边界受限于小规模 CTC 基线与无显式路由正则条件,宽通道与大语境均呈现非单调效应且说话人可分性几乎未被抑制,跨大词汇与噪声场景尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
53. 没有单一嗓音等级:匹配观察机会后类型扩张与顺序依赖如何分离
标签:#音频分类 | #统计分析 | #生物声学 | #语音
评分:5.6/10 | 创新 1.2/2 | 技术严谨 1.1/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 0.5/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:前50% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Mudit Sinha:Independent Researcher, San Bruno, California 94066, United States
- Sanika Chavan:Independent Researcher, San Bruno, California 94066, United States
📌 核心摘要
输入抹香鲸尾声、人类会话电话音、孟加拉雀音节与狨猴叫声四种原生声学事件,输出可比的类型累积速度与时间约束强度,难点在于原生单元时长与语料规模悬殊且无法强行等长切分。处理链先用11组冻结编码器对全部事件做同一信号处理得到单向量,再在各曲库内独立做K均值分组形成操作性类型。接着以鲸的1501事件与113块轮廓为抽样壳对其余三库做块内匹配抽样,使事件数与相邻对机会相等,随后在同一壳上计算希普斯-赫尔丹指数、洗牌校正一阶增益与三压缩比。与既有跨物种熵比较不同,本工作不追求单一复杂度排序,而是分离累积广度、即时依赖与多事件复现三个维度,冻结表征仅作公共描述子并须经物理声学与连续无聚类分析复核。在匹配1501事件壳的评测设置下,鲸的Heaps-Herdan β指标为0.124,高于雀的Heaps-Herdan β指标0.045。结论的适用边界限于源定义事件尺度与现有档案录音,不支持物种级普适排序与录音异质性消除后的外推。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
54. 短窗相关性太 noisy:用多尺度高斯混合稳住 HMM 发射分布
标签:#言语神经解码 | #无监督学习 | #脑信号 | #语音 | #状态空间模型
评分:5.5/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 0.8/1.5 | 清晰度 0.8/1 | 影响力 0.7/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:前50% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Tianyi Li:机构信息未在 arXiv HTML 中可靠披露
- Simon Geirnaert:机构信息未在 arXiv HTML 中可靠披露
- Bert De Smedt:机构信息未在 arXiv HTML 中可靠披露
- Alexander Bertrand:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
选择性听觉注意解码以脑电信号与双路候选语音包络为输入,输出被注意说话人身份,实际难点是短决策窗下Fisher-z相关估计方差大且注意标签缺失使单窗判决不可靠。该文方法链为反向解码器重建包络并计算多窗长Fisher-z相关,接着以多尺度高斯混合模型(Gaussian Mixture Model,GMM)联合估计注意与非注意分量,最后将估计的发射分布代入隐马尔可夫模型(Hidden Markov Model,HMM)做前向后向平滑。与单尺度独立拟合相比,关键差异是跨尺度共享均值并以与样本数成反比的方差缩放律约束估计,从而用长窗稳定统计辅助短窗。在KU Leuven双说话人数据16名被试留一被试解码评测中,72 min数据下1 s窗HMM准确率多尺度为77.98%,较单尺度提升1.82个百分点。该结论适用边界限于监督训练的被试无关解码器加无监督后处理流程,长窗辅助依赖均值跨尺度近似不变假设,跨语种与跨设备外推尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
55. 去掉语言方向:用残差做未见语言的音频伪造检测
英文题目:Language Orthogonalization for Zero-Shot Cross-Lingual Audio Deepfake Detection
标签:#音频深度伪造检测 | #领域适应 | #跨语言 | #0 样本
评分:5.5/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 0.8/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:前50% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Minu Kim:机构信息未在 arXiv HTML 中可靠披露
- Ji Sub Um:机构信息未在 arXiv HTML 中可靠披露
- Hoirin Kim:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
该文处理零样本跨语言音频深度伪造检测,输入为训练时完全未见的目标语言语音,输出为真实与伪造二分类判定,难点在于自监督语音模型表征混杂语言结构,源与目标真实分布偏移误导伪造边界且随语言距离增大而加重。方法分三步衔接:第一步用冻结多语言语言识别编码器提取连续语言嵌入并用冻结自监督语音模型提取utterance表征,第二步仅以源语言真实语音的成对嵌入拟合从语言嵌入到语音表征的岭回归映射,第三步对真实与伪造表征统一减去语言可预测分量得到残差并送入逻辑回归判定。与依赖离散标签或需目标数据适配的去偏不同,该机制利用连续语言识别空间几何实现对未见语言的外推,保留伪造伪影而对齐真实分布。在SEA-Spoof数据集Leave-N-Out评估下,6骨干平均等错误率(Equal Error Rate,EER)从N=1时4.08%降至3.73%,N=5时从14.67%降至12.44%,平均相对下降9%到17%。语言识别空间余弦距离与跨语言EER呈正Pearson相关,远距离迁移基线更差但增益更大。结论仅在南亚与东南亚6语言、6骨干及浅层分类器下验证,细分组存在近距离倒退,未证明对远缘语系、大规模伪造类型或端到端检测器的外推能力。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
56. 说话人向量为何按性别国籍分层:用单链接聚类与匹配打开黑盒
英文题目:Interpreting hierarchical organisation of speaker embeddings
标签:#说话人识别 | #评测协议 | #可解释性 | #语音
评分:5.4/10 | 创新 1.2/2 | 技术严谨 1.1/1.5 | 实验充分 0.9/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0/1.5 | 可复现 0.1/0.5 | 工程/实践 0.5/1.5
排名:后 50% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Yanze Xu:机构信息未在 arXiv HTML 中可靠披露
- Wenwu Wang:机构信息未在 arXiv HTML 中可靠披露
- Mark D. Plumbley:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
本文输入为测试话语的声学频谱并输出用于区分说话人身份的向量表示,难点在于识别网络的表征组织不透明且已有扁平聚类无法揭示簇间层级关系。方法链由三环构成:首先用单链接聚类 Single-Linkage Clustering 生成层次簇树,其输出的全部候选簇进入簇类匹配 Cluster-Class Matching 得到整体对齐分数,随后层次化簇类匹配 Hierarchical Cluster-Class Matching 在个体类与合取类构成的类别池中贪心选取最优簇类对并用 L-score 量化匹配。与仅报告整体 F-score 的已有匹配相比,该机制为每个类指定语义簇并以精确率与召回率中较弱者界定匹配度,使误匹配可归因于漏检或混入。该层次树经树状图可视化后高层簇对应性别语义而低层簇对应国籍合取与身份语义,从而揭示语义在层级组织中的分布规律。在VoxCeleb1测试集评估设置下,国籍&性别合取类的CCM F-score为0.8316,高于国籍个体类的CCM F-score 0.7710。结论仅适用于所检验的 ResNetSE34L 嵌入与欧氏距离下的单链接结构,未验证其他架构、距离度量或扁平聚类的相对优劣。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
57. 秒级对齐加软标签:AVNet 如何让声音与画面在缺模态时仍能互补
英文题目:Multimodal Emergency Vehicle Classification via Audio-Visual Transformers and Knowledge Distillation
标签:#音频分类 | #多模态学习 | #知识蒸馏 | #Transformer | #音视频
评分:5.4/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 0.6/1.5 | 清晰度 0.8/1 | 影响力 0.7/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.6/1.5
排名:后 50% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Vijay John:机构信息未在 arXiv HTML 中可靠披露
- Amar Dabaja:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
紧急车辆分类需同时利用警笛声音与车辆外观,输入为10秒音视频片段,输出为救护车、消防车、警车与道路背景四类标签,难点在于单模态在城市噪声、夜间与遮挡下会系统性失效。AVNet方法链分为三步:音频谱图Transformer与视频Vision Transformer先分别编码各自模态并输出单模态表示,随后按秒对齐的交叉注意力将每帧视频查询与同秒音频键值融合为联合序列,最后经时序Transformer池化得到融合判别结果,缺失模态则以可学习的空嵌入替代。与全局拼接或全序列交叉注意力不同,该设计将物理时间对应直接固化为索引对齐,无需学习对齐机制且保留秒级结构。在Google AudioSet构成的281片段测试集上,音视频融合分支总体准确率为66.6%,相对音频分支56.2%提升10.4个百分点,相对视频分支51.6%提升15.0个百分点。结论仅适用于低分辨率短片段的四分类封闭测试,尚未验证开放道路噪声、远距离小目标与实时流式条件下的外推能力。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
58. 段落是功能语境而非情绪模板:100 首中文流行歌的局部循环与全局累积
标签:#音乐理解 | #统计分析 | #音乐 | #音乐信息检索
评分:5.2/10 | 创新 1/2 | 技术严谨 1.2/1.5 | 实验充分 0.7/1.5 | 清晰度 0.8/1 | 影响力 0.7/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:后 50% | 文档类型:应用研究 | arXiv 原文
👥 作者与机构
- Jingyi Lyu:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
该研究输入为完整中文流行歌曲音频,输出为与主歌、副歌等七类功能段落对齐的连续效价与唤醒度轨迹,难点在于相同声学变化在不同曲式位置承载不同功能含义。方法链分四步:先按歌手分层配额抽取100首歌曲并人工标注1046个段落边界形成结构框架,再冻结双教师模型以0.5秒步长推断全曲连续效价值与唤醒度值并与边界对齐。接着经滑窗融合后按段取均值得到段级情感表示,最后以歌曲为配对单元做段类型、相邻转移、重复段与整曲路径统计检验,使帧级估计逐级汇入歌曲级推断。与固定窗切分或仅区分主副歌的已有音乐情感识别不同,该工作把连续轨迹显式映射到七类功能语境并检验重复段情感回归与整曲累积,使局部循环与全局累积可被量化区分。在100首歌曲语料的歌曲加权评测下,副歌的唤醒度指标为0.206,高于主歌的唤醒度指标-0.073。结论仅适用于所选华语流行样本与模型估计VA,不支持因果解释与单模板推广。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
59. 把静态 NCERT 课本变成问答式视频:检索接地,生成管讲法与画面
英文题目:Dynamic Learning Solutions: A System for Personalized Educational Video Generation
标签:#音视频生成 | #检索增强 | #文本到语音 | #教育
评分:3.7/10 | 创新 0.8/2 | 技术严谨 0.8/1.5 | 实验充分 0.2/1.5 | 清晰度 0.7/1 | 影响力 0.3/1.5 | 开源 0/1.5 | 可复现 0.1/0.5 | 工程/实践 0.8/1.5
排名:后 50% | 文档类型:系统技术报告 | arXiv 原文
👥 作者与机构
- Siddhanth Sridhar:机构信息未在 arXiv HTML 中可靠披露
- Shreya Chaurasia:机构信息未在 arXiv HTML 中可靠披露
- Baddela Sai Yaswantha Reddy:机构信息未在 arXiv HTML 中可靠披露
- Deepak Parmar:机构信息未在 arXiv HTML 中可靠披露
- Shylaja S S:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
该系统通过交互界面接收用户上传的便携式文档格式(Portable Document Format,PDF)教材与自然语言提问,输出同步配音与动画的教育视频,难点在于跨页语义检索、多场景脚本一致性以及视觉与旁白的时间对齐。检索增强生成模块先清洗页眉与总结噪声并抽取插图引用,再经向量检索切块并生成含旁白与视觉描述的多场景脚本,脚本中的视觉提示与旁白文本分别进入后续生成环节。稳定扩散(Stable Diffusion)将视觉提示转为场景图像,动态视频生成器(DynamiCrafter)将其动画化为片段,谷歌文本转语音(Google Text-to-Speech,gTTS)与视频编辑工具(MoviePy)完成配音与音画合成。相对通用文生视频工作,该文的差异在于针对NCERT版式做了正则清洗与插图感知索引,而非提出新的生成模型。原文未提供可核对的关键定量结果。该结论仅适用于NCERT风格教材的演示性问答,未验证跨教材泛化、事实一致性与长时间复杂概念的稳定性。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。





































