TurboBias 2.0: Streaming Context-Biasing for Production-Efficient ASR Systems

📄 TurboBias 2.0: Streaming Context-Biasing for Production-Efficient ASR Systems 标签:#语音识别 #模型融合 #流式处理 #实时处理 #高效推理 9.0/10 | 创新 1.6/2 | 严谨 1.3/1.5 | 实验 1.4/1.5 | 清晰 0.8/1 | 影响 1.2/1.5 | 开源 1.2/1.5 | 复现 0.4/0.5 | 工程 1.1/1.5 🔥 9.0/10 | 前10% | 文档类型:系统技术报告 | 评分置信度:中 | #语音识别 | #模型融合 | #流式处理 #实时处理 | arxiv 👥 作者与机构 第一作者:Vladimir Bataev(NVIDIA, Yerevan, Armenia) 通讯作者:Vladimir Bataev 作者列表:Vladimir Bataev、Lilit Grigoryan、Andrei Andrusenko、Nikolay Karpov、Vitaly Lavrukhin、Boris Ginsburg(机构:NVIDIA, Yerevan, Armenia;NVIDIA, Santa Clara, USA) ...

2026-08-25 · 更新于 2026-09-04 · 4 min · 711 words

μNet: Ultra-Low-Memory and Low-Complexity Speech Enhancement for Embedded Digital Signal Processors

📄 μNet: Ultra-Low-Memory and Low-Complexity Speech Enhancement for Embedded Digital Signal Processors 标签:#语音增强 #RNN #CNN #模型压缩 #实时处理 8.3/10 | 创新 1.7/2 | 严谨 1.3/1.5 | 实验 1.4/1.5 | 清晰 0.8/1 | 影响 1.3/1.5 | 开源 0.2/1.5 | 复现 0.4/0.5 | 工程 1.2/1.5 🔥 8.3/10 | 前25% | 文档类型:方法研究 | 评分置信度:中 | #语音增强 | #RNN | #CNN #模型压缩 | arxiv 👥 作者与机构 第一作者:Shrishti Saha Shetu(International Audio Laboratories, Erlangen, Germany) 通讯作者:正文未明确标注 作者列表:Shrishti Saha Shetu、Jose Miguel Martinez Aponte、Nagashree K. S. Rao、Sharvin Vittappan、Oliver Thiergart、Emanuël A. P. Habets(机构:International Audio Laboratories, Erlangen, Germany;Fraunhofer IIS, Erlangen, Germany) ...

2026-08-25 · 更新于 2026-09-04 · 4 min · 826 words

A Resource-Efficient CNN-Based EEG Auditory Attention Decoding ASIC

📄 A Resource-Efficient CNN-Based EEG Auditory Attention Decoding ASIC 标签:#助听器 #CNN #实时处理 #高效推理 6.2/10 | 创新 1/2 | 严谨 1.2/1.5 | 实验 0.9/1.5 | 清晰 0.8/1 | 影响 0.9/1.5 | 开源 0/1.5 | 复现 0.1/0.5 | 工程 1.3/1.5 ✅ 6.2/10 | 前50% | 文档类型:系统技术报告 | 评分置信度:中 | #助听器 | #CNN | #实时处理 #高效推理 | arxiv 👥 作者与机构 Qier Ma、Richard George、Stefan Scholze、Christian Mayr 来自德累斯顿工业大学(Technische Universität Dresden)电气工程与信息技术系高并行 VLSI 系统与神经微电子讲席;Jehn Constantin 与 Tobias Reichenbach 来自埃尔朗根-纽伦堡弗里德里希·亚历山大大学(FAU)生物医学工程人工智能系。项目获德国联邦研究、技术与航天部 Cluster4Future SEMECO 项目(03ZU1210FA)资助,论文带有 IEEE 版权声明。 ...

2026-08-21 · 更新于 2026-09-04 · 2 min · 414 words

Dancing Through Soundscapes: Designing a Low-Cost, Sound-Based Device for Sensing and Interpreting Movement and Dance

📄 Dancing Through Soundscapes: Designing a Low-Cost, Sound-Based Device for Sensing and Interpreting Movement and Dance 标签:#音频交互 #音频生成 #空间音频 #实时处理 5.2/10 | 创新 0.9/2 | 严谨 0.9/1.5 | 实验 0.8/1.5 | 清晰 0.7/1 | 影响 0.7/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 0.9/1.5 ✅ 5.2/10 | 后50% | 文档类型:应用研究 | 评分置信度:中 | #音频交互 | #音频生成 | #空间音频 #实时处理 | arxiv 👥 作者与机构 Swen E. Gaudl 来自瑞典哥德堡大学并兼任英国 Seam CoLab 有限公司研究员,Silvia Carderelli-Gronau 来自巴斯斯巴大学并兼任同一公司职务。研究历经四年的通过设计做研究与共同创作迭代,面向舞者与混合能力用户群体。 ...

2026-08-21 · 更新于 2026-09-04 · 2 min · 254 words

Closing the Affective Loop: Multimodal Speaker-Listener Emotion-Dynamics-Aware Empathetic Social Robots

📄 Closing the Affective Loop: Multimodal Speaker-Listener Emotion-Dynamics-Aware Empathetic Social Robots 标签:#语音交互 #多模态模型 #语音情感识别 #实时处理 6.5/10 | 创新 1.4/2 | 严谨 1/1.5 | 实验 0.8/1.5 | 清晰 0.9/1 | 影响 1.1/1.5 | 开源 0/1.5 | 复现 0.2/0.5 | 工程 1.1/1.5 ✅ 6.5/10 | 前50% | 文档类型:应用研究 | 评分置信度:高 | #语音交互 | #多模态模型 | #语音情感识别 #实时处理 | arxiv 👥 作者与机构 作者团队来自人机交互与社会机器人方向,系统部署于 Misty II 社交机器人平台,对话框架基于 Retico 增量处理实现。论文定位为具身情感对话系统的试点研究(pilot study),实验部分为五名参与者的被试内比较。 💡 毒舌点评 让机器人维护自己的「听者情绪状态」,而不是把用户情绪塞进一次性提示词——这个概念创新是真实的:它承认对话是双向的情感动力系统,机器人的上一轮表达会改变它下一轮该说什么。同理回应从 4.80 升到 5.35、「鼓励我」条目从 5.40 跳到 6.20 的数字也确实诱人。但必须泼三盆冷水。其一,五名参与者的 pilot 在统计上只能算可行性信号,任何效应都可能被个体差异淹没。其二,情绪识别与听者状态估计的误差没有单独消融——总体提升可能来自系统任何一处改动而非情感循环机制本身。其三,Misty II 的动作表达幅度、TTS 延迟与摄像头光照环境都构成外部效度的硬约束。把它当方向验证可以,当疗效证据不行。 ...

2026-08-19 · 更新于 2026-09-04 · 2 min · 251 words

DynaForcing: Overcoming Dynamic Collapse in Self-Forcing Distillation for Streaming Avatar Generation

📄 DynaForcing: Overcoming Dynamic Collapse in Self-Forcing Distillation for Streaming Avatar Generation 标签:#音视频生成 #生成模型 #扩散模型 #强化学习 #实时处理 8.0/10 | 创新 1.7/2 | 严谨 1.3/1.5 | 实验 1.3/1.5 | 清晰 0.9/1 | 影响 1.3/1.5 | 开源 0/1.5 | 复现 0.2/0.5 | 工程 1.3/1.5 🔥 8.0/10 | 前25% | 文档类型:方法研究 | 评分置信度:高 | #音视频生成 | #扩散模型 | #生成模型 #强化学习 | arxiv 👥 作者与机构 第一作者:Yubo Huang(中国科学技术大学);通讯作者:Enhong Chen。 合作者来自中国科学技术大学、南京大学、合肥工业大学和清华大学。 💡 毒舌点评 DynaForcing 把“看起来清晰”与“真的在动”这两个目标拆开,是 talking avatar 领域很实用的诊断。它的三件套并不神秘:给 rollout 一个真实动态锚点、给损失补 motion reward、给参考图加扰动;真正的贡献在于把这三层作用和 collapse 的反馈回路对上。遗憾是训练仍依赖 14B WanS2V 和八张 H100,普通团队复现门槛不低。补充两点边界:评测全部集中在 talking-head avatar 上,其他视频生成任务是否同样受益未知;结果绑定 WanS2V 14B 与特定训练配方,动态奖励权重和 p_data 对说话人风格的敏感性消融也不成体系。加上未公开代码模型,复现门槛实际相当高。 ...

2026-08-19 · 更新于 2026-09-04 · 3 min · 505 words

PolyDebate: A Game-Orchestrated Multimodal System for Debate Skills Practice and Evaluation

📄 PolyDebate: A Game-Orchestrated Multimodal System for Debate Skills Practice and Evaluation 标签:#语音交互 #大语言模型 #教育 #实时处理 6.8/10 | 创新 1.3/2 | 严谨 1/1.5 | 实验 1/1.5 | 清晰 0.9/1 | 影响 1.1/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 1.2/1.5 ✅ 6.8/10 | 前50% | 文档类型:应用研究 | 评分置信度:中 | #语音交互 | #大语言模型 | #教育 #实时处理 | arxiv 👥 作者与机构 第一作者 Jianing Yin,合作者包括 Weng Pan Kuan、Xiaoyun Liu、Zhiyuan Wen、Yuxuan Li、Milos Stojmenovic 与 Jiannong Cao,来自香港理工大学及 Singidunum University。系统提供 Unity 3D 游戏与网页两种部署形态,并附演示视频。 ...

2026-08-19 · 更新于 2026-09-04 · 2 min · 326 words

语音/音乐/音频论文速递 2026-08-19

语音/音乐/音频论文速递 2026-08-19 共分析 16 篇论文 ⚡ 今日概览 📥 抓取 16 篇 → 🔬 深度分析完成 🏷️ 热门方向 方向 数量 分布 #语音交互 3篇 ███ #音乐理解 2篇 ██ #语音伪造检测 1篇 █ #语音合成 1篇 █ #语音唤醒 1篇 █ #语音情感识别 1篇 █ #说话人验证 1篇 █ #音乐生成 1篇 █ 📊 论文评分排行榜(16 篇,按分数降序) 排名 论文 总分 分档 文档类型 主任务 🥇 FireRedTTS3: Unified Speech Generation and Editing with 9.0分 前10% 方法研究 #语音合成 🥈 SpeechSense: A Paralinguistic-Focused Dataset for Fine- 8.5分 前25% 数据集与基准 #语音情感识别 🥉 DynaForcing: Overcoming Dynamic Collapse in Self-Forcin 8.0分 前25% 方法研究 #音视频生成 4. Automatic Transcription of Microtonal Free-Rhythm Vocal 7.5分 前25% 应用研究 #音乐转录 5. Emotion Across Speech and Faces: Shared Affective Mecha 7.4分 前50% 方法研究 #音视频理解 6. UniVerse: Benchmarking and Enhancing LALMs on Culturall 7.1分 前50% 数据集与基准 #音乐理解 7. A Multiplication-Free Feature Extractor for Signal Clas 6.9分 前50% 方法研究 #语音唤醒 8. PolyDebate: A Game-Orchestrated Multimodal System for D 6.8分 前50% 应用研究 #语音交互 9. Uncertainty-Aware Decision Making in Multimodal Large L 6.8分 前50% 综述 #音频理解 10. Why GPT-Style Models Do Not Directly Transfer to Symbol 6.7分 前50% 理论研究 #音乐生成 11. The Last Mile of Deepfake Speech Detection: An Industry 6.6分 前50% 系统技术报告 #语音伪造检测 12. Closing the Affective Loop: Multimodal Speaker-Listener 6.5分 前50% 应用研究 #语音交互 13. DNN-Based Frequency-Dependent Estimation of Speech, Mus 6.5分 前50% 方法研究 #音频分离 14. Multi-turn Conversational AI from Text to Multimodal In 6.5分 前50% 综述 #语音交互 15. On computational approaches to Pop music culture 6.1分 前50% 综述 #音乐理解 16. Target Speaker Identification: A Low-Latency Streaming 5.6分 前50% 系统技术报告 #说话人验证 📋 论文列表 🥇 FireRedTTS3: Unified Speech Generation and Editing with Semantically Enriched Speech Representations 9.0/10 | 创新 1.6/2 | 严谨 1.2/1.5 | 实验 1.3/1.5 | 清晰 0.9/1 | 影响 1.3/1.5 | 开源 1.2/1.5 | 复现 0.4/0.5 | 工程 1.1/1.5 ...

2026-08-19 · 更新于 2026-09-04 · 18 min · 3634 words

AnyTalk: Speech Animation for Arbitrary Characters Leveraging a Video Generation Model

📄 AnyTalk: Speech Animation for Arbitrary Characters Leveraging a Video Generation Model 标签:#音视频语音合成 #扩散模型 #知识蒸馏 #实时处理 #零样本 6.7/10 | 创新 1.5/2 | 严谨 1/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 1/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 1.1/1.5 ✅ 6.7/10 | 前50% | 文档类型:方法研究 | 评分置信度:中 | #音视频语音合成 | #扩散模型 | #知识蒸馏 #实时处理 | arxiv 👥 作者与机构 第一作者:Kwan Yun(韩国科学技术院文化技术研究生院博士生,共同第一作者) 共同第一作者:Serin Yoon(多伦多大学 DGP 实验室访问研究员,原韩国科学技术院文化技术研究生院硕士,论文标记为共同第一作者) 通讯作者:未说明 作者列表:Kwan Yun(韩国科学技术院文化技术研究生院)、Serin Yoon(多伦多大学 DGP 实验室访问研究员,论文标记共同第一作者)、Sunjin Jung(诚信女子大学计算机工程系助理教授)、Jung Eun Yoo(研发工程师,韩国科学技术院文化技术研究生院 2025 年博士毕业,具体公司未说明)、Inyup Lee(韩国科学技术院文化技术研究生院博士生)、Junyong Noh(韩国科学技术院文化技术研究生院教授) 💡 毒舌点评 这篇文章的切入点聪明:把 2D talking-head 视频扩散模型的运动先验“白嫖”到 3D blendshape 上,并用零音频嵌入做静帧微调,确实绕开了对 3D 动画数据的需求。但评测仍偏软:SyncNet 和用户研究不足以证明几何级口型正确性,蒸馏后的 AnyTalk_RT 在 LSE-D 上从 11.74 退化到 12.19、LSE-C 从 3.24 掉到 2.96,实时版的唇同步损失没有给出令人信服的补偿方案。此外,论文声称代码公开,但正文未给出可验证的仓库链接、模型权重或数据下载,开源可获取性存疑。 ...

2026-08-18 · 更新于 2026-09-04 · 5 min · 868 words

AudioTQ: A Data-Oblivious 6-Bit CPU Audio Codec via Randomized Hadamard Rotation and Lloyd-Max Quantization

📄 AudioTQ: A Data-Oblivious 6-Bit CPU Audio Codec via Randomized Hadamard Rotation and Lloyd-Max Quantization 标签:#音频编码 #模型压缩 #理论分析 #实时处理 3.5/10 | 创新 1/2 | 严谨 0.6/1.5 | 实验 0.3/1.5 | 清晰 0.7/1 | 影响 0.3/1.5 | 开源 0/1.5 | 复现 0.1/0.5 | 工程 0.5/1.5 📝 3.5/10 | 后50% | 文档类型:系统技术报告 | 评分置信度:高 | #音频编码 | #模型压缩 | #理论分析 #实时处理 | arxiv 👥 作者与机构 第一作者:Sahil Gangurde(未说明具体机构;论文给出个人网站 https://lostmartian.in 及邮箱 sahilgangurde08@gmail.com) 通讯作者:未说明 作者列表:Sahil Gangurde(独立作者,未挂靠任何学术或工业机构) 💡 毒舌点评 这篇论文的野心是"把 LLM 权重量化的随机 Hadamard 旋转搬到音频 codec 上",选题本身有一定跨域趣味,失败模式分析(Hadamard 基对齐导致 SQNR 塌缩到 1.31 dB)也确实暴露了作者对方法边界的思考。但这些亮点掩盖不了评估的严重不足:全文只测了两个音频 track、零个真实 codec 基线、零主观听感数据,却敢在标题里写 “6-Bit CPU Audio Codec”。更糟的是,“QJL / Joint Least-Squares” 的名字听上去像在求解最小二乘问题,实际上只是残差符号加回块级 MAE,名副其实的"名字通胀"。压缩率的计算基准是 float32 原始块而非实际 PCM 存储,等于用 4 字节/样本做分母来放大压缩收益。全文没有一行可复现代码或可获取测试音频,这在 2026 年的顶会投稿中基本等于自我放弃。 ...

2026-08-18 · 更新于 2026-09-04 · 5 min · 1061 words