The Null Token Knows: Reducing Message-Free Hallucination in ASR and NMT

📄 The Null Token Knows: Reducing Message-Free Hallucination in ASR and NMT 标签:#语音识别 #参数高效微调 #语音翻译 #鲁棒性 #模型评估 6.5/10 | 创新 1.4/2 | 严谨 1/1.5 | 实验 1.2/1.5 | 清晰 0.8/1 | 影响 0.9/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 0.9/1.5 ✅ 6.5/10 | 前50% | 文档类型:方法研究 | 评分置信度:中 | #语音识别 | #LoRA | #参数高效微调 #语音翻译 | arxiv 👥 作者与机构 第一作者:Kirill Borodin(论文未列出机构) 通讯作者:Kirill Borodin(论文未列出机构) 作者列表:Kirill Borodin、Vasiliy Kudryavtsev、Ivan Viakhirev、Grach Mkrtchian(均未说明机构) 💡 毒舌点评 本文把 reserved null token 从“解码细节”升级成诊断透镜,并把“幻觉抑制”和“删除真实语音”放进同一个 \(C_\kappa\) 代价曲线,这是审稿人希望看到的清醒做法。短板也很明显:locked 评估只覆盖 Whisper-small 的五个 checkpoint 条件,外部 VAD/state gate 没有在同一 locked set 上竞争;trained row 在 locked set 上从未成为任何展示 \(\kappa\) 下的最低点,低 \(\kappa\) 时只是 bias b=5 的点估计更优,\(\kappa\ge 2\) 时 stock 更优。因此最核心的“row 编辑是否真的优于简单 bias 或外部拒绝器”仍没有结论。标题里的 “knows” 也有些过强:论文实际显示状态和 margin 中有可分离信号,但 native EOT argmax 仍经常不弃权。 ...

2026-08-18 · 更新于 2026-09-04 · 6 min · 1073 words

语音/音乐/音频论文速递 2026-08-18

语音/音乐/音频论文速递 2026-08-18 共分析 39 篇论文 ⚡ 今日概览 📥 抓取 39 篇 → 🔬 深度分析完成 🏷️ 热门方向 方向 数量 分布 #语音合成 3篇 ███ #语音增强 3篇 ███ #语音识别 3篇 ███ #音频分类 3篇 ███ #音频理解 3篇 ███ #声源定位 2篇 ██ #语音编码 2篇 ██ #音视频理解 2篇 ██ 📊 论文评分排行榜(39 篇,按分数降序) 排名 论文 总分 分档 文档类型 主任务 🥇 INSPIRE: A Benchmark for Instruction-Aware Speech Retri 7.9分 前25% 数据集与基准 #音频检索 🥈 What Makes a Good Layer? Assessing the Layer-Wise Intri 7.7分 前25% 方法研究 #音乐理解 🥉 How Fragile Is Your Watermark? Training-Free Structural 7.6分 前25% 方法研究 #音频水印 4. Numerical and perceptual validity of synthetic Head-Rel 7.6分 前25% 应用研究 #声源定位 5. ACE-Cap: Active Evidence Acquisition via Agentic Co-Evo 7.5分 前25% 方法研究 #音频字幕生成 6. CineDub: Scaling End-to-End Video Dubbing to Multi-Spea 7.3分 前50% 方法研究 #音视频语音合成 7. Prototype-Rectified Iterative Self-supervised Manifold 7.2分 前50% 方法研究 #音频分类 8. CLARA: Clip-Level Multimodal Alignment with VLM-Derived 7.2分 前50% 方法研究 #音视频理解 9. Impulse Response Estimation via Laguerre-Fourier Expans 6.8分 前50% 方法研究 #音频理解 10. SingDance: Compositional Zero-Shot Singing-and-Dancing 6.8分 前50% 方法研究 #音视频生成 11. Listen, Reason, and Segment: Aligning LALMs with Editor 6.8分 前50% 方法研究 #音频理解 12. AnyTalk: Speech Animation for Arbitrary Characters Leve 6.7分 前50% 方法研究 #音视频语音合成 13. Evidence of Absence: Cross-Modal Abductive Risk Percept 6.6分 前50% 方法研究 #音频事件检测 14. ParaJSCC: A Parameterized Framework for Reusable Multim 6.6分 前50% 方法研究 #音频编码 15. ARENA: Automated Red-Teaming for Large Audio Language M 6.5分 前50% 方法研究 #音频理解 16. The Null Token Knows: Reducing Message-Free Hallucinati 6.5分 前50% 方法研究 #语音识别 17. Moving Horizon Estimation for Underwater Target Trackin 6.5分 前50% 方法研究 #声源定位 18. Multi-Granularity Sentiment Integration for LLM-Based M 6.5分 前50% 方法研究 #音视频理解 19. Adding Voice Cloning to Text-to-Audio-Video Models with 6.4分 前50% 方法研究 #语音克隆 20. Xemo-Talker: Unlock Emotions Explicitly for Audio-Drive 6.2分 前50% 方法研究 #音视频生成 21. Separate First, Then Associate: A Two-Stage Approach fo 6.2分 前50% 系统技术报告 #音视频语音分离 22. Geometry-adaptive Ambisonic encoding for sparse microph 6.2分 前50% 方法研究 #空间音频 23. A survey of AI-generated voices and their detection 6.1分 前50% 综述 #语音伪造检测 24. Iterative Self-Learning for Expressive Text-to-Speech S 6.1分 前50% 方法研究 #语音合成 25. Cached LLM Probability Retrieval for Speech Recognition 6.1分 前50% 方法研究 #语音识别 26. DuplexGen: Decoupling Content, Timing, and Acoustics fo 6.1分 前50% 方法研究 #语音合成 27. Speaker-Normalized Semantic Speech Tokens via Iterative 6.0分 前50% 方法研究 #语音编码 28. Multi-Modal Generative Fuzzy System: Fuzzy Inference Gu 5.9分 前50% 方法研究 #音视频问答 29. A Parameter-Free Few-Shot Evaluation for Elephant Vocal 5.9分 前50% 应用研究 #音频分类 30. Contrastive Learning with Variational Regularization fo 5.9分 前50% 方法研究 #语音合成 31. Sonifying I2S Transport Signals to Detect Transmission 5.9分 前50% 系统技术报告 #音频分类 32. An Analytical-Prior Framework for Data-Efficient Predic 5.8分 前50% 方法研究 #预训练 33. Navigating Speech Enhancement for Real-Time MRI: A Syst 5.7分 前50% 应用研究 #语音增强 34. Distinguishing AI-Generated Music from Edited Audio as 5.6分 前50% 方法研究 #音频伪造检测 35. A Novel Binaural Cue Preservation Loss for DNN-Based Bi 5.6分 前50% 方法研究 #语音增强 36. Unadapted Multilingual ASR on a Garrusi Kurdish Evaluat 5.6分 前50% 方法研究 #语音识别 37. Feedforward Active Speech Suppression Based on Time Ser 5.5分 前50% 方法研究 #语音增强 38. Using the Mimi codec for metalinguistic representations 4.7分 后50% 方法研究 #语音编码 39. AudioTQ: A Data-Oblivious 6-Bit CPU Audio Codec via Ran 3.5分 后50% 系统技术报告 #音频编码 📋 论文列表 🥇 INSPIRE: A Benchmark for Instruction-Aware Speech Retrieval 7.9/10 | 创新 1.2/2 | 严谨 1.2/1.5 | 实验 1/1.5 | 清晰 1/1 | 影响 0.9/1.5 | 开源 1.2/1.5 | 复现 0.3/0.5 | 工程 1.1/1.5 ...

2026-08-18 · 更新于 2026-09-04 · 40 min · 8515 words

Leading-Silence Augmentation and Multi-Stage Synthetic Supervision for the Second MLC-SLM Challenge

📄 Leading-Silence Augmentation and Multi-Stage Synthetic Supervision for the Second MLC-SLM Challenge 标签:#说话人日志 #参数高效微调 #语音识别 #音频理解 #多语言 6.5/10 | 创新 1.2/2 | 严谨 1.2/1.5 | 实验 0.9/1.5 | 清晰 0.9/1 | 影响 0.8/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 1.2/1.5 ✅ 6.5/10 | 前50% | 文档类型:系统技术报告 | 评分置信度:中 | #说话人日志 | #LoRA | #参数高效微调 #语音识别 | arxiv 👥 作者与机构 第一作者:Kexin Shi(Ant Group,依据邮箱与第一作者位置) 通讯作者:未说明 作者列表:Kexin Shi、Renhe Sun、Yuge Huang、Ximeng Wang、Jiayi Zhou、Jian Liu、Malu Zhang 机构说明:论文标注“1 Ant Group, 2 UESTC”,但未逐一匹配作者与单位;从邮箱可确认 Kexin Shi 与 Renhe Sun 属于 Ant Group。论文脚注标注“These authors contributed equally to this work”,但作者列表中未用具体符号标出共同一作对象。 💡 毒舌点评 这套系统报告胜在两条任务链路都闭环,消融数字清楚,尤其静音反事实过滤是聪明的数据清洗策略。但整体仍像挑战赛工程笔记:没有外部基线、没有跨语言/时长拆解,也不公开代码、权重或合成数据;作为系统报告,推理延迟、峰值显存、单条数据处理成本等工程指标同样缺失,使其参考价值更多停留在“战术说明”层面。 ...

2026-08-17 · 更新于 2026-09-04 · 4 min · 752 words

语音/音乐/音频论文速递 2026-08-17

语音/音乐/音频论文速递 2026-08-17 共分析 20 篇论文 ⚡ 今日概览 📥 抓取 20 篇 → 🔬 深度分析完成 🏷️ 热门方向 方向 数量 分布 #音乐理解 3篇 ███ #语音合成 2篇 ██ #语音识别 2篇 ██ #音视频生成 2篇 ██ #语音交互 1篇 █ #语音伪造检测 1篇 █ #说话人日志 1篇 █ #音乐源分离 1篇 █ 📊 论文评分排行榜(20 篇,按分数降序) 排名 论文 总分 分档 文档类型 主任务 🥇 VoiceChat-TTS: A Low-Latency Continuous Speech Synthesi 8.2分 前25% 模型报告 #语音合成 🥈 Omni-LiveAvatar: Minute-Level Real-Time Streaming Joint 7.7分 前25% 方法研究 #音视频生成 🥉 Trajectory Dynamics in Self-Supervised Learning Latent 7.6分 前25% 方法研究 #语音伪造检测 4. H2H Music Improv: A Communication Model and Audio-Visua 7.6分 前25% 数据集与基准 #音乐理解 5. Singer-Informed Vocal Source Separation for Multi-Singe 7.5分 前25% 方法研究 #音乐源分离 6. Why Performance Metrics Overpromise in Auditory Attenti 6.9分 前50% 方法研究 #语音交互 7. VoiceDesigner: Text-to-Voice Generation and Editing via 6.8分 前50% 系统技术报告 #语音合成 8. The MPB Corpus: A Dataset of Melody, Rhythm, Harmony, a 6.8分 前50% 数据集与基准 #音乐理解 9. Acoustic UAV Detection in Battlefield Scenarios: Handli 6.7分 前50% 方法研究 #音频事件检测 10. Avatar-Forever: Decoupled Parallel Training for High-Qu 6.6分 前50% 方法研究 #音视频生成 11. LoopVSR: A Loop Engineering Framework for Automated Rep 6.6分 前50% 方法研究 #音视频语音识别 12. Leading-Silence Augmentation and Multi-Stage Synthetic 6.5分 前50% 系统技术报告 #说话人日志 13. StreamHear: Domain-Adapted Pseudo-Labeling for Semi-Sup 6.4分 前50% 方法研究 #语音识别 14. Ambisonics Encoding of Room Impulse Responses using a D 6.3分 前50% 方法研究 #音频生成 15. AT-ADD: All-Type Audio Deepfake Detection Challenge Sum 6.3分 前50% 数据集与基准 #音频伪造检测 16. S2Dialog: Multimodal Dialogue Retrieval with Semantic a 6.0分 前50% 方法研究 #音频检索 17. Measuring Fairness in Large Audio Language Models via S 5.6分 前50% 方法研究 #语音识别 18. Exploring ESC Winners with Nested Diagrams 5.4分 后50% 系统技术报告 #音乐理解 19. Architecture and Affordances of PLAUD: Performative Lat 5.0分 后50% 系统技术报告 #音乐生成 20. Sensor-Driven Mission Synthesis for UAV/UGV Swarms: A T 4.4分 后50% 系统技术报告 #音视频理解 📋 论文列表 🥇 VoiceChat-TTS: A Low-Latency Continuous Speech Synthesis Model for Interactive Agents 8.2/10 | 创新 1.1/2 | 严谨 1.2/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 1/1.5 | 开源 1.5/1.5 | 复现 0.3/0.5 | 工程 1.3/1.5 ...

2026-08-17 · 更新于 2026-09-04 · 20 min · 4165 words

CASA: Content-Acoustic Speaking Assessment with Speech Encoder and Large Language Model

📄 CASA: Content-Acoustic Speaking Assessment with Speech Encoder and Large Language Model 标签:#语音质量评估 #多模态模型 #大语言模型 #参数高效微调 #教育 7.9/10 | 创新 1.3/2 | 严谨 1.2/1.5 | 实验 1.1/1.5 | 清晰 0.9/1 | 影响 0.9/1.5 | 开源 1/1.5 | 复现 0.3/0.5 | 工程 1.2/1.5 ✅ 7.9/10 | 前25% | 文档类型:方法研究 | 评分置信度:高 | #语音质量评估 | #多模态模型 | #大语言模型 #参数高效微调 | arxiv 👥 作者与机构 第一作者:Nhan Phan(Aalto University, Department of Information and Communications Engineering) 通讯作者:未说明 作者列表: Nhan Phan(Aalto University, Department of Information and Communications Engineering) Ilona Lähteenmäki(University of Helsinki, Department of Education) Anna von Zansen(University of Helsinki, Department of Education) Olli-Pekka Pauna(Aalto University, Department of Information and Communications Engineering) Yaroslav Getman(Aalto University, Department of Information and Communications Engineering) Tamás Grósz(Aalto University, Department of Information and Communications Engineering / Walton Institute, Programmable Autonomous Systems Division) Mikko Kurimo(Aalto University, Department of Information and Communications Engineering) 💡 毒舌点评 该工作的双分支设计把"声学传达"与"文本内容"干净地拆开,并用带容差的辅助损失和 LoRA 适配 Whisper 中间层,提供了比大多数 speech-LLM 系统更少参数的可解释方案,实验透明度较好。然而,其 SOTA 声明建立在 RMSE 相差 0.002 的边际优势上,作者自己都不承认有实质改进,且没有跨数据集验证,距离真正的可泛化口语评估系统还有相当距离。 ...

2026-08-14 · 更新于 2026-09-04 · 5 min · 885 words

语音/音乐/音频论文速递 2026-08-14

语音/音乐/音频论文速递 2026-08-14 共分析 12 篇论文 ⚡ 今日概览 ✅ 筛选入选 12 篇 → 🔬 深度分析完成 🏷️ 热门方向 方向 数量 分布 #语音识别 2篇 ██ #多模态模型 1篇 █ #语音伪造检测 1篇 █ #语音合成 1篇 █ #语音增强 1篇 █ #语音属性识别 1篇 █ #语音质量评估 1篇 █ #音乐生成 1篇 █ 📊 论文评分排行榜(12 篇,按分数降序) 排名 论文 总分 分档 文档类型 主任务 🥇 VoxAudio: Vocalized Audio Synthesis via Multi-Reward… 8.2分 前25% 方法研究 #音频生成 🥈 CASA: Content-Acoustic Speaking Assessment with Speech… 7.9分 前25% 方法研究 #语音质量评估 🥉 Comparative Analysis of Multilingual Pre-trained… 7.6分 前25% 数据集与基准 #语音识别 4. OmniScientist: An Omni-Modal Omni-Discipline AI… 7.6分 前25% 系统技术报告 #多模态模型 5. Alignment Drift in Single-Model Speculative Decoding… 7.3分 前50% 方法研究 #语音识别 6. EgoCITE: Context-Augmented Indexing and Time-Aware… 7.2分 前50% 系统技术报告 #音视频问答 7. CardioState-JEPA: Delay-Aware Cross-Modal Learning of… 7.2分 前50% 方法研究 #音频分类 8. FastThaiG2P: Lightning-fast Thai Grapheme-to-phoneme… 7.0分 前50% 系统技术报告 #语音合成 9. Motor, Cognitive, or Corpus? What Survives Cross… 6.1分 前50% 应用研究 #语音属性识别 10. Evaluating Pre-trained Speech Encoders for Spontaneous… 6.0分 前50% 方法研究 #语音伪造检测 11. HybridSB-MoE: Dual-Domain Schrödinger Bridges with… 5.9分 前50% 方法研究 #语音增强 12. Drive-to-Music: Context-Aware Generative Audio for In… 5.2分 后50% 系统技术报告 #音乐生成 📋 论文列表 🥇 VoxAudio: Vocalized Audio Synthesis via Multi-Reward Autoregressive Flow Matching 8.2/10 | 创新 1.5/2 | 严谨 1.2/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 1.1/1.5 | 开源 1/1.5 | 复现 0.4/0.5 | 工程 1.2/1.5 ...

2026-08-14 · 更新于 2026-09-04 · 12 min · 2527 words

Qwen-MusicAVQA-7B: A Multimodal Model for Music Audio-Visual QA

📄 Qwen-MusicAVQA-7B: A Multimodal Model for Music Audio-Visual QA 标签:#音视频问答 #多模态模型 #音频大模型 #参数高效微调 #鲁棒性 6.6/10 | 创新 1.2/2 | 严谨 1.1/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 0.9/1.5 | 开源 0/1.5 | 复现 0.5/0.5 | 工程 1.1/1.5 ✅ 6.6/10 | 前50% | 文档类型:方法研究 | 评分置信度:高 | #音视频问答 | #多模态模型 | #音频大模型 #参数高效微调 | arxiv 👥 作者与机构 第一作者:Maryam Dehdashti(Inference Matter Labs) 通讯作者:Maryam Dehdashti(Inference Matter Labs;dehdashti@inferencematter.ai) 作者列表:Maryam Dehdashti(Inference Matter Labs) 💡 毒舌点评 这篇论文最有价值的不是又一个 Qwen 变体,而是用受控消融把“音频表示是否保留局部时间细节”与 AVQA 精度强关联起来,并且单卡约 5 小时的可复现成本很吸引人。短板也同样突出:所有结论锁死在 MUSIC-AVQA 的非标准可用视频子集上,Whisper vs PANNs 的 26 点差距被架构、预训练和池化差异共同污染,作者自己也承认这不是干净的因果实验;此外,AVQA 微调会牺牲 ASR 能力,说明得到的“多模态能力”在任务迁移和通用性上仍有明显边界。因此这篇工作更像一次有洞察的系统层观察和务实的模块化适配,而非方法学突破。 ...

2026-08-13 · 更新于 2026-09-04 · 5 min · 1043 words

Robust Multi-Tier Infant-Centered Audio Understanding with Whisper via Structured Speaker Conditioning

📄 Robust Multi-Tier Infant-Centered Audio Understanding with Whisper via Structured Speaker Conditioning 标签:#音频事件检测 #参数高效微调 #说话人日志 #自监督学习 #Transformer 6.0/10 | 创新 1.2/2 | 严谨 1/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 0.6/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 1.1/1.5 ✅ 6.0/10 | 前50% | 文档类型:方法研究 | 评分置信度:中 | #音频事件检测 | #LoRA | #参数高效微调 #说话人日志 | arxiv 👥 作者与机构 Xulin Fan:University of Illinois Urbana-Champaign, USA Jialu Li:University of Arizona, USA Mohammad Nur Hossain Khan:Worcester Polytechnic Institute, USA Kexin Hu:University of Illinois Urbana-Champaign, USA Bashima Islam:Worcester Polytechnic Institute, USA Mark Hasegawa-Johnson:University of Illinois Urbana-Champaign, USA Nancy L. McElwain:University of Illinois Urbana-Champaign, USA 通讯作者:论文未明确标注通讯作者;作者邮箱在论文中列出,但未说明通讯作者身份。 ...

2026-08-13 · 更新于 2026-09-04 · 4 min · 766 words

UniSwap: Streaming Audio-Visual Identity Swapping for Talking Videos

📄 UniSwap: Streaming Audio-Visual Identity Swapping for Talking Videos 标签:#音视频生成 #扩散模型 #知识蒸馏 #参数高效微调 7.8/10 | 创新 1.3/2 | 严谨 1/1.5 | 实验 1.1/1.5 | 清晰 0.8/1 | 影响 1/1.5 | 开源 1/1.5 | 复现 0.3/0.5 | 工程 1.3/1.5 ✅ 7.8/10 | 前25% | 文档类型:方法研究 | 评分置信度:中 | #音视频生成 | #扩散模型 | #知识蒸馏 #参数高效微调 | arxiv 👥 作者与机构 第一作者:Yuxuan Zhang(The Chinese University of Hong Kong;Qwen Applications Business Group of Alibaba) 通讯作者:Liwei Wang(The Chinese University of Hong Kong) 作者列表:Yuxuan Zhang(The Chinese University of Hong Kong;Qwen Applications Business Group of Alibaba)、Haozhong Xiong(Qwen Applications Business Group of Alibaba)、Jiayi Song(Qwen Applications Business Group of Alibaba)、Jinpeng Yu(Qwen Applications Business Group of Alibaba)、Yang Shi(Qwen Applications Business Group of Alibaba)、Jiaming Liu(Qwen Applications Business Group of Alibaba)、Ruihua Huang(Qwen Applications Business Group of Alibaba)、Liwei Wang(The Chinese University of Hong Kong) 💡 毒舌点评 这项工作把换脸、语音转换、流式扩散蒸馏和 RoPE 缓存管理拼成了一个工程上相当完整的统一框架,长视频一致性消融也做得比多数 demo 论文扎实。但核心贡献更接近系统集成而非方法突破,且 Stage 3 蒸馏后在音画同步、视频美学和图像质量上反而低于 Stage 1/Stage 2;作者更多强调身份与语音质量改善,对蒸馏带来的同步和视觉质量回退解释不足。代码仓库仅通过项目主页提供,权重、训练数据和数据合成管线未公开,让“首个联合替换框架”的复现与检验仍受限。 ...

2026-08-13 · 更新于 2026-09-04 · 4 min · 831 words

语音/音乐/音频论文速递 2026-08-13

语音/音乐/音频论文速递 2026-08-13 共分析 18 篇论文 ⚡ 今日概览 📥 抓取 18 篇 → 🔬 深度分析完成 🏷️ 热门方向 方向 数量 分布 #语音合成 4篇 ████ #语音识别 4篇 ████ #语音增强 3篇 ███ #音视频生成 2篇 ██ #音乐生成 1篇 █ #音视频问答 1篇 █ #音频事件检测 1篇 █ #音频生成 1篇 █ 📊 论文评分排行榜(18 篇,按分数降序) 排名 论文 总分 分档 文档类型 主任务 🥇 MiDashengLM-Gen: Unified Audio Scene Generation via LLM 8.0分 前25% 方法研究 #音频生成 🥈 UniSwap: Streaming Audio-Visual Identity Swapping for T 7.8分 前25% 方法研究 #音视频生成 🥉 Confucius4-TTS: Transcript-Free Cross-Lingual Zero-Shot 7.7分 前25% 系统技术报告 #语音合成 4. The SLT 2026 SmartGlasses Challenge: Benchmarking Egoce 7.5分 前25% 数据集与基准 #语音识别 5. Dialogue-Aware Video-to-Music Generation Using Public D 7.1分 前50% 数据集与基准 #音视频生成 6. Rethinking Language Model-Based Generative Speech Enhan 7.1分 前50% 方法研究 #语音增强 7. Easper: An Accessible ASR Pipeline for Language Documen 7.0分 前50% 系统技术报告 #语音识别 8. On-Policy Self-Distillation for Multi-Dialect ASR: Mast 7.0分 前50% 方法研究 #语音识别 9. Luna-TTS Family Technical Report 6.9分 前50% 系统技术报告 #语音合成 10. Do Text-to-Music Models Really Follow Instructions? A C 6.8分 前50% 数据集与基准 #音乐生成 11. Qwen-MusicAVQA-7B: A Multimodal Model for Music Audio-V 6.6分 前50% 方法研究 #音视频问答 12. DonorRank: Donor Language Selection for Low-Resource Cr 6.6分 前50% 方法研究 #语音识别 13. RT-SEMamba: Real-Time Speech Enhancement Mamba via Prog 6.6分 前50% 方法研究 #语音增强 14. Phoenix TTS: High-Fidelity Synthesis and Voice Conversi 6.5分 前50% 系统技术报告 #语音合成 15. MuseCritic: Learning Multi-Aspect Song Rewards through 6.5分 前50% 方法研究 #音频质量评估 16. Robust Multi-Tier Infant-Centered Audio Understanding w 6.0分 前50% 方法研究 #音频事件检测 17. CookVoice: Unified Framework for Style Controllable Mul 6.0分 前50% 模型报告 #语音合成 18. Deep Learning Based Relative Transfer Matrix Estimation 5.1分 后50% 方法研究 #语音增强 📋 论文列表 🥇 MiDashengLM-Gen: Unified Audio Scene Generation via LLM-Driven Autoregressive Flow Matching 8.0/10 | 创新 1.3/2 | 严谨 1.2/1.5 | 实验 1.2/1.5 | 清晰 0.8/1 | 影响 1/1.5 | 开源 1.2/1.5 | 复现 0.3/0.5 | 工程 1/1.5 ...

2026-08-13 · 更新于 2026-09-04 · 20 min · 4212 words