Anchoring Speech with Semantics: A Multimodal Adapter Mechanism for Automatic Speech Recognition in Low-Resource Languages

📄 当解码器缺的不是声音,而是下一词的语义证据 英文题目:Anchoring Speech with Semantics: A Multimodal Adapter Mechanism for Automatic Speech Recognition in Low-Resource Languages 一句话:针对转录稀缺导致解码器目标端先验不足的问题,SAMA-ASR 在冻结 Whisper 上插入语义-声学双锚点门控适配器,在 30 小时闽南语与客家语上以自动生成的普通话翻译锚点实现约 30% 与 19% 的相对 CER 下降,代价是依赖配对翻译与额外的 ST 推理开销。 标签:#语音识别 #Adapter #语音翻译 #低资源 #多语言 评分:8.4/10 | 创新 1.4/2 | 技术严谨 1.2/1.5 | 实验充分 1.3/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 1/1.5 | 可复现 0.5/0.5 | 工程/实践 1.2/1.5 👥 作者与机构 Kuan-Tang Huang:National Taiwan Normal University, Taiwan;EZAI, Taiwan Cheng-Yeh Yang:National Taiwan Normal University, Taiwan Chien-Chun Wang:National Taiwan Normal University, Taiwan Hung-Shin Lee:National Taiwan Normal University, Taiwan Hsin-Min Wang:Academia Sinica, Taiwan Berlin Chen:National Taiwan Normal University, Taiwan 💬 毒舌点评 亮点在于把低资源自动语音识别(Automatic Speech Recognition,ASR)重新定义为目标端生成证据不足问题,并用冻结骨干加语义-声学双锚点门控适配器的极简设计同时解决语义引导与声学落地,消融与冷启动分析相当扎实。短板是验证仅限两套汉语方言且依赖配对普通话翻译,极低资源与弱翻译器下的失效边界已被作者自行暴露,跨语系泛化与真实无配对场景的可用性仍存疑。 ...

2026-09-01 · 更新于 2026-09-04 · 8 min · 1582 words

语音/音乐/音频论文速递 2026-09-01

语音/音乐/音频论文速递 2026-09-01 共分析 49 篇论文 ⚡ 今日概览 ✅ 筛选入选 49 篇 → 🔬 深度分析完成 🏷️ 热门方向 方向 数量 分布 #语音识别 8 篇 ████████ #语音情感识别 5 篇 █████ #音乐生成 5 篇 █████ #语音合成 4 篇 ████ #语音增强 4 篇 ████ #音乐理解 4 篇 ████ #说话人日志 2 篇 ██ #音乐转录 2 篇 ██ 📊 论文评分排行榜(49 篇,按分数降序) 排名 论文 总分 分档 文档类型 主任务 🥇 Anchoring Speech with Semantics: A Multimodal Adapter… 8.4 前25% 方法研究 #语音识别 🥈 Playability-Aware Audio-to-Tablature Guitar… 8.2 前25% 方法研究 #音乐转录 🥉 When Vocal Tone and Literal Meaning Diverge: An… 8.1 前25% 数据集与基准 #语音情感识别 4. Self-Supervised Pretext Tasks for Infant Cry Analysis… 8.1 前25% 方法研究 #音频分类 5. ImageEval 2026: Culturally Grounded Arabic Multimodal… 8.1 前25% 数据集与基准 #语音识别 6. Perceptually Better, Semantically Worse: Measuring… 8.0 前25% 数据集与基准 #语音增强 7. Vocal Music under Phoneme-Conditional Analysis 8.0 前25% 方法研究 #音乐理解 8. Likelihood-Constrained Acoustic Reranking for Training… 7.8 前25% 方法研究 #语音识别 9. Using Prosody to Predict Syntactic Structure 7.6 前25% 方法研究 #Transformer 10. When Does Predictor-Based RL Align with Human… 7.6 前25% 方法研究 #语音合成 11. V2TATC: A Joint Voice-Trajectory Embedding Framework… 7.5 前25% 方法研究 #对比学习 12. Sequential Trajectories and Simultaneous Blending… 7.5 前25% 方法研究 #语音合成 13. No Detectable Change in Side-Level WER from Prompt… 7.4 前50% 应用研究 #语音识别 14. VocalAffectBench: Evaluating Vocal Emotion Recognition… 7.4 前50% 数据集与基准 #语音情感识别 15. When Models Hear What They Expect: Diagnosing Prosodic… 7.4 前50% 方法研究 #语音情感识别 16. Context-Aware Interleaved Batching for WhisperX 7.4 前50% 方法研究 #语音识别 17. Enabling Proactive Spoken Turns via a Generalized… 7.3 前50% 方法研究 #语音交互 18. MusGU+: Toward a Musician-Centered Evaluation… 7.3 前50% 数据集与基准 #音乐生成 19. Stride-k Subsampling: Train-Free Audio Token Reduction… 7.2 前50% 方法研究 #语音识别 20. TEMPO: Temporally-grounded Multi-task Post-training… 7.1 前50% 方法研究 #音频事件检测 21. VIBE: Video Instruction-aligned Background music… 7.1 前50% 方法研究 #音乐生成 22. Diagnose, Then Refine: A Closed-Loop TTS System with… 7.0 前50% 方法研究 #语音合成 23. HEAR Who Said What: Unlocking Speaker-Attributed… 7.0 前50% 数据集与基准 #说话人日志 24. Evidence-Bounded Mental Health Reasoning from… 7.0 前50% 数据集与基准 #语音情感识别 25. SPHERE: Automatic Music Upmixing via Audio Language… 6.9 前50% 方法研究 #音乐生成 26. Linguistic Distance Segregates Latent Representations… 6.9 前50% 应用研究 #语音识别 27. Closing the Verification Loop: Self-Check Captioning… 6.8 前50% 方法研究 #音频字幕生成 28. Conjoint Audio-to-Spikes Encoding and Processing for… 6.8 前50% 方法研究 #语音识别 29. Neural Multichannel Distant Speaker Diarization and… 6.6 前50% 方法研究 #说话人日志 30. PhysWave: Physics-Guided Latent Diffusion Models for… 6.6 前50% 方法研究 #音频生成 31. What Are You Listening to? Temporal Music Grounding… 6.5 前50% 数据集与基准 #音乐理解 32. CoJEPA: Combining Contrastive Learning and JEPA for… 6.5 前50% 方法研究 #音乐理解 33. Ouroboros: Self-Referential Backdoor Attacks on Speech… 6.4 前50% 方法研究 #语音增强 34. Textual Acoustic Grounding for Generalizable LLM-Based… 6.4 前50% 方法研究 #语音伪造检测 35. Towards Balanced Spectral Reconstruction: Spectrally… 6.4 前50% 方法研究 #语音增强 36. Accurate Plate Reverb Parameter Estimation Using Two… 6.3 前50% 方法研究 #音乐理解 37. Beyond Speech: Dual-Domain SSL Fusion for Unified All… 6.3 前50% 系统技术报告 #音频伪造检测 38. Weakly Supervised Tabla Stroke Transcription via an… 6.3 前50% 方法研究 #音乐转录 39. Language-Statistical Analysis of Neural Audio Codec… 6.3 前50% 方法研究 #语音编码 40. Parallel Time-Band Mixing with Learned Observation… 6.2 前50% 方法研究 #语音增强 41. How Well Do Generative Music Models Follow Emotion… 6.0 前50% 数据集与基准 #音乐生成 42. Multimodal Adaptive Expert Selection with Text Routing… 6.0 前50% 方法研究 #音视频理解 43. Evoking Harmony via Convolution 5.9 前50% 方法研究 #音乐生成 44. DreamX-Creator: Democratizing Native Audio-Video… 5.9 前50% 模型报告 #扩散模型 45. Leveraging Bayesian Optimization for Array Shape Self… 5.7 前50% 方法研究 #声源定位 46. Opinionated, Hesitant and Stressed: Three Studies of… 5.6 前50% 应用研究 #语音情感识别 47. Disentangling Representation using Attributes-based… 5.5 前50% 方法研究 #音频分类 48. Decoupled Latent Flow Matching for Few-Step Joint… 5.3 后 50% 方法研究 #音乐源分离 49. Audio-Driven Adversarial Defense for 3D Talking Face… 4.3 后 50% 方法研究 #语音合成 📋 论文列表 🥇 当解码器缺的不是声音,而是下一词的语义证据 英文题目:Anchoring Speech with Semantics: A Multimodal Adapter Mechanism for Automatic Speech Recognition in Low-Resource Languages ...

2026-09-01 · 更新于 2026-09-04 · 55 min · 11646 words

Dissonance Spectrum explicitly models perceptual frequency interactions for better music understanding

📄 让每个频率格为自己的关系负责:DS 接入音乐模型 英文题目:Dissonance Spectrum explicitly models perceptual frequency interactions for better music understanding 一句话:DS 以有理比关系核把 CQT 中同时出现的频率关系归回各自的 target bin,再用零初始化的轻量支路检验这种显式结构能否在不扰动宿主起点的条件下补足音乐理解。 标签:#音乐理解 #Adapter #可解释性 #模型评估 评分:7.2/10 | 创新 1.5/2 | 严谨 1.3/1.5 | 实验 1.3/1.5 | 清晰 0.9/1 | 影响 1.1/1.5 | 开源 0/1.5 | 复现 0.4/0.5 | 工程 0.7/1.5 💬 毒舌点评 DS 最扎实的选择,是让每个 target bin 为自身参与的关系负责,而不是把整帧压成无法追问来源的标量。frequency-axis correlation 使这个关系核避开 K²T 存储,零初始化 gated residual adapter 又保证接入前不改变宿主函数;Gaussian 与同架构 CQT 控制也让“只是多了参数或第二支路”的解释较难成立。 但最该泼冷水的是相对 CQT 的增益并不大:MusicQA 只高 .0028,且 3 个比较的 Holm-adjusted sign test 都为 .0938。relation transform 还没有从压缩与归一化中完全拆开,理论排序和 BERTScore-R 更不能升级为人类悦耳、张力或和声理解的裁决;它是可解释补充先验,不是感知理论已经获证。 ...

2026-08-27 · 更新于 2026-09-04 · 3 min · 609 words

Mandarin Humorous Homophone Recognition and Disambiguation in Automatic Speech Recognition

📄 谐音不是错字:让普通话 ASR 在纠错与保留笑点之间踩刹车 英文题目:Mandarin Humorous Homophone Recognition and Disambiguation in Automatic Speech Recognition 一句话:这篇论文把高频字改对和别把故意反常的谐音笑点抹平拆为双支路,用 span 定位、条件提示与不同的语义选择规则分担矛盾;低频收益、高频退化和 80 条 TTS HumourPhone 共同说明保守路由仍未被充分验证。 标签:#语音识别 #大语言模型 #Adapter #提示学习 #模型评估 评分:5.7/10 | 创新 1.2/2 | 严谨 1/1.5 | 实验 0.9/1.5 | 清晰 0.9/1 | 影响 0.9/1.5 | 开源 0/1.5 | 复现 0.2/0.5 | 工程 0.6/1.5 💬 毒舌点评 该工作真正做对的不是再增加泛化提示词,而是承认纠错和识别笑点的判据相反:常规支路用 5% 相对裕量保留原转写,HumourPhone 支路则允许保留合乎模式的语义不协调。Whisper-v3 的低频靶词 T-CER 从 24.74% 到 20.39%说明,先圈定可疑 span 再局部改写,比让语音 LLM 对整句即兴发挥更有纪律。 但最难的现实部分只有 80 条、0.08 小时的 Edge TTS 语料,也没有拆开 Emotion Detector、span 扩展、LLM 生成和 MacBERT 选择器的贡献。Qwen3-ASR 高频组从 2.19% 升到 3.42%,Prompt 4 又从 13.88% 回升到 14.04%;这提醒我们,知道哪里可能有梗,离知道何时绝不能动原句,仍缺少被实测的置信度策略。 ...

2026-08-27 · 更新于 2026-09-04 · 4 min · 643 words

SPECTRA: Subspace-Preserving Embedding Calibration, Transport, and Replay for Fully Few-Shot Class-Incremental Audio Classification

📄 别把旧类压成一个点:SPECTRA 用低秩几何给 5-shot 音频增量学习留住记忆 英文题目:SPECTRA: Subspace-Preserving Embedding Calibration, Transport, and Replay for Fully Few-Shot Class-Incremental Audio Classification 一句话:SPECTRA 的关键选择是让冻结 PENGI 保持通用稳定性、让残差 adapter 承担任务可塑性 标签:#音频分类 #少样本 #持续学习 #Adapter #高效推理 评分:7.2/10 | 创新 1.6/2 | 严谨 1.3/1.5 | 实验 1.4/1.5 | 清晰 0.9/1 | 影响 1.1/1.5 | 开源 0/1.5 | 复现 0.2/0.5 | 工程 0.7/1.5 💬 毒舌点评 作者没有用“冻结 encoder”把问题粗暴地冻住,而是承认 adapter 会让旧类失去参照,再以低秩子空间 replay 把旧类的局部几何带回训练。最扎实的是 Table 5:匹配总方差的 Gaussian replay 没能复现收益,subspace replay 才把 NSynth-100 的 AA/PD 推到 96.5/3.2,说明这里有被消融钉住的结构性主张,而非给 replay 换个名字。 ...

2026-08-27 · 更新于 2026-09-04 · 4 min · 810 words

语音/音乐/音频论文速递 2026-08-27

语音/音乐/音频论文速递 2026-08-27 共分析 21 篇论文 ⚡ 今日概览 ✅ 筛选入选 21 篇 → 🔬 深度分析完成 🏷️ 热门方向 方向 数量 分布 #语音识别 4 篇 ████ #回声消除 2 篇 ██ #语音交互 2 篇 ██ #音频分类 2 篇 ██ #音频理解 2 篇 ██ #基准测试 1 篇 █ #空间音频 1 篇 █ #语音伪造检测 1 篇 █ 📊 论文评分排行榜(21 篇,按分数降序) 排名 论文 总分 分档 文档类型 主任务 🥇 AllMusicCaps: Album Reviews as Complementary… 9.1 前10% 方法研究 #音乐检索 🥈 LibriBrain100: One Hundred Hours of Broad and Deep MEG… 8.9 前25% 数据集与基准 #基准测试 🥉 What Do Audio-Visual Synchronization Metrics Actually… 8.8 前25% 方法研究 #音视频理解 4. Why ML-based cough models do not generalize: a… 8.8 前25% 应用研究 #音频分类 5. Lost but not erased: Finding traces of a forgotten… 8.6 前25% 方法研究 #语音识别 6. TurnBench: A Multi-Domain Benchmark for Turn-Taking… 8.5 前25% 数据集与基准 #语音交互 7. Knowledge Distillation for Efficient Acoustic Echo… 8.5 前25% 方法研究 #回声消除 8. Domain-Adaptive ASR for Telephony AI Agents: Fine… 7.9 前25% 系统技术报告 #语音识别 9. CSAVocoder: A Causal Spatial Audio Vocoder Towards… 7.6 前25% 系统技术报告 #空间音频 10. SPECTRA: Subspace-Preserving Embedding Calibration… 7.2 前50% 方法研究 #音频分类 11. Dissonance Spectrum explicitly models perceptual… 7.2 前50% 方法研究 #音乐理解 12. AudioLens: Multi-Perspective Speech Clustering with… 7.1 前50% 方法研究 #音频理解 13. Super Star: Towards Streaming Real-time Interactive… 6.9 前50% 系统技术报告 #音视频交互 14. Can We Read the Mind of an Audio LLM? A Verbalizable… 6.6 前50% 方法研究 #音频理解 15. VoiceMem: Streaming Dual-Brain Memory for Real-Time… 6.6 前50% 系统技术报告 #语音交互 16. A Training-Free Proactive Defense Against Partial… 6.5 前50% 方法研究 #语音伪造检测 17. Combining Self-Embedding Audio Watermarking with Ultra… 6.4 前50% 方法研究 #音频水印 18. Generative vs. Encoder Large Language Models for ASR… 6.1 前50% 应用研究 #语音质量评估 19. Mandarin Humorous Homophone Recognition and… 5.7 前50% 方法研究 #语音识别 20. Acoustic Echo Control Based on Sound Object… 4.9 后50% 方法研究 #回声消除 21. Fine-Tuning Whisper for Automatic Speech Recognition… 4.7 后50% 应用研究 #语音识别 📋 论文列表 🥇 把乐评变成检索监督,关键不在多而在语域对位 英文题目:AllMusicCaps: Album Reviews as Complementary Supervision for Music CLAP ...

2026-08-27 · 更新于 2026-09-04 · 18 min · 3730 words

Multi-Granularity Sentiment Integration for LLM-Based Multimodal Sentiment Analysis

📄 Multi-Granularity Sentiment Integration for LLM-Based Multimodal Sentiment Analysis 标签:#音视频理解 #Adapter #大语言模型 #多模态模型 6.5/10 | 创新 1.3/2 | 严谨 1/1.5 | 实验 1.2/1.5 | 清晰 0.8/1 | 影响 1/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 0.9/1.5 ✅ 6.5/10 | 前50% | 文档类型:方法研究 | 评分置信度:中 | #音视频理解 | #Adapter | #大语言模型 #多模态模型 | arxiv 👥 作者与机构 第一作者:Shanshan Lin(Fuzhou University, Fuzhou, China) 通讯作者:Xiangwen Liao(Fuzhou University, Fuzhou, China) 作者列表:Shanshan Lin(Fuzhou University)、Yuesheng Wu(Fuzhou University)、Chao Chen(Harbin Institute of Technology, Shenzhen)、Yizhe Yang(Fuzhou University)、Zhihao Chen(Jiangxia University, Fuzhou)、Zexian Yang(Fuzhou University)、Xiangwen Liao(Fuzhou University) 💡 毒舌点评 本文把“非文本模态在进入 LLM 前如何组织时序结构”作为核心问题,并用多粒度编码加伪 token 压缩做文章,这一点比单纯换 adapter 更有思考。但实验对比没有纳入 DEVA、MFON 等直接 LLM-based 竞品的受控复现,且 MOSEI 上 Acc-2/F1 仍明显弱于 UniMSE;正文用“remains competitive with strong multimodal methods”概括略高估,更适合限定为“在 frozen-LLM 设定下相对 MSE-Adapter 的竞争优势”。 ...

2026-08-18 · 更新于 2026-09-04 · 4 min · 842 words

Xemo-Talker: Unlock Emotions Explicitly for Audio-Driven Talking Portrait Synthesis

📄 Xemo-Talker: Unlock Emotions Explicitly for Audio-Driven Talking Portrait Synthesis 标签:#音视频生成 #扩散模型 #对比学习 #Adapter #高效推理 6.2/10 | 创新 1.3/2 | 严谨 0.9/1.5 | 实验 1/1.5 | 清晰 0.7/1 | 影响 0.5/1.5 | 开源 0.5/1.5 | 复现 0.3/0.5 | 工程 1/1.5 ✅ 6.2/10 | 前50% | 文档类型:方法研究 | 评分置信度:中 | #音视频生成 | #扩散模型 | #对比学习 #Adapter | arxiv 👥 作者与机构 第一作者:Chaolong Yang(论文中标注单位 1、2、3) 通讯作者:Jie Sun(单位 2)、Kaizhu Huang(单位 3) 作者列表:Chaolong Yang(1,2,3)、Yinuo Guo(4)、Kai Yao(5)、Yuyao Yan(2)、Jie Sun(2)、Guangliang Cheng(1)、Shibin Wu(6)、Bin Dong(7)、Kaizhu Huang(3) 机构信息:论文仅以数字上标标注作者单位,未在文本中给出上标对应的机构名称,因此具体大学、实验室或公司均未说明。 💡 毒舌点评 这项工作最有趣的地方是把情绪监督压到 PCA 低方差尾部,确实比一刀切全空间监督更聪明,也换来了接近真实视频的情绪分类准确率。但它只在 MEAD 四个测试说话人上证明自己,LSE-C 和 FID 明显输给部分基线,而且所谓开源还停留在“will be publicly available”;更麻烦的是,低主成分投影到底该作用于干净运动还是预测噪声,论文的公式和动机对不齐,审稿人很难为可复现性和跨域泛化买账。 ...

2026-08-18 · 更新于 2026-09-04 · 5 min · 869 words

语音/音乐/音频论文速递 2026-08-18

语音/音乐/音频论文速递 2026-08-18 共分析 39 篇论文 ⚡ 今日概览 📥 抓取 39 篇 → 🔬 深度分析完成 🏷️ 热门方向 方向 数量 分布 #语音合成 3篇 ███ #语音增强 3篇 ███ #语音识别 3篇 ███ #音频分类 3篇 ███ #音频理解 3篇 ███ #声源定位 2篇 ██ #语音编码 2篇 ██ #音视频理解 2篇 ██ 📊 论文评分排行榜(39 篇,按分数降序) 排名 论文 总分 分档 文档类型 主任务 🥇 INSPIRE: A Benchmark for Instruction-Aware Speech Retri 7.9分 前25% 数据集与基准 #音频检索 🥈 What Makes a Good Layer? Assessing the Layer-Wise Intri 7.7分 前25% 方法研究 #音乐理解 🥉 How Fragile Is Your Watermark? Training-Free Structural 7.6分 前25% 方法研究 #音频水印 4. Numerical and perceptual validity of synthetic Head-Rel 7.6分 前25% 应用研究 #声源定位 5. ACE-Cap: Active Evidence Acquisition via Agentic Co-Evo 7.5分 前25% 方法研究 #音频字幕生成 6. CineDub: Scaling End-to-End Video Dubbing to Multi-Spea 7.3分 前50% 方法研究 #音视频语音合成 7. Prototype-Rectified Iterative Self-supervised Manifold 7.2分 前50% 方法研究 #音频分类 8. CLARA: Clip-Level Multimodal Alignment with VLM-Derived 7.2分 前50% 方法研究 #音视频理解 9. Impulse Response Estimation via Laguerre-Fourier Expans 6.8分 前50% 方法研究 #音频理解 10. SingDance: Compositional Zero-Shot Singing-and-Dancing 6.8分 前50% 方法研究 #音视频生成 11. Listen, Reason, and Segment: Aligning LALMs with Editor 6.8分 前50% 方法研究 #音频理解 12. AnyTalk: Speech Animation for Arbitrary Characters Leve 6.7分 前50% 方法研究 #音视频语音合成 13. Evidence of Absence: Cross-Modal Abductive Risk Percept 6.6分 前50% 方法研究 #音频事件检测 14. ParaJSCC: A Parameterized Framework for Reusable Multim 6.6分 前50% 方法研究 #音频编码 15. ARENA: Automated Red-Teaming for Large Audio Language M 6.5分 前50% 方法研究 #音频理解 16. The Null Token Knows: Reducing Message-Free Hallucinati 6.5分 前50% 方法研究 #语音识别 17. Moving Horizon Estimation for Underwater Target Trackin 6.5分 前50% 方法研究 #声源定位 18. Multi-Granularity Sentiment Integration for LLM-Based M 6.5分 前50% 方法研究 #音视频理解 19. Adding Voice Cloning to Text-to-Audio-Video Models with 6.4分 前50% 方法研究 #语音克隆 20. Xemo-Talker: Unlock Emotions Explicitly for Audio-Drive 6.2分 前50% 方法研究 #音视频生成 21. Separate First, Then Associate: A Two-Stage Approach fo 6.2分 前50% 系统技术报告 #音视频语音分离 22. Geometry-adaptive Ambisonic encoding for sparse microph 6.2分 前50% 方法研究 #空间音频 23. A survey of AI-generated voices and their detection 6.1分 前50% 综述 #语音伪造检测 24. Iterative Self-Learning for Expressive Text-to-Speech S 6.1分 前50% 方法研究 #语音合成 25. Cached LLM Probability Retrieval for Speech Recognition 6.1分 前50% 方法研究 #语音识别 26. DuplexGen: Decoupling Content, Timing, and Acoustics fo 6.1分 前50% 方法研究 #语音合成 27. Speaker-Normalized Semantic Speech Tokens via Iterative 6.0分 前50% 方法研究 #语音编码 28. Multi-Modal Generative Fuzzy System: Fuzzy Inference Gu 5.9分 前50% 方法研究 #音视频问答 29. A Parameter-Free Few-Shot Evaluation for Elephant Vocal 5.9分 前50% 应用研究 #音频分类 30. Contrastive Learning with Variational Regularization fo 5.9分 前50% 方法研究 #语音合成 31. Sonifying I2S Transport Signals to Detect Transmission 5.9分 前50% 系统技术报告 #音频分类 32. An Analytical-Prior Framework for Data-Efficient Predic 5.8分 前50% 方法研究 #预训练 33. Navigating Speech Enhancement for Real-Time MRI: A Syst 5.7分 前50% 应用研究 #语音增强 34. Distinguishing AI-Generated Music from Edited Audio as 5.6分 前50% 方法研究 #音频伪造检测 35. A Novel Binaural Cue Preservation Loss for DNN-Based Bi 5.6分 前50% 方法研究 #语音增强 36. Unadapted Multilingual ASR on a Garrusi Kurdish Evaluat 5.6分 前50% 方法研究 #语音识别 37. Feedforward Active Speech Suppression Based on Time Ser 5.5分 前50% 方法研究 #语音增强 38. Using the Mimi codec for metalinguistic representations 4.7分 后50% 方法研究 #语音编码 39. AudioTQ: A Data-Oblivious 6-Bit CPU Audio Codec via Ran 3.5分 后50% 系统技术报告 #音频编码 📋 论文列表 🥇 INSPIRE: A Benchmark for Instruction-Aware Speech Retrieval 7.9/10 | 创新 1.2/2 | 严谨 1.2/1.5 | 实验 1/1.5 | 清晰 1/1 | 影响 0.9/1.5 | 开源 1.2/1.5 | 复现 0.3/0.5 | 工程 1.1/1.5 ...

2026-08-18 · 更新于 2026-09-04 · 40 min · 8515 words

Dialogue-Aware Video-to-Music Generation Using Public Domain Film Collections

📄 Dialogue-Aware Video-to-Music Generation Using Public Domain Film Collections 标签:#音视频生成 #Adapter #数据集 #音乐生成 #基准测试 7.1/10 | 创新 1.2/2 | 严谨 1/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 1/1.5 | 开源 1.2/1.5 | 复现 0.1/0.5 | 工程 0.8/1.5 ✅ 7.1/10 | 前50% | 文档类型:数据集与基准 | 评分置信度:中 | #音视频生成 | #Adapter | #数据集 #音乐生成 | arxiv 👥 作者与机构 第一作者:Haven Kim(具体机构未逐作者标注;论文仅列 1 University of California San Diego、2 University of Michigan) 通讯作者:未说明 作者列表:Haven Kim、Zachary Novack、Julian McAuley(原文作者名单拼作 “Juian McAuley”,疑为 Julian McAuley 的笔误)、Hao-Wen Dong;机构信息仅列两个单位,未逐作者映射 💡 毒舌点评 这篇论文用一个 246.4 小时的自托管公共领域电影数据集,直击视频配乐领域“链接腐烂 + 爬取限速”的真实痛点,工程贡献清楚。但对话感知模块本质上是 FiLM 加位置编码的轻量改装,且 GVMGen 在 in-domain 上出现 CLAP 0.43→0.39、KL 0.72→0.73 的倒退,作者仅以“OOD 提升/正则化”解释,缺乏组件级消融和主观听感证据,却仍宣称“improvement over the state-of-the-art baselines”,结论偏强。 ...

2026-08-13 · 更新于 2026-09-04 · 3 min · 616 words