研究条目

ICLR 2026 - 音频检索 论文列表

ICLR 2026 - 音频检索 共 4 篇论文 ← 返回 ICLR 2026 总览 排名 论文 评分 分档 🥇 WAVE: Learning Unified & Versatile Audio-Visual Embeddings w 8.0分 前25% 🥈 Beyond Instance-Level Alignment: Dual-Level Optimal Transpor 7.5分 前25% 🥉 OmniCVR: A Benchmark for Omni-Composed Video Retrieval with 7.0分 前25% 4. SupCLAP: Controlling Optimization Trajectory Drift in Audio- 7.0分 前25% 📋 论文详情 🥇 WAVE: Learning Unified & Versatile Audio-Visual Embeddings with Multimodal LLM 🔥 8.0/10 | 前25% | #音频检索 | #对比学习 | #多模态模型 #视频检索 ...

 · 更新于 2026-09-05 · 约 3 分钟 · 500 字 阅读 →
研究条目

ICLR 2026 - 音频生成 论文列表

ICLR 2026 - 音频生成 共 9 篇论文 ← 返回 ICLR 2026 总览 排名 论文 评分 分档 🥇 PrismAudio: Decomposed Chain-of-Thought and Multi-dimensiona 9.0分 前10% 🥈 SCRAPL: Scattering Transform with Random Paths for Machine L 8.5分 前25% 🥉 UALM: Unified Audio Language Model for Understanding, Genera 8.5分 前25% 4. Flow2GAN: Hybrid Flow Matching and GAN with Multi-Resolution 8.0分 前25% 5. Aurelius: Relation Aware Text-to-Audio Generation At Scale 8.0分 前25% 6. AC-Foley: Reference-Audio-Guided Video-to-Audio Synthesis wi 8.0分 前25% 7. TangoFlux: Super Fast and Faithful Text to Audio Generation 8.0分 前25% 8. LayerSync: Self-aligning Intermediate Layers 7.5分 前25% 9. AudioX: A Unified Framework for Anything-to-Audio Generation 7.5分 前25% 📋 论文详情 🥇 PrismAudio: Decomposed Chain-of-Thought and Multi-dimensional Rewards for Video-to-Audio Generation 🔥 9.0/10 | 前10% | #音频生成 | #强化学习 | #扩散模型 #流匹配 ...

 · 更新于 2026-09-05 · 约 9 分钟 · 1782 字 阅读 →
研究条目

ICLR 2026 - 音频问答 论文列表

ICLR 2026 - 音频问答 共 6 篇论文 ← 返回 ICLR 2026 总览 排名 论文 评分 分档 🥇 Incentivizing Consistent, Effective and Scalable Reasoning C 8.5分 前10% 🥈 Echo: Towards Advanced Audio Comprehension via Audio-Interle 8.5分 前10% 🥉 Query-Guided Spatial–Temporal–Frequency Interaction for Musi 8.0分 前25% 4. Can Vision-Language Models Answer Face to Face Questions in 8.0分 前25% 5. Measuring Audio’s Impact on Correctness: Audio-Contribution- 7.5分 前25% 6. WorldSense: Evaluating Real-world Omnimodal Understanding fo 7.0分 前25% 📋 论文详情 🥇 Incentivizing Consistent, Effective and Scalable Reasoning Capability in Audio LLMs via Reasoning Process Rewards 🔥 8.5/10 | 前10% | #音频问答 | #强化学习 | #音频大模型 #推理 ...

 · 更新于 2026-09-05 · 约 3 分钟 · 541 字 阅读 →
研究条目

ICLR 2026 - 音视频 论文列表

ICLR 2026 - 音视频 共 4 篇论文 ← 返回 ICLR 2026 总览 排名 论文 评分 分档 🥇 JavisDiT++: Unified Modeling and Optimization for Joint Audi 9.0分 前25% 🥈 JavisDiT: Joint Audio-Video Diffusion Transformer with Hiera 8.5分 前25% 🥉 Syncphony: Synchronized Audio-to-Video Generation with Diffu 8.0分 前25% 4. Instilling an Active Mind in Avatars via Cognitive Simulatio 7.0分 前25% 📋 论文详情 🥇 JavisDiT++: Unified Modeling and Optimization for Joint Audio-Video Generation 🔥 9.0/10 | 前25% | #音视频 | #流匹配 | #扩散模型 #多模态模型 ...

 · 更新于 2026-09-05 · 约 2 分钟 · 400 字 阅读 →
研究条目

ICLR 2026 - 音视频联合推理 论文列表

ICLR 2026 - 音视频联合推理 共 1 篇论文 ← 返回 ICLR 2026 总览 排名 论文 评分 分档 🥇 JointAVBench: A Benchmark for Joint Audio-Visual Reasoning E 7.0分 前25% 📋 论文详情 🥇 JointAVBench: A Benchmark for Joint Audio-Visual Reasoning Evaluation ✅ 7.0/10 | 前25% | #音视频联合推理 | #基准测试 | #多模态模型 #大语言模型 👥 作者与机构 第一作者:Jianghan Chao(中国人民大学高瓴人工智能学院) 通讯作者:Ruihua Song(中国人民大学高瓴人工智能学院) 作者列表:Jianghan Chao(中国人民大学高瓴人工智能学院),Jianzhang Gao(中国人民大学高瓴人工智能学院),Wenhui Tan(中国人民大学高瓴人工智能学院),Yuchong Sun(中国人民大学高瓴人工智能学院),Ruihua Song(中国人民大学高瓴人工智能学院),Liyun Ru(百川智能) 💡 毒舌点评 亮点在于提出了一个设计严谨、维度全面的音视频联合推理评估框架,并巧妙地利用先进的LLM构建了自动化数据生成流水线,在保证质量的同时大幅降低了标注成本;短板在于其基准数据集完全来源于SF20K这一特定影视数据集,可能存在领域偏差,且论文主要贡献是评估基准而非新的建模方法,对推动模型架构本身创新的直接贡献有限。 🔗 开源详情 代码:论文中未提及代码链接。 模型权重:未提及公开权重。 数据集:公开。论文提供了项目页面链接 (https://jointavbench.github.io),并说明JointAVBench数据集将在该页面发布。 Demo:未提及。 复现材料:论文在附录中提供了生成流水线各阶段使用的详细Prompt模板(如图10-16),这对于复现其数据生成过程至关重要。 论文中引用的开源项目:引用了多个开源模型(Qwen2.5-VL, Qwen2.5-Omni, Whisper-v3等)和工具(PySceneDetect)用于构建基准。 整体开源计划:论文明确表示会发布数据集,但代码和模型权重的开源计划未提及。 📌 核心摘要 ...

 · 更新于 2026-09-05 · 约 1 分钟 · 91 字 阅读 →
研究条目

ICLR 2026 - 音视频深度伪造检测 论文列表

ICLR 2026 - 音视频深度伪造检测 共 1 篇论文 ← 返回 ICLR 2026 总览 排名 论文 评分 分档 🥇 Tell me Habibi, is it Real or Fake? 8.5分 前25% 📋 论文详情 🥇 Tell me Habibi, is it Real or Fake? 🔥 8.5/10 | 前25% | #音视频深度伪造检测 | #数据集 | #多语言 #零样本 👥 作者与机构 第一作者:Kartik Kuckreja (MBZUAI) 通讯作者:未明确标注,但通讯邮箱主要为 kartik.kuckreja@mbzuai.ac.ae 和 parul@monash.edu 作者列表:Kartik Kuckreja (MBZUAI)、Parul Gupta (Monash University)、Injy Hamed (MBZUAI)、Thamar Solorio (MBZUAI)、Muhammad Haris Khan (MBZUAI)、Abhinav Dhall (Monash University) 💡 毒舌点评 ...

 · 更新于 2026-09-05 · 约 1 分钟 · 109 字 阅读 →
研究条目

ICLR 2026 - 音视频事件检测 论文列表

ICLR 2026 - 音视频事件检测 共 1 篇论文 ← 返回 ICLR 2026 总览 排名 论文 评分 分档 🥇 Entropy-Monitored Kernelized Token Distillation for Audio-Vi 8.5分 前25% 📋 论文详情 🥇 Entropy-Monitored Kernelized Token Distillation for Audio-Visual Compression 🔥 8.5/10 | 前25% | #音视频事件检测 | #知识蒸馏 | #多模态模型 #音频分类 👥 作者与机构 第一作者:Hyoungseob Park (Yale University, Amazon AGI 实习期间完成) 通讯作者:未明确说明(论文未标注通讯作者信息) 作者列表: Hyoungseob Park (Yale University) Lipeng Ke (Amazon AGI) Pritish Mohapatra (Amazon AGI) Huajun Ying (Amazon AGI) Sankar Venkataraman (Amazon AGI) Alex Wong (Yale University) 💡 毒舌点评 ...

 · 更新于 2026-09-05 · 约 1 分钟 · 128 字 阅读 →
研究条目

ICLR 2026 - 语音大模型 论文列表

ICLR 2026 - 语音大模型 共 1 篇论文 ← 返回 ICLR 2026 总览 排名 论文 评分 分档 🥇 Closing the Gap Between Text and Speech Understanding in LLM 8.5分 前25% 📋 论文详情 🥇 Closing the Gap Between Text and Speech Understanding in LLMs 🔥 8.5/10 | 前25% | #语音大模型 | #知识蒸馏 #主动学习 | #知识蒸馏 #主动学习 👥 作者与机构 第一作者:Santiago Cuervo(Université de Toulon, Aix Marseille Université, CNRS, LIS) 通讯作者:未说明 作者列表:Santiago Cuervo(Université de Toulon, Aix Marseille Université, CNRS, LIS)、Skyler Seto(Apple)、Maureen de Seyssel(Apple)、Richard He Bai(Apple)、Zijin Gu(Apple)、Tatiana Likhomanenko(Apple)、Navdeep Jaitly(Apple)、Zakaria Aldeneh(Apple) 💡 毒舌点评 ...

 · 更新于 2026-09-05 · 约 1 分钟 · 128 字 阅读 →
研究条目

ICLR 2026 - 语音对话系统 论文列表

ICLR 2026 - 语音对话系统 共 8 篇论文 ← 返回 ICLR 2026 总览 排名 论文 评分 分档 🥇 DrVoice: Parallel Speech-Text Voice Conversation Model via D 9.5分 前10% 🥈 STITCH: Simultaneous Thinking and Talking with Chunked Reaso 8.5分 前25% 🥉 End-to-end Listen, Look, Speak and Act 8.5分 前25% 4. From Text to Talk: Audio-Language Model Needs Non-Autoregres 8.5分 前25% 5. ParaS2S: Benchmarking and Aligning Spoken Language Models fo 8.0分 前25% 6. Human or Machine? A Preliminary Turing Test for Speech-to-Sp 7.5分 前25% 7. Can Speech LLMs Think while Listening? 7.5分 前25% 8. Towards True Speech-to-Speech Models Without Text Guidance 7.5分 前25% 📋 论文详情 🥇 DrVoice: Parallel Speech-Text Voice Conversation Model via Dual-Resolution Speech Representations 🔥 9.5/10 | 前10% | #语音对话系统 | #自回归模型 | #多模态模型 #语音合成 ...

 · 更新于 2026-09-05 · 约 4 分钟 · 817 字 阅读 →
研究条目

ICLR 2026 - 语音翻译 论文列表

ICLR 2026 - 语音翻译 共 2 篇论文 ← 返回 ICLR 2026 总览 排名 论文 评分 分档 🥇 Scalable Multilingual Multimodal Machine Translation with Sp 8.5分 前25% 🥈 UniSS: Unified Expressive Speech-to-Speech Translation with 8.0分 前25% 📋 论文详情 🥇 Scalable Multilingual Multimodal Machine Translation with Speech-Text Fusion 🔥 8.5/10 | 前25% | #语音翻译 | #多模态模型 | #多语言 #低资源 👥 作者与机构 第一作者:Yexing Du(哈尔滨工业大学,鹏城实验室) 通讯作者:Youcheng Pan(鹏城实验室), Yang Xiang(鹏城实验室), Ming Liu(哈尔滨工业大学,鹏城实验室) 作者列表:Yexing Du(哈尔滨工业大学,鹏城实验室)、 Youcheng Pan(鹏城实验室)、 Zekun Wang(哈尔滨工业大学)、 Zheng Chu(哈尔滨工业大学)、 Yichong Huang(哈尔滨工业大学)、 Kaiyuan Liu(哈尔滨工业大学,鹏城实验室)、 Bo Yang(鹏城实验室)、 Yang Xiang(鹏城实验室)、 Ming Liu(哈尔滨工业大学,鹏城实验室)、 Bing Qin(哈尔滨工业大学,鹏城实验室) 💡 毒舌点评 ...

 · 更新于 2026-09-05 · 约 2 分钟 · 214 字 阅读 →
研究条目

ICLR 2026 - 语音分离 论文列表

ICLR 2026 - 语音分离 共 3 篇论文 ← 返回 ICLR 2026 总览 排名 论文 评分 分档 🥇 MARS-Sep: Multimodal-Aligned Reinforced Sound Separation 7.5分 前25% 🥈 Efficient Audio-Visual Speech Separation with Discrete Lip S 7.5分 前25% 🥉 Knowing When to Quit: Probabilistic Early Exits for Speech S 7.0分 前25% 📋 论文详情 🥇 MARS-Sep: Multimodal-Aligned Reinforced Sound Separation ✅ 7.5/10 | 前25% | #语音分离 | #强化学习 | #多模态模型 #对比学习 👥 作者与机构 第一作者:Zihan Zhang (Zhejiang University) 通讯作者:Tao Jin (Zhejiang University) 作者列表:Zihan Zhang (Zhejiang University), Xize Cheng (Zhejiang University), Zhennan Jiang (Institute of Automation, Chinese Academy of Sciences), Dongjie Fu (Zhejiang University), Jingyuan Chen (Zhejiang University), Zhou Zhao (Zhejiang University), Tao Jin (Zhejiang University) 💡 毒舌点评 ...

 · 更新于 2026-09-05 · 约 4 分钟 · 708 字 阅读 →
研究条目

ICLR 2026 - 语音合成 论文列表

ICLR 2026 - 语音合成 共 10 篇论文 ← 返回 ICLR 2026 总览 排名 论文 评分 分档 🥇 FlexiCodec: A Dynamic Neural Audio Codec for Low Frame Rates 9.0分 前10% 🥈 VibeVoice: Expressive Podcast Generation with Next-Token Dif 8.5分 前10% 🥉 SpeechJudge: Towards Human-Level Judgment for Speech Natural 8.5分 前10% 4. FlexiVoice: Enabling Flexible Style Control in Zero-Shot TTS 8.0分 前25% 5. Toward Complex-Valued Neural Networks for Waveform Generatio 8.0分 前25% 6. From Natural Alignment to Conditional Controllability in Mul 8.0分 前25% 7. Hierarchical Semantic-Acoustic Modeling via Semi-Discrete Re 8.0分 前25% 8. Gogo: Group-wise granularity-ordered codec for stable and ef 7.5分 前25% 9. Continuous Audio Language Models 7.0分 前25% 10. MambaVoiceCloning: Efficient and Expressive Text-to-Speech v 6.5分 前50% 📋 论文详情 🥇 FlexiCodec: A Dynamic Neural Audio Codec for Low Frame Rates 🔥 9.0/10 | 前10% | #语音合成 | #自监督学习 | #流匹配 #多语言 ...

 · 更新于 2026-09-05 · 约 8 分钟 · 1679 字 阅读 →
研究条目

ICLR 2026 - 语音合成评估 论文列表

ICLR 2026 - 语音合成评估 共 1 篇论文 ← 返回 ICLR 2026 总览 排名 论文 评分 分档 🥇 TTSDS2: Resources and Benchmark for Evaluating Human-Quality 7.5分 前25% 📋 论文详情 🥇 TTSDS2: Resources and Benchmark for Evaluating Human-Quality Text to Speech Systems ✅ 7.5/10 | 前25% | #语音合成评估 | #基准测试 | #语音合成 #模型评估 👥 作者与机构 第一作者:Christoph Minixhofer(爱丁堡大学语音技术研究中心) 通讯作者:论文中未明确指定,根据作者邮箱统一格式,可能为同一机构课题组 作者列表:Christoph Minixhofer(爱丁堡大学语音技术研究中心)、Ondrej Klejch(爱丁堡大学语音技术研究中心)、Peter Bell(爱丁堡大学语音技术研究中心) 💡 毒舌点评 亮点在于构建了首个覆盖14种语言、横跨多个真实世界域(含噪声、野生、儿童语音)的TTS客观评估基准与自动化流水线,实用价值高。但核心创新点(TTSDS2)是对原有TTSDS指标的增量改进,更多是工程优化和鲁棒性验证,而非提出全新评估范式,且其计算开销(CPU-bound)限制了快速迭代。 🔗 开源详情 代码:提供代码仓库链接(github.com/ttsds/pipeline),用于自动化数据创建和基准测试。 模型权重:论文评估的20个系统多为开源,TTSDS2本身不涉及需训练的模型,但依赖的特征提取模型(如mHuBERT-147)是公开的。 数据集:公开发布了包含11,282条评分的人类评估数据集(hf.co/datasets/ttsds/listening_test)。自动化流水线可创建多语言数据集。 Demo:提供在线基准排行榜网站(ttsdsbenchmark.com)。 复现材料:论文详细描述了评估设置、问卷内容、流水线算法(Algorithm 1)、特征选择标准,并提供了特征分布可视化示例(图1)。 论文中引用的开源项目:大量引用了开源工具和模型,如Whisper, Demucs, Pyannote, XNLI模型, VERSA工具包, 以及所评估的20个开源TTS系统。 📌 核心摘要 ...

 · 更新于 2026-09-05 · 约 1 分钟 · 198 字 阅读 →
研究条目

ICLR 2026 - 语音情感识别 论文列表

ICLR 2026 - 语音情感识别 共 5 篇论文 ← 返回 ICLR 2026 总览 排名 论文 评分 分档 🥇 VowelPrompt: Hearing Speech Emotions from Text via Vowel-lev 8.5分 前25% 🥈 AVERE: Improving Audiovisual Emotion Reasoning with Preferen 8.0分 前25% 🥉 Learnable Fractional Superlets with a Spectro-Temporal Emoti 8.0分 前25% 4. EmotionThinker: Prosody-Aware Reinforcement Learning for Exp 8.0分 前25% 5. Speech World Model: Causal State–Action Planning with Explic 7.5分 前25% 📋 论文详情 🥇 VowelPrompt: Hearing Speech Emotions from Text via Vowel-level Prosodic Augmentation 🔥 8.5/10 | 前25% | #语音情感识别 | #强化学习 | #多语言 #大语言模型 ...

 · 更新于 2026-09-05 · 约 3 分钟 · 637 字 阅读 →
研究条目

ICLR 2026 - 语音生成 论文列表

ICLR 2026 - 语音生成 共 1 篇论文 ← 返回 ICLR 2026 总览 排名 论文 评分 分档 🥇 TASTE: Text-Aligned Speech Tokenization and Embedding for Sp 7.0分 前25% 📋 论文详情 🥇 TASTE: Text-Aligned Speech Tokenization and Embedding for Spoken Language Modeling ✅ 7.0/10 | 前25% | #语音生成 | #自回归模型 | #语音大模型 #预训练 👥 作者与机构 第一作者:Liang-Hsuan Tseng (台湾大学电信工程学研究所,MediaTek Research实习) 通讯作者:未明确说明,但Yi-Chang Chen和Hung-yi Lee提供了单位邮箱。 作者列表: Liang-Hsuan Tseng (台湾大学电信工程学研究所,MediaTek Research实习) Yi-Chang Chen (MediaTek Research) Kuan-Yi Lee (台湾大学电信工程学研究所,MediaTek Research实习) Da-Shan Shiu (MediaTek Research) Hung-yi Lee (台湾大学人工智能研究中心) 💡 毒舌点评 ...

 · 更新于 2026-09-05 · 约 1 分钟 · 126 字 阅读 →
研究条目

ICLR 2026 - 语音识别 #语音合成 论文列表

ICLR 2026 - 语音识别 #语音合成 共 1 篇论文 ← 返回 ICLR 2026 总览 排名 论文 评分 分档 🥇 Latent Speech-Text Transformer 7.0分 前25% 📋 论文详情 🥇 Latent Speech-Text Transformer ✅ 7.0/10 | 前25% | #语音识别 #语音合成 | #预训练 | #语音识别 #语音合成 👥 作者与机构 第一作者:Yen-Ju Lu ( Johns Hopkins University, Center for Language and Speech Processing ),工作于 Meta 期间完成。 通讯作者:Srinivasan Iyer, Duc Le ( Meta Superintelligence Labs ) 作者列表: Yen-Ju Lu ( Johns Hopkins University, CLSP ) Yashesh Gaur ( Meta Superintelligence Labs ) Wei Zhou ( Meta Superintelligence Labs ),工作于 Meta 期间完成。 Benjamin Muller ( Meta Superintelligence Labs ) Jesus Villalba ( Johns Hopkins University, CLSP ) Najim Dehak ( Johns Hopkins University, CLSP ) Luke Zettlemoyer ( Meta Superintelligence Labs ) Gargi Ghosh ( Meta Superintelligence Labs ) Mike Lewis ( Meta Superintelligence Labs ) Srinivasan Iyer ( Meta Superintelligence Labs ) Duc Le ( Meta Superintelligence Labs ) 💡 毒舌点评 ...

 · 更新于 2026-09-05 · 约 1 分钟 · 197 字 阅读 →
研究条目

ICLR 2026 - 语音识别 论文列表

ICLR 2026 - 语音识别 共 9 篇论文 ← 返回 ICLR 2026 总览 排名 论文 评分 分档 🥇 CTC-DRO: Robust Optimization for Reducing Language Dispariti 9.0分 前25% 🥈 Scaling Speech Tokenizers with Diffusion Autoencoders 8.5分 前25% 🥉 StableToken: A Noise-Robust Semantic Speech Tokenizer for Re 8.0分 前25% 4. Pay Attention to CTC: Fast and Robust Pseudo-Labelling for U 8.0分 前10% 5. A Brain-Inspired Gating Mechanism Unlocks Robust Computation 7.5分 前25% 6. A cross-species neural foundation model for end-to-end speec 7.5分 前25% 7. Confident and Adaptive Generative Speech Recognition via Ris 7.5分 前25% 8. Speech-to-LaTeX: New Models and Datasets for Converting Spok 7.5分 前25% 9. SumRA: Parameter Efficient Fine-tuning with Singular Value D 7.5分 前25% 📋 论文详情 🥇 CTC-DRO: Robust Optimization for Reducing Language Disparities in Speech Recognition 🔥 9.0/10 | 前25% | #语音识别 | #鲁棒性 | #多语言 #自监督学习 ...

 · 更新于 2026-09-05 · 约 6 分钟 · 1099 字 阅读 →
研究条目

ICLR 2026 - 语音问答 论文列表

ICLR 2026 - 语音问答 共 1 篇论文 ← 返回 ICLR 2026 总览 排名 论文 评分 分档 🥇 Data-Centric Lessons To Improve Speech-Language Pretraining 8.0分 前25% 📋 论文详情 🥇 Data-Centric Lessons To Improve Speech-Language Pretraining 🔥 8.0/10 | 前25% | #语音问答 | #预训练 | #语音大模型 #多模态模型 👥 作者与机构 第一作者:Vishaal Udandarao (Apple, University of Cambridge, University of Tübingen) 通讯作者:未明确说明 作者列表:Vishaal Udandarao (Apple, University of Cambridge, University of Tübingen), Zhiyun Lu (Apple), Xuankai Chang (Apple), Yongqiang Wang (Apple), Albin Madappally Jose (Apple), Fartash Faghri (Apple), Joshua P Gardner (Apple), Chung-Cheng Chiu (Apple) 💡 毒舌点评 ...

 · 更新于 2026-09-05 · 约 1 分钟 · 145 字 阅读 →
研究条目

ICLR 2026 - 语音增强 #对抗样本 论文列表

ICLR 2026 - 语音增强 #对抗样本 共 1 篇论文 ← 返回 ICLR 2026 总览 排名 论文 评分 分档 🥇 Are Deep Speech Denoising Models Robust to Adversarial Noise 8.5分 前25% 📋 论文详情 🥇 Are Deep Speech Denoising Models Robust to Adversarial Noise? 🔥 8.5/10 | 前25% | #语音增强 #对抗样本 | #信号处理 | #语音增强 #对抗样本 👥 作者与机构 第一作者:Will Schwarzer(马萨诸塞大学阿默斯特分校) 通讯作者:Will Schwarzer(马萨诸塞大学阿默斯特分校) 作者列表:Will Schwarzer(马萨诸塞大学阿默斯特分校)、Philip S. Thomas(马萨诸塞大学阿默斯特分校)、Andrea Fanelli(Dolby Laboratories)、Xiaoyu Liu(Meta) 💡 毒舌点评 论文将音频对抗攻击的研究从简单的扰动约束推进到了考虑真实声学环境(模拟过空传播)和严格心理声学掩蔽的实用化设定,这是一项重要且扎实的安全研究。然而,攻击的成功高度依赖于白盒梯度访问,且论文坦承通用对抗扰动和跨模型迁移基本无效,这限制了其直接展示的“威胁”的即时实用性,更像是一份详尽的系统性风险报告。 🔗 开源详情 ...

 · 更新于 2026-09-05 · 约 1 分钟 · 131 字 阅读 →
研究条目

ICLR 2026 - 语音增强 论文列表

ICLR 2026 - 语音增强 共 1 篇论文 ← 返回 ICLR 2026 总览 排名 论文 评分 分档 🥇 SpeechOp: Inference-Time Task Composition for Generative Spe 7.5分 前25% 📋 论文详情 🥇 SpeechOp: Inference-Time Task Composition for Generative Speech Processing ✅ 7.5/10 | 前25% | #语音增强 | #扩散模型 | #语音分离 #多任务学习 👥 作者与机构 第一作者:Justin Lovelace(Cornell University) 通讯作者:未明确说明(论文作者来自Cornell University和Adobe Research,从贡献描述看,Adobe Research团队的Rithesh Kumar, Jiaqi Su, Ke Chen, Zeyu Jin可能承担更多指导角色,但论文未明确标注通讯作者) 作者列表: Justin Lovelace(Cornell University) Rithesh Kumar(Adobe Research) Jiaqi Su(Adobe Research) Ke Chen(Adobe Research) Kilian Q Weinberger(Cornell University) Zeyu Jin(Adobe Research) 💡 毒舌点评 ...

 · 更新于 2026-09-05 · 约 1 分钟 · 105 字 阅读 →