The Missing Temporal Link: Temporal Context Routing for Script-Driven Audio-Video Generation

📄 剧本写好了时间,音画却演错了拍子:用路由把时间还给剧本 英文题目:The Missing Temporal Link: Temporal Context Routing for Script-Driven Audio-Video Generation 一句话:针对联合音视频生成中音画互相同步却共同偏离剧本时间的问题,论文用时长归一化的加性时间路由把镜头与对白区间送进双分支交叉注意力,在 200 个剧本上把镜头边界误差从 1.11 秒降到 0.042 秒、对白准时率提到 84.1%,代价是评测仍锁在短剧对白域且零开源。 标签:#音视频生成 | #流匹配 | #参数高效微调 | #多模态模型 评分:7.5/10 | 创新 1.6/2 | 技术严谨 1.2/1.5 | 实验充分 1.3/1.5 | 清晰度 0.8/1 | 影响力 1.1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5 👥 作者与机构 Yichen Liu:机构信息未在 arXiv HTML 中可靠披露 Quanwei Zhang:机构信息未在 arXiv HTML 中可靠披露 Haozhe Wang:机构信息未在 arXiv HTML 中可靠披露 Donghao Zhou:机构信息未在 arXiv HTML 中可靠披露 Xiaojie Li:机构信息未在 arXiv HTML 中可靠披露 Yang Shi:机构信息未在 arXiv HTML 中可靠披露 Jiaming Liu:机构信息未在 arXiv HTML 中可靠披露 Ruihua Huang:机构信息未在 arXiv HTML 中可靠披露 Yingtian Zou:机构信息未在 arXiv HTML 中可靠披露 Daquan Zhou:机构信息未在 arXiv HTML 中可靠披露 💬 毒舌点评 把剧本时间从文本字符串里拽出来做成双模态注意力偏置,治好了音画很同步但集体演错时间的毛病,匹配算子对照也算体面。硬伤是全套数据、训练、评测都锁在自家短剧闭环里,基线文本带时间本就不公平,检测器既当教练又当裁判,还零开源,离可复现的剧本驱动标准差一口气。 ...

2026-09-03 · 更新于 2026-09-04 · 5 min · 905 words

语音/音乐/音频论文速递 2026-09-03

语音/音乐/音频论文速递 2026-09-03 共分析 18 篇论文 ⚡ 今日概览 ✅ 筛选入选 18 篇 → 🔬 深度分析完成 🏷️ 热门方向 方向 数量 分布 #语音识别 6 篇 ██████ #语音合成 2 篇 ██ #音频分类 2 篇 ██ #声源定位 1 篇 █ #语音增强 1 篇 █ #语音情感识别 1 篇 █ #音乐生成 1 篇 █ #音视频理解 1 篇 █ 📊 论文评分排行榜(18 篇,按分数降序) 排名 论文 总分 分档 文档类型 主任务 🥇 AVERT: Audio-Verified Adjudication for Spoken Dialogue… 7.6 前25% 方法研究 #语音识别 🥈 Hearing the Whispers: Black-Box Membership Inference… 7.5 前25% 方法研究 #语音合成 🥉 The Missing Temporal Link: Temporal Context Routing… 7.5 前25% 方法研究 #音视频生成 4. VibeVoice-ASR-Streaming Technical Report 7.5 前25% 系统技术报告 #语音识别 5. A Common Measure of Communication for Speech Brain… 7.4 前50% 方法研究 #语音识别 6. SonicCaps: Large-Scale Diverse and Fine-Grained… 7.2 前50% 数据集与基准 #音频检索 7. Understanding Automatic Mixing: A Subtask-Oriented… 7.0 前50% 应用研究 #音乐生成 8. Scalable Direction-Following TTS via Voice Impression… 6.8 前50% 方法研究 #语音合成 9. Efficient Passive Acoustic Monitoring of Killer Whales… 6.7 前50% 应用研究 #音频分类 10. Auditory Illusion Benchmark for Large Audio Language… 6.4 前50% 数据集与基准 #音频理解 11. ARFT: A Synchronized Multimodal RF-Acoustic Dataset… 6.4 前50% 数据集与基准 #声源定位 12. Sensing Bone-Conducted Speech with Earbuds 6.3 前50% 应用研究 #语音增强 13. PhoenixNest-Video: Evidence-Grounded Multimodal Agent… 6.3 前50% 方法研究 #音视频理解 14. SpeakPay: Domain-Adaptive LoRA Fine-Tuning of Whisper… 6.1 前50% 应用研究 #语音识别 15. Removing Speech, Keeping Activities: A Privacy… 5.9 前50% 应用研究 #音频分类 16. Choosing a PEFT Variant for Per-Patient Dysarthric ASR… 5.9 前50% 应用研究 #语音识别 17. VAANI Noise Event Dataset: A curated spontaneous… 5.8 前50% 数据集与基准 #语音识别 18. Predictors of Loneliness in Older Adults Using… 4.9 后 50% 应用研究 #语音情感识别 📋 论文列表 🥇 别让音频去写作,让它来验货:AVERT 对口语状态跟踪的裁决式修正 英文题目:AVERT: Audio-Verified Adjudication for Spoken Dialogue State Tracking ...

2026-09-03 · 更新于 2026-09-04 · 15 min · 3026 words

A Composable Evaluation System for Reproducible Omni-Modal Foundation Model Evaluation

📄 评测比模型更碎:用一套可组合的流水线让全模态分数可比、可复现 英文题目:A Composable Evaluation System for Reproducible Omni-Modal Foundation Model Evaluation 一句话:面对文本、图像、视频、音频四模态评测工具链互不兼容导致的分数不可比与复现难,OmniEvaluator 以统一中间模式将推理与评测解耦为可组合流水线,并以产物钉扎与轻量 CPU 验证器在跨引擎与跨提示下把分数波动从数十点压到数点,代价是验证器仅判文本语义且落后最强闭源裁判约 5 点。 标签:#多模态模型 | #模型评估 | #基准测试 评分:8.3/10 | 创新 1.3/2 | 技术严谨 1.1/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 1.5/1.5 | 可复现 0.4/0.5 | 工程/实践 1.3/1.5 👥 作者与机构 Hodong Lee:NAVER Cloud AI;Korea University Sanghee Park:NAVER Cloud AI;KAIST AI Dohoon Ryu:NAVER Cloud AI Jungwhan Kim:NAVER Cloud AI Junyeob Kim:Seoul National University Soyoon Kim:NAVER Cloud AI Geewook Kim:NAVER Cloud AI;KAIST AI 💬 毒舌点评 用统一中间模式把 4 类推理后端与 4 个评测框架打通,将 N×M pairwise 集成降至 N+M,并用产物钉扎与轻量 CPU 验证器解决分数不可比与复现难的工程痛点,思路务实且已在 HyperCLOVA X 8B Omni 研发中落地。代价是贡献偏系统整合而非建模突破,验证器仅做文本三元组二分类、准确率 85.0 仍落后最强闭源裁判约 5 个点,对视觉 grounding、音频质量与多模态生成等非文本维度无能为力。 ...

2026-09-02 · 更新于 2026-09-04 · 7 min · 1426 words

Heard but Not Heeded: Paralinguistic Information Encoding and Loss in Audio-Language Models

📄 听见了却不听从:音频大模型在编码器里记住语气,在解码器里忘记语气 英文题目:Heard but Not Heeded: Paralinguistic Information Encoding and Loss in Audio-Language Models 一句话:论文用四段式贯穿分析追踪副语言信息从编码器到输出的演化,发现所有模型在编码器顶层都能以 82% 至 85% 线性探测到说话风格,却在输出端跌至 19.7% 至 53.7%,并用泄露度量与梯度反转实验说明这是训练目标导致的系统性利用失败而非编码失败。 标签:#语音情感识别 | #多模态模型 | #可解释性 | #模型评估 评分:6.0/10 | 创新 1.4/2 | 技术严谨 1.2/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.4/1.5 👥 作者与机构 Bhuvan Koduru:Language Technologies Institute;Carnegie Mellon University Dareen Safar B Alharthi:Language Technologies Institute;Carnegie Mellon University Rita Singh:Language Technologies Institute;Carnegie Mellon University Bhiksha Raj:Language Technologies Institute;Carnegie Mellon University 💬 毒舌点评 亮点在于用中心化核对齐(Centered Kernel Alignment, CKA)与线性探测(Linear Probing)的解离现象干净地揭示了“编码强、利用弱”的结构性鸿沟,并以训练目标作为解释变量给出可信的对照线索。短板是全篇建立在 Expresso 的 4 个说话人、7 类风格的封闭受控集上,外推性存疑,且梯度反转层(Gradient Reversal Layer, GRL)干预仅在单线性投影器上做最小化验证,离真正可用的解耦训练还很远,输出评估依赖关键词映射的启发式分桶也引入了额外噪声。 ...

2026-09-02 · 更新于 2026-09-04 · 8 min · 1613 words

TEIDAN: A Multilingual Multiparty Dialogue Corpus

📄 三个人怎么把话说完:TEIDAN 用统一的停顿尺子量出日英对话的节奏差 英文题目:TEIDAN: A Multilingual Multiparty Dialogue Corpus 一句话:TEIDAN 用三人围桌开放讨论与 200 毫秒为界的间歇单元统一采集日英多模态对话,通过过滤回馈后的伪轮次统计揭示英语长段陈述与日语增量协同的节奏分化,但受限于熟人度混淆与不足十小时的规模而只能作描述性对照。 标签:#多模态模型 | #多语言 | #数据集 评分:5.1/10 | 创新 1.2/2 | 技术严谨 0.8/1.5 | 实验充分 0.6/1.5 | 清晰度 0.7/1 | 影响力 0.7/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5 👥 作者与机构 Taiga Mori:Graduate School of Informatics, Kyoto University, Japan Koji Inoue:Graduate School of Informatics, Kyoto University, Japan Mikey Elmers:Graduate School of Informatics, Kyoto University, Japan Divesh Lala:Graduate School of Informatics, Kyoto University, Japan Tatsuya Kawahara:Graduate School of Informatics, Kyoto University, Japan 💬 毒舌点评 贡献在于首次以统一协议把自然三人围桌讨论做成可跨日英对照的多模态语料,并沿用 Corpus of Spontaneous Japanese(CSJ)的间歇单元(Inter-Pausal Unit,IPU,≥200 ms 静音为界)实现时间对齐转写,对多方轮替与指称研究确有填空价值;硬伤是总量仅 9 小时 46 分 57 秒、69 个会话,且跨语言对照在熟人-陌生人、话题数与会话时长上完全混淆,却仍做日英定量对比,尚未开放数据与基线模型,离可复用基准尚有距离。 ...

2026-09-02 · 更新于 2026-09-04 · 4 min · 777 words

TimeSteer: Inference-Time Speech Scheduling in Joint Audio-Visual Diffusion Models

📄 掐点说话:TimeSteer 把联合音视频扩散模型的隐式时间搬到明处 英文题目:TimeSteer: Inference-Time Speech Scheduling in Joint Audio-Visual Diffusion Models 一句话:针对联合音视频扩散模型只管说什么不管何时说的问题,TimeSteer 在推理时用时序敏感注意力头定位源区间并用分区读图在预测干净隐空间搬运内容,在 SpeechShift 上将 HR0.2 提升 2 倍以上而 WER 与画质几乎不掉,代价仅为每步一次无梯度前向。 标签:#音视频生成 | #扩散模型 | #语音合成 | #多模态模型 评分:7.2/10 | 创新 1.6/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.1/1.5 👥 作者与机构 Chao Zhou:机构信息未在 arXiv HTML 中可靠披露 Yiling Chen:机构信息未在 arXiv HTML 中可靠披露 Qi Chu:机构信息未在 arXiv HTML 中可靠披露 Tao Gong:机构信息未在 arXiv HTML 中可靠披露 Nenghai Yu:机构信息未在 arXiv HTML 中可靠披露 Tianyi We:机构信息未在 arXiv HTML 中可靠披露 💬 毒舌点评 亮点在于把联合音视频扩散模型中隐含的时序结构显式化为可编辑的目标到源读图映射,无需训练即可把语音精确塞进任意区间,思路干净且在 LTX-2 与 daVinci-MagiHuman 两个异构骨干上均有效。短板是所有证据仍困在 5 秒短片段与 8 步蒸馏采样器内,对长时多轮对话、真实语速自然度以及口型同步的人工主观评估几乎空白,承诺开源的 SpeechShift 与代码尚未兑现也削弱了可验证性。 ...

2026-09-02 · 更新于 2026-09-04 · 9 min · 1803 words

Zero-Shot Respiratory Sound Classification through LLM-Augmented Audio-Text Alignment

📄 没有配对报告时,如何让呼吸声自己找到临床语义? 英文题目:Zero-Shot Respiratory Sound Classification through LLM-Augmented Audio-Text Alignment 一句话:REACH 用 GPT-4 把离散元数据蒸馏为结构化报告来锚定冻结的 MedSigLIP 文本空间,并以 Sigmoid 对比损失加掩码重建与第 10 远负采样对齐呼吸音编码器,在 9 任务上实现 61.3% 零样本 AUC 的同时把线性探测推至 71.6%,代价是细粒度分级仍近随机且依赖合成文本的措辞稳定性。 标签:#音频分类 | #对比学习 | #自监督学习 | #多模态模型 评分:7.8/10 | 创新 1.5/2 | 技术严谨 1.3/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 1/1.5 | 可复现 0.1/0.5 | 工程/实践 1/1.5 👥 作者与机构 Mustafa Talha İlerisoy:机构信息未在 arXiv HTML 中可靠披露 Hung Manh Pham:机构信息未在 arXiv HTML 中可靠披露 Mathias Funk:机构信息未在 arXiv HTML 中可靠披露 Mykola Pechenizkiy:机构信息未在 arXiv HTML 中可靠披露 Aaqib Saeed:机构信息未在 arXiv HTML 中可靠披露 💬 毒舌点评 用冻结的 MedSigLIP 文本空间作锚点、以 GPT-4 把离散元数据蒸馏为 2-3 行标准化报告来填补呼吸音音频-报告配对真空,并用 SigLIP 损失加掩码重建正则与 FAISS 第 10 远负采样来防止对齐崩塌,思路干净且在 9 任务上把零样本从通用模型的 51% 拉到 61% 可用区间。短板是所谓零样本高度依赖合成报告的措辞与 prompt 模板,相似度采样与温度等关键超参不透明,且 T3 Covid 咳嗽 51.3% 与 T9 五级 COPD 分级 52.1% 仍近随机,平均数掩盖了细粒度任务的失效,宣称的通用临床零样本能力被高估。 ...

2026-09-02 · 更新于 2026-09-04 · 6 min · 1252 words

语音/音乐/音频论文速递 2026-09-02

语音/音乐/音频论文速递 2026-09-02 共分析 23 篇论文 ⚡ 今日概览 ✅ 筛选入选 23 篇 → 🔬 深度分析完成 🏷️ 热门方向 方向 数量 分布 #音频分类 3 篇 ███ #多模态模型 2 篇 ██ #语音合成 2 篇 ██ #语音增强 2 篇 ██ #语音情感识别 2 篇 ██ #音频分离 2 篇 ██ #语音交互 1 篇 █ #语音伪造检测 1 篇 █ 📊 论文评分排行榜(23 篇,按分数降序) 排名 论文 总分 分档 文档类型 主任务 🥇 BiMTokenizer: Preserving Semantic-Acoustic Balance in… 8.3 前25% 方法研究 #语音编码 🥈 A Composable Evaluation System for Reproducible Omni… 8.3 前25% 系统技术报告 #多模态模型 🥉 Phrase-Localized Language-Contrastive Guidance… 8.2 前25% 方法研究 #语音合成 4. Zero-Shot Respiratory Sound Classification through LLM… 7.8 前25% 方法研究 #音频分类 5. A Unified Uncertainty-Aware Back-End for Speaker… 7.8 前25% 方法研究 #说话人验证 6. ABSE-NET: A Lightweight Neural Model for Active… 7.5 前25% 方法研究 #语音增强 7. TUTTI: Toward generalizable audio-to-score… 7.4 前50% 方法研究 #音乐转录 8. Perceptible or Not? Diagnosing Passive Fingerprints… 7.4 前50% 方法研究 #语音伪造检测 9. Ready to Speak: Aligning LLMs for TTS-Friendly Text… 7.4 前50% 方法研究 #语音合成 10. On the Human and Computer Alignment of Attribute-Based… 7.3 前50% 数据集与基准 #音乐检索 11. TimeSteer: Inference-Time Speech Scheduling in Joint… 7.2 前50% 方法研究 #音视频生成 12. VoiceLongMemEval: Do Assistants Remember How You… 7.1 前50% 数据集与基准 #语音情感识别 13. Cleaner Speech, Weaker Generalization: Revisiting Pitt… 7.0 前50% 数据集与基准 #音频分类 14. TAG-Bench: Benchmarking Temporal Audio Grounding in… 6.9 前50% 数据集与基准 #音频理解 15. Artificial Rosetta Stone: Constrained Maximum A… 6.8 前50% 方法研究 #音乐理解 16. XVAE-WMT: Explainable Wavelet-Temporal Variational… 6.6 前50% 方法研究 #音频分离 17. U-PAST: A Phase-Aware Audio Spectrogram Transformer-U… 6.4 前50% 方法研究 #语音增强 18. Conversation Coach: A Voice-enabled AI System that… 6.3 前50% 系统技术报告 #语音交互 19. Soft Posterior Speaker Injection for Multi-Talker… 6.2 前50% 方法研究 #语音识别 20. Heard but Not Heeded: Paralinguistic Information… 6.0 前50% 方法研究 #语音情感识别 21. Ontology-based Target Sound Extraction 5.7 前50% 方法研究 #音频分离 22. MADS: A Multiview Acoustic Descriptor Set Beyond… 5.7 前50% 方法研究 #音频分类 23. TEIDAN: A Multilingual Multiparty Dialogue Corpus 5.1 后 50% 数据集与基准 #多模态模型 📋 论文列表 🥇 单塔为何还能赢双塔:BiMTokenizer 用双向状态与固定格点重做 1.1 kbps 的语义-声学平衡 英文题目:BiMTokenizer: Preserving Semantic-Acoustic Balance in Low-Bitrate Speech Tokenization via Bidirectional State-Space Modeling ...

2026-09-02 · 更新于 2026-09-04 · 24 min · 4954 words

ImageEval 2026: Culturally Grounded Arabic Multimodal Evaluation

📄 当模型听得懂阿拉伯语,却看不懂阿拉伯文化:ImageEval 2026 的三重拷问 英文题目:ImageEval 2026: Culturally Grounded Arabic Multimodal Evaluation 一句话:ImageEval 2026 把口语视觉问答、对比式幻觉检测与参考图锚定的文生图文化评分放进同一阿英双语基准,用合成到真人的语音域偏移和五档 caption 梯度撕开现有模型的文化盲区,却也暴露了小样本与结构先验可被利用的代价。 标签:#语音识别 #多模态模型 #基准测试 #多语言 评分:8.1/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 1/1.5 | 清晰度 0.9/1 | 影响力 1/1.5 | 开源 1.5/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5 👥 作者与机构 Samir Abdaljalil:Texas A&M University Hunzalah Hassan Bhatti:Qatar Computing Research Institute, Qatar Ahlam Bashiti:Birzeit University, Palestine Farina Amir:Hamad Bin Khalifa University, Qatar Md Arid Hasan:University of Toronto, Canada Basel Mousi:Qatar Computing Research Institute, Qatar Nadir Durrani:Qatar Computing Research Institute, Qatar Fahim Dalvi:Qatar Computing Research Institute, Qatar Zien Sheikh Ali:Qatar Computing Research Institute, Qatar Erchin Serpedin:Texas A&M University Hasan Kurban:Hamad Bin Khalifa University, Qatar Mustafa Jarrar:Hamad Bin Khalifa University, Qatar Shammur Absar Chowdhury:Qatar Computing Research Institute, Qatar Firoj Alam:Qatar Computing Research Institute, Qatar 💬 毒舌点评 亮点在于把阿拉伯语口语视觉问答(Spoken VQA)、幻觉检测与文化敏感的文生图评测打包成统一双语基准,并用真实人声测试集撕开了合成语音训练的遮羞布。短板是 CRAI-Bench 仅用 40 张参考图和单一生成模型,却让标题版本号这种结构先验就能刷到第一,文化评估的视觉 grounding 几乎被架空。 ...

2026-09-01 · 更新于 2026-09-04 · 7 min · 1395 words

Multimodal Adaptive Expert Selection with Text Routing and Ordinal Prototype Optimization for Sentiment Analysis

📄 当文字当指挥:MAESTRO 如何让声画专家按序就位 英文题目:Multimodal Adaptive Expert Selection with Text Routing and Ordinal Prototype Optimization for Sentiment Analysis 一句话:针对静态融合难以处理讽刺等语义冲突与情感强度有序性被忽略的问题,MAESTRO 以文本为指挥动态调度声画专家并用序数原型对比塑造有序隐空间,在 CMU-MOSI 上取得 Acc-7 49.42% 与 MAE 0.689 的领先,同时引入稀疏路由与额外对比开销。 标签:#音视频理解 #对比学习 #多模态模型 评分:6.0/10 | 创新 1.4/2 | 技术严谨 1.2/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 0.5/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5 👥 作者与机构 Xiaode Chen:Jianghan University, Wuhan, China Jiakang Yu:Jianghan University, Wuhan, China Hongtao Deng:Jianghan University, Wuhan, China Huina Qu:Jianghan University, Wuhan, China Xun Zhu:Jianghan University, Wuhan, China Yinxia Lou:Jianghan University, Wuhan, China 💬 毒舌点评 用文本当指挥棒来调度音视频专家的比喻很形象,序数原型对比对回归误差的针对性也到位,在 MOSI 上把 7 分类从 47.08 拉到 49.42、MAE 压到 0.689 算是硬提升。但原型靠批次内现算、类别缺失就跳过,小批量下估计方差必然抖;全程只在两个英语视频数据集上刷分,没给方差、显著性检验,也没测文本噪声或缺失时指挥失灵的后果,且零代码零权重,复现只能靠猜。 ...

2026-09-01 · 更新于 2026-09-04 · 6 min · 1175 words