论文解读

Hierarchical Tokenization of Multimodal Music Data for Generative Music Retrieval

音乐检索 | 7.0/10

 · 更新于 2026-09-24 · 约 10 分钟 · 4794 字 阅读 →
论文解读

HVAC-EAR: Eavesdropping Human Speech Using HVAC Systems

音频安全 | 8.5/10

 · 更新于 2026-09-24 · 约 11 分钟 · 5225 字 阅读 →
论文解读

Improving Anomalous Sound Detection with Attribute-Aware Representation from Domain-Adaptive Pre-Training

音频事件检测 | 8.0/10

 · 更新于 2026-09-24 · 约 11 分钟 · 5175 字 阅读 →
论文解读

Monitoring exposure-length variations in submarine power cables using distributed fiber-optic sensing

音频事件检测 | 6.5/10

 · 更新于 2026-09-24 · 约 7 分钟 · 3073 字 阅读 →
论文解读

Multimodal Fusion-Based IPCLIP Network for Mixed Reality Surgical Assistance

多模态模型 | 6.5/10

 · 更新于 2026-09-24 · 约 7 分钟 · 3263 字 阅读 →
论文解读

Natural Language to Spatial Audio Parameters: Lightweight Deterministic Rendering for Creative Authoring

空间音频 | 7.5/10

 · 更新于 2026-09-24 · 约 10 分钟 · 4737 字 阅读 →
论文解读

Peeking Into the Future for Contextual Biasing

语音识别 | 7.0/10

 · 更新于 2026-09-24 · 约 11 分钟 · 5086 字 阅读 →
论文解读

Phase-Space Signal Processing of Acoustic Data for Advanced Manufacturing In-Situ Monitoring

音频事件检测 | 7.0/10

 · 更新于 2026-09-24 · 约 7 分钟 · 3474 字 阅读 →
论文解读

Production-Scale Dynamic Vocabulary ASR Biasing with Word-Level FST and Robust Training

语音识别 | 7.5/10

 · 更新于 2026-09-24 · 约 8 分钟 · 3562 字 阅读 →
论文解读

RCAL: Reinforced Cross-Modal Alignment for Multimodal Sentiment Analysis with Sparse Visual Frames

多模态模型 | 8.5/10

 · 更新于 2026-09-24 · 约 10 分钟 · 4562 字 阅读 →
论文解读

Refgen: Reference-Guided Synthetic Data Generation for Anomalous Sound Detection

音频事件检测 | 7.5/10

 · 更新于 2026-09-24 · 约 8 分钟 · 3682 字 阅读 →
论文解读

Representation-Based Data Quality Audits for Audio

数据集 | 7.5/10

 · 更新于 2026-09-24 · 约 9 分钟 · 4054 字 阅读 →
论文解读

TextlessRAG: End-to-End Visual Document RAG by Speech without Text

语音问答 | 8.5/10

 · 更新于 2026-09-24 · 约 9 分钟 · 4218 字 阅读 →
论文解读

Toward Faithful Explanations in Acoustic Anomaly Detection

音频事件检测 | 7.5/10

 · 更新于 2026-09-24 · 约 8 分钟 · 3867 字 阅读 →
论文解读

MOMO: A framework for seamless physical, verbal, and graphical robot skill learning and adaptation

机器人技能学习 | 7.5/10

 · 更新于 2026-09-24 · 约 8 分钟 · 3742 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-04-25

共分析 2 篇语音/AI 论文

 · 更新于 2026-09-24 · 约 6 分钟 · 2986 字 阅读 →
论文解读

Deep Hierarchical Knowledge Loss for Fault Intensity Diagnosis

1. **要解决什么问题**:传统故障强度诊断方法将各类故障视为独立标签,忽略了物理状态之间固有的层次依赖关系(如“空化”是“初期空化”、“稳定空化”等的父类),这限制了模型的性能和鲁棒性。 2. **方法核心是什么**:提出一个名为DHK的通用框架,其核心是设计两个新的损失函数:**层次树损失

 · 更新于 2026-09-24 · 约 11 分钟 · 5217 字 阅读 →
论文解读

MOMO: A framework for seamless physical, verbal, and graphical robot skill learning and adaptation

1. **问题**:工业机器人需要频繁适应新任务和环境,但现有技能调整方法(如手动重编程)对非专家用户不友好,且单一交互模态无法高效处理所有类型的调整需求。 2. **方法核心**:提出MOMO框架,集成三种互补交互模态:动觉接触(用于精确空间修正)、自然语言(用于高层语义修改)和图形界面(用于参数

 · 更新于 2026-09-24 · 约 9 分钟 · 4373 字 阅读 →
论文解读

Disentangling Damage from Operational Variability: A Label-Free Self-Supervised Representation Learning Framework for Output-Only Structural Damage Identification

本文针对结构健康监测中损伤信号易被环境与操作变异掩盖的核心挑战,提出了一种**无标签、自监督的解缠表示学习框架**。该框架采用双流自编码器架构,通过**时间序列重构损失**确保信息完整性,并利用**VICReg自监督损失**(基于假设损伤状态不变的基线期数据)强制损伤敏感表征(`z_dmg`)对操作

 · 更新于 2026-09-24 · 约 11 分钟 · 5106 字 阅读 →
论文解读

MimicLM: Zero-Shot Voice Imitation through Autoregressive Modeling of Pseudo-Parallel Speech Corpora

这篇论文旨在解决零样本语音模仿任务中高质量平行训练数据稀缺的核心瓶颈。传统方法要么依赖复杂的解耦架构,要么使用合成语音作为训练目标,导致输出质量受限于合成系统的能力。作者提出了一种名为 **MimicLM** 的新框架,其核心创新在于**“角色交换”的数据构建策略**:使用TTS生成的语音作为**训

 · 更新于 2026-09-24 · 约 10 分钟 · 4878 字 阅读 →