论文解读

GigaChat Audio: Time-aware Large Audio Language Model

音频理解 | 7.4/10

 · 更新于 2026-09-06 · 约 14 分钟 · 6899 字 阅读 →
论文解读

Graph Representation of RaagBase: A Unique Dataset for Hindustani Music

音乐理解 | 5.7/10

 · 更新于 2026-09-06 · 约 12 分钟 · 5708 字 阅读 →
论文解读

Hearing Like Humans? Sound Symbolism and Perceptual Alignment in Speech Language Models

多模态模型 | 6.1/10

 · 更新于 2026-09-06 · 约 25 分钟 · 12190 字 阅读 →
论文解读

Learn2Chat: Rethinking Dyadic Talking Heads via Interaction-Modulated Monologic Priors

音视频生成 | 6.8/10

 · 更新于 2026-09-06 · 约 13 分钟 · 6464 字 阅读 →
论文解读

LightMem-Ego: Your AI Memory for Everyday Life

流式处理 | 5.6/10

 · 更新于 2026-09-06 · 约 12 分钟 · 5925 字 阅读 →
论文解读

Listen to the Features: Voice Anonymization Driven by Content Embedding Matching over Signal Reconstruction

语音克隆 | 6.5/10

 · 更新于 2026-09-06 · 约 14 分钟 · 6792 字 阅读 →
论文解读

Local Multimodal Music Alignment from Global Supervision

对比学习 | 7.6/10

 · 更新于 2026-09-06 · 约 16 分钟 · 7732 字 阅读 →
论文解读

LOGOS: A Living Logic for AI Agent Teams That Evolve With Humans

多模态模型 | 6.1/10

 · 更新于 2026-09-06 · 约 21 分钟 · 10138 字 阅读 →
论文解读

MeloBottleneck: Self-Supervised Melody Skeleton Extraction with a Latent Subsequence Bottleneck

音乐理解 | 7.5/10

 · 更新于 2026-09-06 · 约 17 分钟 · 8118 字 阅读 →
论文解读

MRUF: Multi-granularity Routing with Uncertainty-Aware Fusion for Robust Multimodal Sentiment Analysis

多模态模型 | 5.9/10

 · 更新于 2026-09-06 · 约 18 分钟 · 8734 字 阅读 →
论文解读

MusicMark: A Robust Generative Watermarking Framework for Music Generation

音频水印 | 7.3/10

 · 更新于 2026-09-06 · 约 18 分钟 · 8863 字 阅读 →
论文解读

Omni-Decision: A Progressive Evidence-State Agent System for Omni-Modal QA

音频理解 | 5.9/10

 · 更新于 2026-09-06 · 约 16 分钟 · 7666 字 阅读 →
论文解读

PC-Mix: Partial-Component Audio Spoofing Detection under Mixed Speech and Environmental Sound Conditions

音频伪造检测 | 8.9/10

 · 更新于 2026-09-06 · 约 12 分钟 · 5825 字 阅读 →
论文解读

Perceived Annoyance in Multi-source Electric Vehicle AVAS Environments

音频质量评估 | 3.5/10

 · 更新于 2026-09-06 · 约 19 分钟 · 9113 字 阅读 →
论文解读

Qwen-Audio-VAE Technical Report

音频编码 | 7.7/10

 · 更新于 2026-09-06 · 约 17 分钟 · 8347 字 阅读 →
论文解读

Qwen-Music Technical Report

音乐生成 | 7.4/10

 · 更新于 2026-09-06 · 约 15 分钟 · 7232 字 阅读 →
论文解读

Semantic Sampling via Learnable Observation Front Ends

音频理解 | 5.1/10

 · 更新于 2026-09-06 · 约 17 分钟 · 8112 字 阅读 →
论文解读

Simple Features and Honest Calibration for Ambivalence and Hesitancy Recognition in Video

模型集成 | 9.0/10

 · 更新于 2026-09-06 · 约 14 分钟 · 6811 字 阅读 →
论文解读

Synchronized Three-Dimensional Vocal-Tract Motion for Speech Synchronization via Joint-Embedding Predictive Architecture Alignment

语音合成 | 5.7/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4932 字 阅读 →
论文解读

TabPFN beyond Tabular Data: Calibration and Accuracy on Multimodal Embeddings

音频分类 | 7.9/10

 · 更新于 2026-09-06 · 约 20 分钟 · 9587 字 阅读 →