论文解读

Do Speech LLMs Learn Crossmodal Embedding Spaces?

音频检索 | 6.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4063 字 阅读 →
论文解读

Enhancing Dialogue-Related Speech Tasks with Generated Spoken Dialogues

语音对话系统 | 6.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4549 字 阅读 →
论文解读

Enhancing Speaker Verification with w2v-BERT 2.0 and Knowledge Distillation Guided Structured Pruning

说话人验证 | 7.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4903 字 阅读 →
论文解读

Evaluating Bias in Spoken Dialogue LLMs for Real-World Decisions and Recommendations

模型评估 | 7.0/10

 · 更新于 2026-09-25 · 约 8 分钟 · 3876 字 阅读 →
论文解读

Evaluating Emotion Recognition in Spoken Language Models on Emotionally Incongruent Speech

语音情感识别 | 7.5/10

 · 更新于 2026-09-25 · 约 7 分钟 · 3322 字 阅读 →
论文解读

Fine-Tuning Large Multimodal Models for Automatic Pronunciation Assessment

语音评估 | 7.0/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5097 字 阅读 →
论文解读

FinHuBERT: Hierarchical Feature Imitating Networks for Low-Resource Speech Recognition

语音识别 | 7.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4221 字 阅读 →
论文解读

FocalCodec-Stream: Streaming Low-Bitrate Speech Coding via Causal Distillation

语音编码 | 8.0/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5230 字 阅读 →
论文解读

Frame-Stacked Local Transformers for Efficient Multi-Codebook Speech Generation

语音合成 | 7.5/10

 · 更新于 2026-09-25 · 约 8 分钟 · 4005 字 阅读 →
论文解读

From Human Speech to Ocean Signals: Transferring Speech Large Models for Underwater Acoustic Target Recognition

水下声学目标识别 | 7.0/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4052 字 阅读 →
论文解读

Game-Time: Evaluating Temporal Dynamics in Spoken Language Models

语音对话系统 | 7.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4572 字 阅读 →
论文解读

Grey-Box Prompt Tuning With Graph Alignment for Speech-Language Models

语音识别 | 8.0/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5713 字 阅读 →
论文解读

Group Relative Policy Optimization for Text-to-Speech with Large Language Models

语音合成 | 8.0/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4330 字 阅读 →
论文解读

High-Fidelity Speech Enhancement Via Discrete Audio Tokens

语音增强 | 7.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4455 字 阅读 →
论文解读

Human-1 by Josh Talks: A Full-Duplex Conversational Modeling Framework in Hindi using Real-World Conversations

语音对话系统 | 7.5/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5611 字 阅读 →
会议任务专题

ICASSP 2026 - 语音大模型

共 3 篇 ICASSP 2026 语音大模型 方向论文

 · 更新于 2026-09-25 · 约 10 分钟 · 4676 字 阅读 →
论文解读

In-Sync: Adaptation of Speech Aware Large Language Models for ASR with Word level timestamp predictions

语音识别 | 7.0/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4573 字 阅读 →
论文解读

Leveraging Large Speech Language Models as Evaluators for Expressive Speech

语音情感识别 | 6.5/10

 · 更新于 2026-09-25 · 约 7 分钟 · 3233 字 阅读 →
论文解读

Leveraging Segment-Level Speech Representations for LLM-Based Speech Recognition

语音识别 | 7.0/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5225 字 阅读 →
论文解读

MI-Fuse: Label Fusion for Unsupervised Domain Adaptation with Closed-Source Large Audio-Language Model

语音情感识别 | 8.0/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4330 字 阅读 →