论文解读

Cooperative Multi-Agent Reinforcement Learning for Adaptive Aggregation in Semi-Supervised Federated Learning with non-IID Data

联邦学习 | 7.0/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4379 字 阅读 →
论文解读

EMORL-TTS: Reinforcement Learning for Fine-Grained Emotion Control in LLM-based TTS

语音合成 | 8.5/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5127 字 阅读 →
论文解读

Emotion-Aligned Generation in Diffusion Text to Speech Models Via Preference-Guided Optimization

语音合成 | 8.0/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4704 字 阅读 →
论文解读

EmoTri-RL: Emotion- and Cause-Aware Reinforcement Learning for Multi-Modal Empathetic Dialogue

语音情感识别 | 7.0/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4826 字 阅读 →
论文解读

Enhancing Audio Question-Answering Performance Through Log-Likelihood Guided Reward Functions

音频问答 | 8.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4398 字 阅读 →
论文解读

FlowSE-GRPO: Training Flow Matching Speech Enhancement via Online Reinforcement Learning

语音增强 | 7.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4353 字 阅读 →
论文解读

Group Relative Policy Optimization for Text-to-Speech with Large Language Models

语音合成 | 8.0/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4330 字 阅读 →
论文解读

MECap-R1: Emotion-Aware Policy with Reinforcement Learning for Multimodal Emotion Captioning

语音情感识别 | 7.5/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5068 字 阅读 →
论文解读

Medical ASR Enhancement by Domain-Specific Reinforcement Fine-Tuning

语音识别 | 6.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4017 字 阅读 →
论文解读

MR-FlowDPO: Multi-Reward Direct Preference Optimization for Flow-Matching Text-to-Music Generation

音乐生成 | 7.5/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5357 字 阅读 →
论文解读

Nemotron 3 Nano Omni: Efficient and Open Multimodal Intelligence

多模态模型 | 8.5/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6861 字 阅读 →
论文解读

No Verifiable Reward for Prosody: Toward Preference-Guided Prosody Learning in TTS

语音合成 | 8.0/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4301 字 阅读 →
论文解读

PAC: Pronunciation-Aware Contextualized Large Language Model-Based Automatic Speech Recognition

语音识别 | 7.0/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4114 字 阅读 →
论文解读

RAS: a Reliability Oriented Metric for Automatic Speech Recognition

语音识别 | 7.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4136 字 阅读 →
论文解读

RLBR: Reinforcement Learning with Biasing Rewards for Contextual Speech Large Language Models

语音识别 | 8.0/10

 · 更新于 2026-09-25 · 约 8 分钟 · 3657 字 阅读 →
论文解读

RRPO: Robust Reward Policy Optimization for LLM-Based Emotional TTS

语音合成 | 7.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4067 字 阅读 →
论文解读

Step-Audio-R1.5 Technical Report

语音对话系统 | 8.0/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4640 字 阅读 →
论文解读

SymphonyGen: 3D Hierarchical Orchestral Generation with Controllable Harmony Skeleton

音乐生成 | 7.5/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5548 字 阅读 →
论文解读

Text2midi-InferAlign: Improving Symbolic Music Generation with Inference-Time Alignment

音乐生成 | 7.5/10

 · 更新于 2026-09-25 · 约 8 分钟 · 3668 字 阅读 →
论文解读

ZSV2C-MLLM: Zero-Shot Visual Voice Cloning Via Multimodal Large Language Models

语音克隆 | 6.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4244 字 阅读 →