论文解读

SimulS2ST-Omni: Data-Efficient Streaming Speech-to-Speech Translation via Explicit Trajectory Supervision

语音翻译 | 7.3/10

 · 更新于 2026-09-24 · 约 15 分钟 · 7236 字 阅读 →
论文解读

When to Use Extra Context: Evidence-Grounded Terminology Adaptation for Simultaneous Speech Translation

语音翻译 | 6.7/10

 · 更新于 2026-09-24 · 约 13 分钟 · 6074 字 阅读 →
论文解读

X-Translator: A Real-Time Multilingual Speaker-Aware Speech-to-Speech Translation System

语音翻译 | 7.8/10

 · 更新于 2026-09-24 · 约 16 分钟 · 7793 字 阅读 →
论文解读

Do LLMs Need Architectural Changes for Simultaneous Speech Translation? A Prefix-to-Prefix Data Driven Approach

语音翻译 | 5.7/10

 · 更新于 2026-09-24 · 约 15 分钟 · 7514 字 阅读 →
论文解读

Gemma 4 Technical Report

语音识别 | 6.2/10

 · 更新于 2026-09-24 · 约 17 分钟 · 8126 字 阅读 →
论文解读

NAVER LABS System Re-implementation for the IWSLT 2026 Instruction-Following Task

语音翻译 | 6.4/10

 · 更新于 2026-09-24 · 约 12 分钟 · 5932 字 阅读 →
论文解读

Unified Audio Intelligence Without Regressing on Text Intelligence

音频交互 | 6.8/10

 · 更新于 2026-09-24 · 约 7 分钟 · 3294 字 阅读 →
论文解读

ProactiveLLM: Learning Active Interaction for Streaming Large Language Models

语音识别 | 7.2/10

 · 更新于 2026-09-24 · 约 8 分钟 · 3736 字 阅读 →
论文解读

Simultaneous Speech-to-Speech Translation Without Aligned Data

语音翻译 | 8/10

 · 更新于 2026-09-24 · 约 12 分钟 · 5628 字 阅读 →
论文解读

NAVER LABS Europe Submission to the Instruction-following 2026 Short Track

语音翻译 | 6.2/10

 · 更新于 2026-09-24 · 约 15 分钟 · 7251 字 阅读 →
论文解读

Preserving Speech-to-Text LLM Capabilities in Speech-to-Speech Generation

语音识别 | 7/10

 · 更新于 2026-09-24 · 约 6 分钟 · 2889 字 阅读 →
论文解读

GigaSpeechBench: A Real-World Multilingual Speech-to-Text Benchmark

语音识别 | 8.7/10

 · 更新于 2026-09-24 · 约 12 分钟 · 5725 字 阅读 →
论文解读

FBK's Long-form SpeechLLMs for IWSLT 2026 Instruction Following

语音识别 | 6.5/10

 · 更新于 2026-09-24 · 约 13 分钟 · 6105 字 阅读 →
论文解读

Does Translation-Enhanced Speech Encoder Pre-training Affect Speech LLMs?

语音识别 | 7.1/10

 · 更新于 2026-09-24 · 约 11 分钟 · 5097 字 阅读 →
论文解读

Evaluating Japanese Dialect Robustness Across Speech and Text-based Large Language Models

语音识别 | 5.8/10

 · 更新于 2026-09-24 · 约 10 分钟 · 4856 字 阅读 →
论文解读

STEB: A Speech-to-Speech Translation Expressiveness Benchmark for Evaluating Beyond Translation Fidelity

语音翻译 | 7.8/10

 · 更新于 2026-09-24 · 约 14 分钟 · 6956 字 阅读 →
论文解读

Measuring User's Mental Models of Speech Translation in Human-AI Collaboration

语音翻译 | 6.6/10

 · 更新于 2026-09-24 · 约 9 分钟 · 4502 字 阅读 →
论文解读

ESPnet3: Infrastructure for Scalable Speech and Audio Research in the Foundation Model Era

语音识别 | 7.5/10

 · 更新于 2026-09-24 · 约 23 分钟 · 11361 字 阅读 →
论文解读

Bridging the Usability Gap: Lessons from Interpreting Studies for Machine Interpreting Design

语音翻译 | 7.1/10

 · 更新于 2026-09-24 · 约 8 分钟 · 3574 字 阅读 →
论文解读

Leveraging Audio-LLMs to Filter Speech-to-Speech Training Data

语音翻译 | 8.4/10

 · 更新于 2026-09-24 · 约 13 分钟 · 6061 字 阅读 →