论文解读

长语音同传评测为何卡在切句与时间戳:一条可复现的三段式流水线

针对长时连续语音到语音同传难以复现评测的问题,论文用目标端语音识别加强制对齐恢复词级时间戳、再用句嵌入对齐切分到源语句组的方法,在约 10 分钟与约 45 秒两类语音上验证可行,并报告延迟随输入变长而累积的主要代价。

 · 更新于 2026-09-24 · 约 21 分钟 · 10263 字 阅读 →
论文解读

无菌环境下不敢动手:语音多智能体如何接管手术室设备控制与延迟

针对无菌手术室中多设备协调控制难与语音交互延迟高的问题,论文提出分层语音流水线加智能体核心的 SurgicalRoomAgent,用 KV 缓存预热、流式提前执行与渐进式提示披露降低延迟与上下文压力,但所报告的延迟数字为理论估计且缺乏大规模临床验证。

 · 更新于 2026-09-24 · 约 18 分钟 · 8706 字 阅读 →
每日研究速递

aaai-2026 论文深度解读

共收录 147 篇 aaai-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 307 分钟 · 153423 字 阅读 →
每日研究速递

acl-2026 论文深度解读

共收录 199 篇 acl-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 433 分钟 · 216709 字 阅读 →
论文解读

没有交叉注意力时如何做 AlignAtt:把源文钉在提示词里再重算对齐块

论文把英语语音同传拆成 Qwen3 语音识别加强制对齐与 Gemma-4 解码器翻译的同步级联,用显式源文区间加离线挑选的 8 个对齐头加 qk-fast 重算实现解码器侧 AlignAtt,在英德和英意低延迟约 2 秒与高延迟 4 秒内超过主办方基线,代价是中文方向不稳定且全头重算会明显抬高计算感知延迟。

 · 更新于 2026-09-24 · 约 20 分钟 · 9819 字 阅读 →
论文解读

鸡尾酒会里看口型说话:AV-Dialog 如何同时听清、看准接话时机

AV-Dialog 针对多人干扰下跟丢目标说话人与抢话时机错乱问题,用声学码加唇部视觉做流式理解与轮次预测,在干扰下把轮次预测准确率从 54% 提升到 79%,代价是双模型并行与视觉前视带来的额外延迟与显存开销。

 · 更新于 2026-09-24 · 约 20 分钟 · 9965 字 阅读 →
论文解读

把等待学进模型里:用原生音频大模型做无切分同声传译

针对无句子边界的长音频与计算感知延迟限制,用冻结音频编码器的 Qwen3-Omni-30B-A3B 只训练语言侧 LoRA 并以内化的``策略做读写决策,在官方开发集低延迟档取得英中 40.5 BLEU 与英德 27.7 BLEU,代价是依赖合成目标与固定块推理的折中。

 · 更新于 2026-09-24 · 约 17 分钟 · 8210 字 阅读 →
论文解读

边想边说不断流:用播放掩蔽保连续,用四重约束修原子性

针对先想后说首音等待过长而边想边说又破坏思维块原子性的矛盾,论文用流式掩蔽机制保证音频不欠载、用原子一致性修复重建逻辑因果,在 VoiceBench 上从 67.24 提升到 73.41 的同时把首次音频延迟从 20.35s 降到 3.65s、实时率从 7.04 降到 1.05,代价是依赖外部教师模型打分且复杂混合推理仍与串行思考存在小幅差距。

 · 更新于 2026-09-24 · 约 20 分钟 · 9547 字 阅读 →
论文解读

先保证译对再求快:用分层奖励纠正合成轨迹的无界语音同传

针对无界语音同传中合成读-写轨迹不准的问题,该工作用分层策略优化在质量达标后才优化延迟,在 1.5 秒延迟附近报告超过 +7 COMET 和 +1.25 MetricX 的提升,但 BLEU 与独立评测显示神经奖励仍有投机风险。

 · 更新于 2026-09-24 · 约 20 分钟 · 9604 字 阅读 →
论文解读

先转准再压短:Qwen3 级联字幕如何在时间戳不动下满足中文字幕行数与语速

该工作用流式语音识别加文本预处理加机器翻译加两阶段大模型压缩的级联管线做英译中自动字幕,在开发集上以压缩换合规并略微改善 SubER,而代价是保留时间戳不动且依赖确定性改写与人工规则阈值。

 · 更新于 2026-09-24 · 约 18 分钟 · 8868 字 阅读 →
每日研究速递

iwslt-2026 论文深度解读

共收录 38 篇 iwslt-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 80 分钟 · 39666 字 阅读 →
论文解读

少即是多:轮次结束主要靠声音和韵律,而非文本语义

论文用同一轻量三流分类器穷举声学、韵律、文本七种组合,发现声学加韵律在相同训练下取得最平衡的准确与延迟,而加入文本只增加抢话误报且不能提升性能。

 · 更新于 2026-09-24 · 约 17 分钟 · 8308 字 阅读 →
论文解读

标注起点系统性偏早时,如何量出语音检测的真实反应速度

论文把带噪标注起点建模为真实起点加偏移并用期望最大化估计数据集级均值来校正起始偏差,同时用对角状态空间模型 S4VAD 实现流式低延迟检测,在合成朗读混合与真实电影语音上报告了更低的起始偏差与延迟分布尾部,但结论依赖参考模型质量与有界独立噪声等假设且本次无可用代码资源。

 · 更新于 2026-09-24 · 约 19 分钟 · 9291 字 阅读 →
论文解读

用黑盒发射策略把离线大模型压成同传:Parakeet 加 Qwen 的级联取舍

该工作用 Parakeet 做流式识别、Qwen 3.5 做流式翻译并以黑盒前缀策略控制提交时机,在 MCIF 长语音上以高延迟配置换质量、低延迟用掩码重翻译补足,并用词表增强与检索示例做上下文轨道,代价是更宽松策略会带来可测的质量回落与闪烁。

 · 更新于 2026-09-24 · 约 19 分钟 · 9109 字 阅读 →
论文解读

用双模识别稳住部分音频,再让大模型翻译:NeMo 级联同传如何兼顾延迟与质量

该工作用双模统一识别器做流式转写加多语言大模型做翻译的级联路线,在英德英意英中和捷英四个方向上以统一模型覆盖高低延迟档,最强证据是低延迟下统一模型转写与翻译质量优于缓冲与缓存感知基线,代价是中文等语序重排方向需缩小块并提前结束以控延迟。

 · 更新于 2026-09-24 · 约 16 分钟 · 7887 字 阅读 →
论文解读

长音频不等说完再译:Pinch-AST 用级联重翻译与噪声前缀训练换单卡实时

Pinch-AST 针对最长约 2.5 小时无切分音频同时翻译,用 Qwen3-ASR 加 Qwen3.5-4B 每语言对 LoRA 级联与字符级最长公共前缀只增发,在单张 H100 上报告 En→De、En→It、En→Zh 相对基线 XCOMET-XL 提升 4.1、5.7、2.6 分,代价是靠固定块重解码与前缀截断训练控制延迟。

 · 更新于 2026-09-24 · 约 15 分钟 · 7135 字 阅读 →
论文解读

从等词输出到译员式取舍:用四种显式动作重做同声传译

论文把同传从读写时机控制改成包含切句、删除、压缩与代词化的动作选择,用统计感知的逐步提示在英中、英德、英日上同时改善语义与单调性延迟,但文本实验与启发式充分性检查仍留下语音端到端的待验证缺口。

 · 更新于 2026-09-24 · 约 17 分钟 · 8164 字 阅读 →
论文解读

边听边想错了怎么办:RetroThinker 让语音大模型向前改错

针对流式语音大模型边听边推理容易出错且不能回滚重说的问题,RetroThinker 用三阶段事后反思微调让 Moshi 在文本内心独白中自验自改,在 TTS 版 GSM8K 上以相近延迟取得 11 个百分点的绝对准确率提升,代价是反思会先拉长推理链,需再用 Early Reasoning 和 LengthDPO 压回延迟。

 · 更新于 2026-09-24 · 约 20 分钟 · 9841 字 阅读 →
论文解读

流式音视频不同步、该不该开口难判断:ROMA 用对齐单元与说话头统一反应与主动

针对连续音视频流中被动问答与主动触发难以统一的问题,ROMA 用一秒多模态单元加分块时间位置编码与独立说话头做对齐与时机判断,在主动提醒与实时解说上报告最优并保持被动问答竞争力,代价是每秒决策粒度和有限上下文。

 · 更新于 2026-09-24 · 约 17 分钟 · 8355 字 阅读 →
论文解读

先定情绪再说话:Self-EmoQ 把情绪当作可规划的动作

针对流式语音对话必须在文本生成前给出情绪条件的问题,Self-EmoQ 用话语级马尔可夫决策过程加模仿奖励与普鲁契克理论奖励学习情绪规划器,四个对话数据集上报告了情绪排序与回复质量的提升,代价是依赖大模型打分与离散情绪集合。

 · 更新于 2026-09-24 · 约 19 分钟 · 9038 字 阅读 →