论文解读

冻住大模型做共情对话:用语义情绪解耦把文本共情搬到语音

针对共情语音指令数据稀缺与微调大模型易遗忘问题,论文用冻结大模型加语义适配器与情绪抽取器的解耦编码与三阶段对齐,仅用现有语音指令与情绪识别数据实现共情理解与富有表现力语音生成,在共情对话与情绪识别等任务上报告更强结果,但情绪标签随机指派与韵律监督仍有边界。

 · 更新于 2026-09-24 · 约 20 分钟 · 9741 字 阅读 →
论文解读

先保证译对再求快:用分层奖励纠正合成轨迹的无界语音同传

针对无界语音同传中合成读-写轨迹不准的问题,该工作用分层策略优化在质量达标后才优化延迟,在 1.5 秒延迟附近报告超过 +7 COMET 和 +1.25 MetricX 的提升,但 BLEU 与独立评测显示神经奖励仍有投机风险。

 · 更新于 2026-09-24 · 约 20 分钟 · 9604 字 阅读 →
论文解读

先转准再压短:Qwen3 级联字幕如何在时间戳不动下满足中文字幕行数与语速

该工作用流式语音识别加文本预处理加机器翻译加两阶段大模型压缩的级联管线做英译中自动字幕,在开发集上以压缩换合规并略微改善 SubER,而代价是保留时间戳不动且依赖确定性改写与人工规则阈值。

 · 更新于 2026-09-24 · 约 18 分钟 · 8868 字 阅读 →
论文解读

长音频无切分条件下用两遍转写与语义合并压住幻觉的级联语音翻译

针对长时无切分英文到中文与德文离线语音翻译,论文采用 Silero VAD 加两遍转写与 150 词元语义合并的 Qwen3 级联路线,在 tst-2022 上报告 En-Zh COMET 0.8462 与 En-De 0.7854,最强证据来自两遍转写把 WER 压到 3.01%,代价是多模型串行推理与重分段计算开销。

 · 更新于 2026-09-24 · 约 19 分钟 · 9028 字 阅读 →
论文解读

多轮修音不推倒重来:用大模型定方向、用听觉优化守住上一轮

针对一次指令只给一个预设、无法在已有参数上连续修改的问题,论文用大语言模型做效果选择与初始化、再用 CLAP 引导的优化做原地微调,在 SocialFX 均衡器词对上 10 组中有 9 组的最大均值差异低于重提词基线,但非可微效果与长时间优化仍不稳定且每轮需要秒级计算。

 · 更新于 2026-09-24 · 约 18 分钟 · 8855 字 阅读 →
每日研究速递

iwslt-2026 论文深度解读

共收录 38 篇 iwslt-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 80 分钟 · 39666 字 阅读 →
论文解读

以文本为锚、让停顿和拖长显形:LAPE 如何统一转写与融合做阿尔茨海默语音检测

针对看图说话中词汇语义与发音 timing 互补但贡献不均的问题,LAPE 以大语言模型文本表示为锚,把停顿与拖长写进转写并做事件保持组块与门控融合,在 ADReSS 与 ADReSSo 的五折与留一被试评估中均取得最高准确率,代价是依赖词时间戳与多路语音特征的完整流水线。

 · 更新于 2026-09-24 · 约 9 分钟 · 4186 字 阅读 →
论文解读

声纹不可靠时如何认语言:声学嵌入与转写推理的互补验证

针对同一说话人说多种语言导致声纹捷径失效的问题,该系统用声学分类器加语音大模型加零样本音位模型做识别、用双转写加推理大模型做验证,开发集识别 95.2% 宏准确率与验证 0.90% 等错误率,评估集为 96.78% 与 3.06%,但开发到评估存在明显落差且融合参数依赖开发集估计。

 · 更新于 2026-09-24 · 约 22 分钟 · 10563 字 阅读 →
论文解读

重构保真与可预测难以兼得:用未来预测与语义对齐重塑音频编码器

针对重构训练的编码器与自回归语言模型目标不一致导致词元难学的问题,论文用未来词元预测与语义对齐改造编码器,在 SALMon 上报告 61.6% 准确率与 35 倍困惑度下降,同时语音 Mel 距离改善 5.0%,代价是需要配对文本与额外训练开销。

 · 更新于 2026-09-24 · 约 19 分钟 · 9505 字 阅读 →
论文解读

把对齐改成填空:一次填完长语音时间戳的槽位方案

针对多语长语音中逐帧搜索易累积系统性偏移的问题,该文把强制对齐改成在文本中插入时间槽并分类预测离散时间索引,报告在伪标签与人工标注上平均累积偏移大幅下降,代价是模型更大且实时因子略升、人工验证仅覆盖中文。

 · 更新于 2026-09-24 · 约 19 分钟 · 9165 字 阅读 →
论文解读

先标出不流利词,再让大模型学会不说:三语语音纠错的对比调优

针对印地语、孟加拉语、马拉地语语音转写中填充词与重复修复残留问题,论文用 MuRIL 词级标记引导指令微调并以对比损失惩罚复现不流利词,在人工校对与真实口语两类测试上取得一致提升,但真实集规模小且仅验证 3B 量级模型。

 · 更新于 2026-09-24 · 约 19 分钟 · 9477 字 阅读 →
论文解读

用黑盒发射策略把离线大模型压成同传:Parakeet 加 Qwen 的级联取舍

该工作用 Parakeet 做流式识别、Qwen 3.5 做流式翻译并以黑盒前缀策略控制提交时机,在 MCIF 长语音上以高延迟配置换质量、低延迟用掩码重翻译补足,并用词表增强与检索示例做上下文轨道,代价是更宽松策略会带来可测的质量回落与闪烁。

 · 更新于 2026-09-24 · 约 19 分钟 · 9109 字 阅读 →
论文解读

用双模识别稳住部分音频,再让大模型翻译:NeMo 级联同传如何兼顾延迟与质量

该工作用双模统一识别器做流式转写加多语言大模型做翻译的级联路线,在英德英意英中和捷英四个方向上以统一模型覆盖高低延迟档,最强证据是低延迟下统一模型转写与翻译质量优于缓冲与缓存感知基线,代价是中文等语序重排方向需缩小块并提前结束以控延迟。

 · 更新于 2026-09-24 · 约 16 分钟 · 7887 字 阅读 →
每日研究速递

odyssey-2026 论文深度解读

共收录 52 篇 odyssey-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 108 分钟 · 53865 字 阅读 →
论文解读

从等词输出到译员式取舍:用四种显式动作重做同声传译

论文把同传从读写时机控制改成包含切句、删除、压缩与代词化的动作选择,用统计感知的逐步提示在英中、英德、英日上同时改善语义与单调性延迟,但文本实验与启发式充分性检查仍留下语音端到端的待验证缺口。

 · 更新于 2026-09-24 · 约 17 分钟 · 8164 字 阅读 →
论文解读

先对齐再翻译:S2ST-Omni 用分层语言感知桥接语音与大模型

S2ST-Omni 把多语语音到语音翻译拆成高精度语音到文本前端加可插拔语音合成后端,用先局部后全局的混合适配器和声学加语言两级源语言感知提升翻译,在 CVSS-C 法德西到英上取得平均 BLEU 35.67 的报告最好结果,代价是依赖大骨干与可靠语言标识且只验证了三对高资源方向。

 · 更新于 2026-09-24 · 约 20 分钟 · 9617 字 阅读 →
论文解读

先定情绪再说话:Self-EmoQ 把情绪当作可规划的动作

针对流式语音对话必须在文本生成前给出情绪条件的问题,Self-EmoQ 用话语级马尔可夫决策过程加模仿奖励与普鲁契克理论奖励学习情绪规划器,四个对话数据集上报告了情绪排序与回复质量的提升,代价是依赖大模型打分与离散情绪集合。

 · 更新于 2026-09-24 · 约 19 分钟 · 9038 字 阅读 →
论文解读

笑声不止于好笑:把视频转成文字再让专家模型分工推理

论文用文本化多模态线索统一笑声检测、类型分类与原因解释,并以笑声自指令扩充与混合笑声专家提升泛化,主证据是文本大模型在三任务上优于音视频大模型,代价是依赖外部抽取器与伪标签校对。

 · 更新于 2026-09-24 · 约 19 分钟 · 9370 字 阅读 →
论文解读

双假设迟融合:在语言空间里让听觉与视觉各自举证再裁决

针对噪声下单流纠错被音频质量卡住的问题,论文用独立 ASR 与 VSR 双路 N-best 假设加可靠性提示词做语言空间组合,在 LRS2 上把基线相对误差降低约一半,代价是依赖上下游识别头质量并增加大模型串行纠错开销。

 · 更新于 2026-09-24 · 约 19 分钟 · 9036 字 阅读 →
论文解读

不用先分离也能听清目标人:以参考语音作声纹提示的统一识别

针对多人重叠时只转写目标说话人并在目标缺席时拒识的问题,该报告用参考语音拼接混合语音加文本提示的端到端大语言模型方案,在合成与真实会议集上报告了目标说话人词错率下降,同时保留单人识别与空文本拒识能力,但拒识率与误拒之间仍需权衡。

 · 更新于 2026-09-24 · 约 20 分钟 · 9660 字 阅读 →