每日研究速递

aaai-2026 论文深度解读

共收录 147 篇 aaai-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 307 分钟 · 153423 字 阅读 →
每日研究速递

acl-2026 论文深度解读

共收录 199 篇 acl-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 433 分钟 · 216709 字 阅读 →
论文解读

把 Transformer 换成 Mamba 做语音自监督:长语音更快,但双向扩展仍有代价

该文把 HuBERT 的 Transformer 层替换为 Mamba 做语音自监督预训练,在因果与长上下文语音识别上验证线性复杂度与更低计算量优势,并以音素纯度、典型相关分析和 SUPERB 探测说明表征特点,代价是 Base 尺寸双向 Mamba 整体探测分数落后于 Transformer。

 · 更新于 2026-09-24 · 约 20 分钟 · 9889 字 阅读 →
论文解读

用已确认的块把下一步拽回来:锚定循环如何抑制长序列符号音乐的误差累积

针对长序列符号音乐自回归生成中误差累积导致结构漂移的问题,论文提出先预测块级语义再重建音符细节并用已生成块回嵌为锚的循环范式与分草图细化的层次框架,最强证据是预测特征与真值余弦距离平均降低 34.7% 且长序列主客观评价接近真值,代价是钢琴卷表示压缩可能丢失细微时值与目前主要面向钢琴。

 · 更新于 2026-09-24 · 约 18 分钟 · 8791 字 阅读 →
论文解读

不只看文字:用时间轴重新定义音频章节切分

论文把音频章节切分从句子序列搬到时间轴上,对比文本加声学特征、纯音频 AudioSeg 与多模态大模型,报告 AudioSeg 在 YTSeg 上显著领先而停顿是最有效的手工特征,同时揭示长音频与多说话人下的衰减与评估不可比问题。

 · 更新于 2026-09-24 · 约 18 分钟 · 8745 字 阅读 →
论文解读

长语音不止读对字:SwanBench-Speech 如何拆开声学、语义与表现力来评测

针对长语音与对话生成的评测缺口,该工作构建 1101 样本、17 场景的 SwanBench-Speech 并提出 7 个解耦指标,用人类一致性验证支撑其发现的混响一致性与表现力层次短板,但高表现力场景与多说话人声场统一仍代价明显。

 · 更新于 2026-09-24 · 约 21 分钟 · 10134 字 阅读 →
论文解读

长会议听不懂也找不着:用多维图加计划智能体做可定位问答

针对长会议中声学线索缺失与上下文碎片化问题,论文把会议建成多维异构图并用计划执行反思智能体检索生成,在 LongAudioQA 三套数据上以语义准确率为证据取得领先,但迭代规划带来更高推理开销且依赖上游识别与说话人分离质量。

 · 更新于 2026-09-24 · 约 22 分钟 · 10529 字 阅读 →
论文解读

先把长语音变短再回答:用类文本表示搭桥的端到端语音检索器 CLSR

针对长语音问答中大音频语言模型难以直接处理十几分钟以上上下文的问题,论文提出先把语音转成类文本表示再做对比检索的 CLSR,用四个数据集的召回对照和长文问答的抽取验证支撑该路线,并以联合训练三项损失与冻结文本编码器为代价。

 · 更新于 2026-09-24 · 约 20 分钟 · 9797 字 阅读 →
论文解读

短模型拉长用:固定切分为何在长语音指令跟随中最稳

该研究用同一套语音大模型先做短语音指令跟随再扩展到长语音,比较三种切分策略,最强证据是固定 30 秒切分取得 2.0663 的 HIFS 分数,代价是长摘要与章节任务仍不稳定且幻觉以重复插入为主。

 · 更新于 2026-09-24 · 约 16 分钟 · 7988 字 阅读 →
论文解读

先保证译对再求快:用分层奖励纠正合成轨迹的无界语音同传

针对无界语音同传中合成读-写轨迹不准的问题,该工作用分层策略优化在质量达标后才优化延迟,在 1.5 秒延迟附近报告超过 +7 COMET 和 +1.25 MetricX 的提升,但 BLEU 与独立评测显示神经奖励仍有投机风险。

 · 更新于 2026-09-24 · 约 20 分钟 · 9604 字 阅读 →
论文解读

长音频无切分条件下用两遍转写与语义合并压住幻觉的级联语音翻译

针对长时无切分英文到中文与德文离线语音翻译,论文采用 Silero VAD 加两遍转写与 150 词元语义合并的 Qwen3 级联路线,在 tst-2022 上报告 En-Zh COMET 0.8462 与 En-De 0.7854,最强证据来自两遍转写把 WER 压到 3.01%,代价是多模型串行推理与重分段计算开销。

 · 更新于 2026-09-24 · 约 19 分钟 · 9028 字 阅读 →
每日研究速递

iwslt-2026 论文深度解读

共收录 38 篇 iwslt-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 80 分钟 · 39666 字 阅读 →
论文解读

把对齐改成填空:一次填完长语音时间戳的槽位方案

针对多语长语音中逐帧搜索易累积系统性偏移的问题,该文把强制对齐改成在文本中插入时间槽并分类预测离散时间索引,报告在伪标签与人工标注上平均累积偏移大幅下降,代价是模型更大且实时因子略升、人工验证仅覆盖中文。

 · 更新于 2026-09-24 · 约 19 分钟 · 9165 字 阅读 →
论文解读

长语音指令跟随:把短语料拼成长训练、再用重排补转写的得失

该工作把短语音语料拼接成最长 15 分钟的长指令数据并覆盖六任务四语言,用温度采样和端到端加级联两种结构参赛,最强证据是似然加最小贝叶斯风险重排在英语上把词错率从 37.65 降到 21.39 而语义任务仅小幅波动,代价是似然重排会误选切分候选并损害问答与摘要。

 · 更新于 2026-09-24 · 约 17 分钟 · 8206 字 阅读 →
论文解读

用合成数据与对话式分段建模换取可复现的长歌曲生成

Muse 针对长歌曲不可复现问题,用 116489 首授权合成歌曲与全局加分段风格标注训练单阶段自回归模型,在小参数下取得可比的歌词对齐与风格相似度,并以多轮分段生成实现细粒度风格控制。

 · 更新于 2026-09-24 · 约 19 分钟 · 9358 字 阅读 →
论文解读

长音频查不完:先规划模态与时间,再用结构化查询取小证据

针对 10 分钟到 540 分钟音频中说话内容、说话人、情感与声音事件交织推理难的问题,PlanRAG-Audio 先把音频离线转成时间对齐的结构化库,再按问题规划检索并只取相关片段生成答案,以检索把推理代价与原始长度解耦,代价是受上游感知精度约束并需承担离线预处理开销。

 · 更新于 2026-09-24 · 约 22 分钟 · 10857 字 阅读 →
每日研究速递

eacl-2026 论文深度解读

共收录 36 篇 eacl-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 75 分钟 · 37568 字 阅读 →
论文解读

只拉伸音频位置、不动文本位置:部分 YaRN 与虚拟长音频训练的长音频泛化

针对统一输入空间大音频语言模型音频窗短的问题,论文提出只改音频区旋转位置编码的部分 YaRN 与训练时随机虚拟长度的位置增强虚拟长音频训练,在 1 至 10 分钟问答上用免训练与微调对照验证长音频泛化收益与调参代价。

 · 更新于 2026-09-24 · 约 20 分钟 · 9547 字 阅读 →
论文解读

在帧之间听见时间:TimeAudio 如何把时刻、时长与语义对齐

针对大音频语言模型时间定位不准、长音频难以端到端理解的问题,TimeAudio 用时间标记加绝对时间编码加分段令牌合并,并在 FTAR 时间任务数据上微调,在密集描述、定位与时间线摘要上报告了定位精度的提升,但密集描述的文本多样性仍有代价与边界。

 · 更新于 2026-09-24 · 约 21 分钟 · 10124 字 阅读 →
论文解读

野外长音频与多音频并存时,模型为何听得到却答不对

MMAU-Pro 用 5305 组野外音频与 49 项技能考查长时、多音频、空间与文化理解,最强模型仅 59.2% 准确率,暴露感知到推理的断层与指令遵循短板。

 · 更新于 2026-09-24 · 约 21 分钟 · 10274 字 阅读 →