以漫游为方法:古琴即兴、混沌空间与图形谱如何并行转化
该作品以《采真游》演奏与即兴为唯一声源,经触觉式合成与混沌吸引子四通道扩散形成 9 分钟沉浸声景,并以墨盒弹线、蓝晒、三维扫描与低秩适配生成九幅悬挂图形谱,最强证据是全天录音所得约两小时素材与双话筒立体声采集链,代价是全程无可运行基线对照与可复测听感指标。
该作品以《采真游》演奏与即兴为唯一声源,经触觉式合成与混沌吸引子四通道扩散形成 9 分钟沉浸声景,并以墨盒弹线、蓝晒、三维扫描与低秩适配生成九幅悬挂图形谱,最强证据是全天录音所得约两小时素材与双话筒立体声采集链,代价是全程无可运行基线对照与可复测听感指标。
共收录 103 篇 cvpr-2026 会议论文的 Reader 深度解读
针对多模态微调中文本主导参数更新的问题,论文用单矩阵隐式分区加解耦与对齐两个梯度约束来恢复平衡,在音频视觉文本等任务上提升精度且保持与标准 LoRA 相同的可合并参数量与推理结构。
共收录 147 篇 aaai-2026 会议论文的 Reader 深度解读
共收录 199 篇 acl-2026 会议论文的 Reader 深度解读
针对统一低秩适配破坏解码器中间层共享语义的问题,该研究按 U 形结构分配秩并用奇异值尾部方向冻结中间层,在 18 个低资源语言上以约五分之一参数达到与标准低秩相当的平均词错误率,并在极低数据下更稳定,代价是平均掩盖了分语言差异且未验证推理延迟。
AURA-ST 针对豪萨语、伊博语、约鲁巴语到英语的低资源语音翻译,用双流声学编码加 4 倍卷积压缩把音频变成冻结 Gemma-4-E2B 的前缀,并只调 MLP 的 LoRA,在教师强制代理 BLEU 上达到 91.29,但自由自回归解码的 SpBLEU 仅为 19.5、5.2 和 4.6,暴露了严重的暴露偏置代价。
针对无句子边界的长音频与计算感知延迟限制,用冻结音频编码器的 Qwen3-Omni-30B-A3B 只训练语言侧 LoRA 并以内化的``策略做读写决策,在官方开发集低延迟档取得英中 40.5 BLEU 与英德 27.7 BLEU,代价是依赖合成目标与固定块推理的折中。
共收录 38 篇 iwslt-2026 会议论文的 Reader 深度解读
针对同一说话人说多种语言导致声纹捷径失效的问题,该系统用声学分类器加语音大模型加零样本音位模型做识别、用双转写加推理大模型做验证,开发集识别 95.2% 宏准确率与验证 0.90% 等错误率,评估集为 96.78% 与 3.06%,但开发到评估存在明显落差且融合参数依赖开发集估计。
共收录 52 篇 odyssey-2026 会议论文的 Reader 深度解读
OEA 用冻结多模态大模型加 LoRA 统一编码文本与音频,在文本到音频上与 M2D-CLAP 接近,在文本到文本与硬负例排除上明显占优,代价是更大的显存与离线音频编码开销。
针对 IWSLT 2026 跨语言克隆学术演讲到阿拉伯语、法语和汉语的任务,该工作用 OmniVoice、VoxCPM 和 Chatterbox 三教师做 Best-of-N 合成蒸馏再对 OmniVoice 按语言做 LoRA 微调,在完整盲测上阿拉伯语 WER 由 0.244 降到 0.228、法语和汉语说话人相似度分别升到 0.760 和 0.732, …
Pinch-AST 针对最长约 2.5 小时无切分音频同时翻译,用 Qwen3-ASR 加 Qwen3.5-4B 每语言对 LoRA 级联与字符级最长公共前缀只增发,在单张 H100 上报告 En→De、En→It、En→Zh 相对基线 XCOMET-XL 提升 4.1、5.7、2.6 分,代价是靠固定块重解码与前缀截断训练控制延迟。
针对零样本合成过度继承参考风格的问题,ReStyle-TTS 用解耦引导降低参考依赖、用正交融合的风格 LoRA 做连续相对调节,并用音色一致性优化补回音色,代价是新风格仍需收集数据再训 LoRA。
S2ST-Omni 把多语语音到语音翻译拆成高精度语音到文本前端加可插拔语音合成后端,用先局部后全局的混合适配器和声学加语言两级源语言感知提升翻译,在 CVSS-C 法德西到英上取得平均 BLEU 35.67 的报告最好结果,代价是依赖大骨干与可靠语言标识且只验证了三对高资源方向。
针对无预切分、无说话人标签的 21 语言多说话人长对话选择题任务,论文对比了 Voxtral-Mini-3B 的 LoRA 微调、冻结 Voxtral-24B 的多模态上下文学习纠偏、以及免训练语音锚定检索三条路线,最强证据是上下文学习在第二阶段评测取得 0.81 准确率,代价是微调在小数据上过拟合回落与检索前端依赖转写和切分质量。
该工作在 SeamlessM4T 编码器每层加入预测未来帧数的调度器并用滑动窗口重翻译与改造版 StreamAtt 进行验证,最强证据是改造版 StreamAtt 在英德 4 秒块取得 1976 毫秒延迟比基线快 817 毫秒,主要代价是两种策略下翻译质量均系统性低于未修改基线。
共分析 42 篇语音/AI 论文
AniTales 针对文本互动故事缺少稳定多模态呈现的问题,用大语言模型生成带说话人与情绪标签的结构化剧本,再以同一标签驱动立绘表情与语音韵律,在 10 名普通用户与 5 名专家的十幕故事试用中获得可用性 84 分与角色对话匹配 4.2 分,但语音适配在两组均为 3.6 分成为最弱环节。