先分对白再分音乐音效:LiteCASS 用两级子带 U-Net 做立体声实时分离
针对立体声电影音频要同时分出对白、音乐、音效并保住空间感的问题,LiteCASS 用确定性子带重排加两级紧凑 U-Net 做掩码分离,在 DnR v3 立体声扩展上以 1.06 M 参数和 0.72 G 每秒运算量取得平均 SI-SDR 最高,代价是语音感知指标仍落后于更大基线与视觉辅助系统。
针对立体声电影音频要同时分出对白、音乐、音效并保住空间感的问题,LiteCASS 用确定性子带重排加两级紧凑 U-Net 做掩码分离,在 DnR v3 立体声扩展上以 1.06 M 参数和 0.72 G 每秒运算量取得平均 SI-SDR 最高,代价是语音感知指标仍落后于更大基线与视觉辅助系统。
针对全双工语音交互中打断、回切与外部工具调用难以共存的问题,该工作用并行智能体文本流与函数调用流加流式 TTS 与 RNN-T 转写的统一架构实现边听边说边调工具,最强证据是工具选择 F1 达 82.5% 且打断后恢复质量 4.33/5,代价是参数准确率与端到端执行仍明显落后且工具执行期间不支持打断。
论文用线性硬弦偏微分方程加三角拨弦初值约束多层感知机做正演,在第一振动周期内与有限差分和断线实验做对照,随机傅里叶特征尺度越大高频细节越好,但评估只限首周期且存在幅值偏差。
针对 5 分钟以上医患对话直接生成 SOAP 病历的问题,论文用统一端到端架构比较 3B 轻量与 30B 重量模型,报告四阶段训练把 Concept F1 从零样本的 0.26 和 0.18 分别推到 0.4082 和 0.5167,并以级联基线为对照说明直接优化的收益与容量代价。
针对构音障碍语音识别中离散 token 与识别目标错位且随严重程度漂移的问题,该文用迭代伪标签更新、可微端到端优化与严重程度不变正则学习 DSI token,在 UASpeech 与 TORGO 上显著优于可比 HuBERT 连续与离散基线,系统组合后最低词错误率分别为 18.90% 和 6.38%,代价是需内容平行的健康对照与额外的端到端训练。
针对语音激励、混响与噪声变化下的批量声学系统辨识,该工作把最小二乘加多重稀疏约束的参数化模型族用交替方向乘子法求解并展开为 ADMM-SysIDNet,在 Bar-Ilan 实测房间冲激响应与 LibriSpeech 激励下以归一化均方偏差为指标优于最小二乘和 ADMM-ℓ1,代价是依赖分混响条件的离线训练与批量观测流程。
针对耳蜗个体差异难以直接调参的问题,该文在可微 CARFAC 上增加后向传输与相干反射路径,以复合损失拟合瞬态诱发耳声发射波形,在传输线模型仿真与 58 耳实测数据上显示可还原不同听力损失形态,但对真实生理状态与泛化仍需更多验证。
共收录 103 篇 cvpr-2026 会议论文的 Reader 深度解读
共收录 91 篇 dafx-2026 会议论文的 Reader 深度解读
该研究把正常听觉与电刺激听觉都写成可微模型,用同一段语音驱动两条通路并以螺旋神经节神经元包络误差为目标训练双网络刺激器,在 TIMIT 干净语音上把包络平均绝对误差从 0.6261 降到 0.0934,代价是仅用单一包络指标、干净语音和 8 kHz 以下频带且允许同时刺激。
该文研究混响加定向噪声下两人混合的多麦目标说话人提取,对比瞬时相对传递函数、已知波达方向和单通道声纹三种配准线索,随机位置上瞬时相对传递函数取得 9.2 dB 和 0.81 的分离与可懂度,同波达方向下仍保持 8.8 dB,代价是需要与目标同位置的无噪配准信号。
共收录 127 篇 eusipco-2026 会议论文的 Reader 深度解读
该文把 16 通道反馈延迟网络做成端到端可微并用梯度下降拟合实测房间脉冲响应,在 9 个房间上以更少参数和更快训练达到更低混响时间误差,但训练延迟线可能引入可闻染色。
针对事件相机记录的语音致振恢复语音的问题,论文提出两阶段振动到语音模型 EV2A,用 8 个 8×8 感兴趣区域做视觉前端加语音增强端到端训练,在真实薯片袋振动数据上相对事件版视觉麦克风降低词错误率 0.48 但仍保留金属感与表示损失等代价。
论文提出 POLAR 框架,把扬声器滤波器、自由场传播与可微听觉损失连成端到端链路,用梯度下降复现了幅度声像、串扰消除与波束展宽甜点的已知解,并展示定位、不确定度与音染可加权折中,但多属性部分仍是模型自评、权重靠试错且未经正式听音验证。
针对直接联合训练让倾听分支塌缩为静态表情的问题,UniLS 用无音频自回归预训练学习内在运动先验,再用双轨音频交叉注意力微调实现端到端说听生成,在 Seamless Interaction 测试与 25 人偏好比较中报告说话对齐与倾听分布同时改善,代价是更大算量与仍缺语义理解。
共收录 147 篇 aaai-2026 会议论文的 Reader 深度解读
共收录 199 篇 acl-2026 会议论文的 Reader 深度解读
论文把全双工语音模型的知识退化归因于深层语义与声学梯度冲突,用共享浅层加并行深层头与语义对齐通道来分离优化,主证据是口语问答平均提升 7.4% 与 FullDuplexBench 1.5 提升 28.5%,代价是约 10B 参数与专用三通道训练数据依赖。
共收录 52 篇 odyssey-2026 会议论文的 Reader 深度解读