研究条目

让同一组录音按用户视角重新分组:AudioLens 如何把语音聚类变成集合推理

让同一组录音按用户视角重新分组:AudioLens 如何把语音聚类变成集合推理 英文题目:AudioLens: Multi-Perspective Speech Clustering with Reasoning Audio-Language Models arXiv:2608.25177 标签: #speech clustering #audio-language models #reasoning distillation #preference optimization 评分: 7.45/10 八维分项: 创新 1.7/2 | 技术严谨 1.25/1.5 | 实验充分 1.35/1.5 | 清晰度 0.9/1 | 影响力 1.2/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.75/1.5 作者与机构: Wenjun Huang, Qiaosong Chu, Tiger Shao, Pengfei Zhang, Yutong Song, Hanning Chen, Yezi Liu, Weiyi Wu, SungHeon Jeong, Ryozo Masukawa, Sanggeon Yun, Yang Ni, Jiang Gui, Mohsen Imani ...

 · 更新于 2026-09-05 · 约 3 分钟 · 451 字 阅读 →
研究条目

语音/音乐/音频论文速递 2026-08-27

语音/音乐/音频论文速递 2026-08-27 共分析 21 篇论文 ⚡ 今日概览 ✅ 筛选入选 21 篇 → 🔬 深度分析完成 🏷️ 热门方向 方向 数量 分布 #语音识别 4 篇 ████ #回声消除 2 篇 ██ #语音交互 2 篇 ██ #音频分类 2 篇 ██ #音频理解 2 篇 ██ #基准测试 1 篇 █ #空间音频 1 篇 █ #语音伪造检测 1 篇 █ 📊 论文评分排行榜(21 篇,按分数降序) 排名 论文 总分 分档 文档类型 主任务 🥇 AllMusicCaps: Album Reviews as Complementary… 9.1 前10% 方法研究 #音乐检索 🥈 LibriBrain100: One Hundred Hours of Broad and Deep MEG… 8.9 前25% 数据集与基准 #基准测试 🥉 What Do Audio-Visual Synchronization Metrics Actually… 8.8 前25% 方法研究 #音视频理解 4. Why ML-based cough models do not generalize: a… 8.8 前25% 应用研究 #音频分类 5. Lost but not erased: Finding traces of a forgotten… 8.6 前25% 方法研究 #语音识别 6. TurnBench: A Multi-Domain Benchmark for Turn-Taking… 8.5 前25% 数据集与基准 #语音交互 7. Knowledge Distillation for Efficient Acoustic Echo… 8.5 前25% 方法研究 #回声消除 8. Domain-Adaptive ASR for Telephony AI Agents: Fine… 7.9 前25% 系统技术报告 #语音识别 9. CSAVocoder: A Causal Spatial Audio Vocoder Towards… 7.6 前25% 系统技术报告 #空间音频 10. SPECTRA: Subspace-Preserving Embedding Calibration… 7.2 前50% 方法研究 #音频分类 11. Dissonance Spectrum explicitly models perceptual… 7.2 前50% 方法研究 #音乐理解 12. AudioLens: Multi-Perspective Speech Clustering with… 7.1 前50% 方法研究 #音频理解 13. Super Star: Towards Streaming Real-time Interactive… 6.9 前50% 系统技术报告 #音视频交互 14. Can We Read the Mind of an Audio LLM? A Verbalizable… 6.6 前50% 方法研究 #音频理解 15. VoiceMem: Streaming Dual-Brain Memory for Real-Time… 6.6 前50% 系统技术报告 #语音交互 16. A Training-Free Proactive Defense Against Partial… 6.5 前50% 方法研究 #语音伪造检测 17. Combining Self-Embedding Audio Watermarking with Ultra… 6.4 前50% 方法研究 #音频水印 18. Generative vs. Encoder Large Language Models for ASR… 6.1 前50% 应用研究 #语音质量评估 19. Mandarin Humorous Homophone Recognition and… 5.7 前50% 方法研究 #语音识别 20. Acoustic Echo Control Based on Sound Object… 4.9 后50% 方法研究 #回声消除 21. Fine-Tuning Whisper for Automatic Speech Recognition… 4.7 后50% 应用研究 #语音识别 📋 论文列表 🥇 把乐评变成检索监督,关键不在多而在语域对位 英文题目:AllMusicCaps: Album Reviews as Complementary Supervision for Music CLAP ...

 · 更新于 2026-09-05 · 约 18 分钟 · 3730 字 阅读 →
研究条目

Anatomy of a Scam Call: What 10,000 real scam and spam calls reveal about how phone scammers operate

📄 Anatomy of a Scam Call: What 10,000 real scam and spam calls reveal about how phone scammers operate 标签:#语音交互 #数据集 #模型评估 #工业应用 7.3/10 | 创新 1.4/2 | 严谨 1.2/1.5 | 实验 1.2/1.5 | 清晰 0.9/1 | 影响 1.3/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 1/1.5 ✅ 7.3/10 | 前50% | 文档类型:应用研究 | 评分置信度:中 | #语音交互 | #数据集 | #模型评估 #工业应用 | arxiv 👥 作者与机构 第一作者:Ethan Traister(scam.ai) 通讯作者:Simiao Ren(论文以 benren@scam.ai 标注通讯邮箱) 作者列表:Ethan Traister、Ankit Raj、Jiaqi Gan、Xingyu Shen、Tyler Wu、Yuchen Zhou、Tommy Duong、Kidus Zewde、Siying Chen、Simiao Ren(机构:scam.ai) ...

 · 更新于 2026-09-05 · 约 3 分钟 · 496 字 阅读 →
研究条目

Arbitrary Polygon Oscillator: Generalizing Polygonal Synthesis to Arbitrary Shapes, Morphing, and Three-Dimensional Polyhedra

📄 Arbitrary Polygon Oscillator: Generalizing Polygonal Synthesis to Arbitrary Shapes, Morphing, and Three-Dimensional Polyhedra 标签:#音乐生成 #音频生成 #实时处理 #理论分析 #开源工具 8.7/10 | 创新 1.8/2 | 严谨 1.3/1.5 | 实验 1/1.5 | 清晰 0.9/1 | 影响 1.1/1.5 | 开源 1.2/1.5 | 复现 0.4/0.5 | 工程 1/1.5 🔥 8.7/10 | 前25% | 文档类型:方法研究 | 评分置信度:高 | #音乐生成 | #音频生成 | #实时处理 #理论分析 | arxiv 👥 作者与机构 第一作者:Antonio Argentieri(Conservatorio Niccolò Piccinni di Bari) 通讯作者:Antonio Argentieri;Francesco Scagliola 作者列表:Antonio Argentieri、Francesco Scagliola(机构:Conservatorio Niccolò Piccinni di Bari, Bari, Italy) ...

 · 更新于 2026-09-05 · 约 1 分钟 · 145 字 阅读 →
研究条目

Array-Agnostic Ambisonics Encoding via Diffusion Posterior Sampling

📄 Array-Agnostic Ambisonics Encoding via Diffusion Posterior Sampling 标签:#空间音频 #扩散模型 #零样本 #多通道 7.5/10 | 创新 1.7/2 | 严谨 1.3/1.5 | 实验 1.2/1.5 | 清晰 0.9/1 | 影响 1.2/1.5 | 开源 0/1.5 | 复现 0.4/0.5 | 工程 0.8/1.5 ✅ 7.5/10 | 前25% | 文档类型:方法研究 | 评分置信度:高 | #空间音频 | #扩散模型 | #零样本 #多通道 | arxiv 👥 作者与机构 第一作者:Amit Milstein(ECE School, Ben-Gurion University of the Negev) 通讯作者:正文未明确标注;电子邮件列出 Amit Milstein、Nir Shlezinger、Boaz Rafaely 作者列表:Amit Milstein、Nir Shlezinger、Boaz Rafaely(机构:ECE School, Ben-Gurion University of the Negev, Be’er-Sheva, Israel) ...

 · 更新于 2026-09-05 · 约 4 分钟 · 825 字 阅读 →
研究条目

Benchmarking LLM Judges for Voice-Agent Evaluation: Reliability, Calibration, and Human Oversight

📄 Benchmarking LLM Judges for Voice-Agent Evaluation: Reliability, Calibration, and Human Oversight 标签:#模型评估 #基准测试 #语音交互 #大语言模型 6.6/10 | 创新 1.2/2 | 严谨 1.1/1.5 | 实验 1.2/1.5 | 清晰 0.8/1 | 影响 1/1.5 | 开源 0.2/1.5 | 复现 0.2/0.5 | 工程 0.9/1.5 ✅ 6.6/10 | 前50% | 文档类型:数据集与基准 | 评分置信度:中 | #语音交互 | #大语言模型 | #模型评估 #基准测试 | arxiv 👥 作者与机构 第一作者:Shashank Singh(Sprinklr AI,Bengaluru,India) 通讯作者:Anupam Purwar 作者列表:Shashank Singh、Anupam Purwar、Kritika Srivastava(机构:Sprinklr AI,Bengaluru / Gurugram,India) ...

 · 更新于 2026-09-05 · 约 4 分钟 · 706 字 阅读 →
研究条目

CoSTALA: Compositional Spatio-Temporal Audio-Language Alignment via Multi-Grain Hierarchical Contrastive Learning

📄 CoSTALA: Compositional Spatio-Temporal Audio-Language Alignment via Multi-Grain Hierarchical Contrastive Learning 标签:#空间音频 #对比学习 #音频检索 #多通道 #长音频处理 7.9/10 | 创新 1.5/2 | 严谨 1.2/1.5 | 实验 1.2/1.5 | 清晰 0.8/1 | 影响 1/1.5 | 开源 1/1.5 | 复现 0.4/0.5 | 工程 0.8/1.5 ✅ 7.9/10 | 前25% | 文档类型:方法研究 | 评分置信度:高 | #空间音频 | #对比学习 | #音频检索 #多通道 | arxiv 👥 作者与机构 第一作者:Peiwei Ren(Xi’an Jiaotong Liverpool University, China) 通讯作者:Peiwei Ren;Jinbo Hu;Fang Kang;Shan Liang;Yin Cao 作者列表:Peiwei Ren、Jinbo Hu、Fang Kang、Shan Liang、Yin Cao(机构:Xi’an Jiaotong Liverpool University, China;MiLM Plus, Xiaomi Inc., China;Center for Machine Vision and Signal Analysis, University of Oulu, Finland;Institute of Acoustics, Chinese Academy of Sciences) ...

 · 更新于 2026-09-05 · 约 3 分钟 · 618 字 阅读 →
研究条目

Don't Just Listen, Try Planning: Graph-based Retrieval-Generation Agent for Long-form Audio Meeting Understanding

📄 Don’t Just Listen, Try Planning: Graph-based Retrieval-Generation Agent for Long-form Audio Meeting Understanding 标签:#音频理解 #长音频处理 #图神经网络 #音频检索 #会议转录 7.8/10 | 创新 1.5/2 | 严谨 1.2/1.5 | 实验 1.3/1.5 | 清晰 0.7/1 | 影响 1.3/1.5 | 开源 0.5/1.5 | 复现 0.4/0.5 | 工程 0.9/1.5 ✅ 7.8/10 | 前25% | 文档类型:方法研究 | 评分置信度:高 | #音频理解 | #图神经网络 | #长音频处理 #音频检索 | arxiv 👥 作者与机构 第一作者:Quanwei Tang(School of Computer Science & Technology, NLP Lab, Soochow University, China) 通讯作者:Dong Zhang 作者列表:Quanwei Tang、Dong Zhang、Shoushan Li、Guodong Zhou(机构:School of Computer Science & Technology, NLP Lab, Soochow University, China;Jiangsu Key Lab of Language Computing, Suzhou) ...

 · 更新于 2026-09-05 · 约 4 分钟 · 770 字 阅读 →
研究条目

EM-KalmanNet: Learned Expectation-Maximization for Adaptive Tracking in Partially Known, Block-Wise Time-Varying State-Space Models

📄 EM-KalmanNet: Learned Expectation-Maximization for Adaptive Tracking in Partially Known, Block-Wise Time-Varying State-Space Models 标签:#声源定位 #RNN #测试时自适应 #高效推理 #鲁棒性 8.8/10 | 创新 1.6/2 | 严谨 1.3/1.5 | 实验 1.2/1.5 | 清晰 0.9/1 | 影响 1.2/1.5 | 开源 1.2/1.5 | 复现 0.4/0.5 | 工程 1/1.5 🔥 8.8/10 | 前25% | 文档类型:方法研究 | 评分置信度:高 | #声源定位 | #RNN | #测试时自适应 #高效推理 | arxiv 👥 作者与机构 第一作者:Ori Cohen(School of ECE, Ben-Gurion University of the Negev, Israel) 通讯作者:正文未明确标注通讯作者 作者列表:Ori Cohen、Nir Shlezinger、Tirza Routtenberg(机构:School of ECE, Ben-Gurion University of the Negev, Israel) ...

 · 更新于 2026-09-05 · 约 4 分钟 · 790 字 阅读 →
研究条目

EmoTra-TTS: Smooth Intra-Utterance Emotion Transitions for Speech Synthesis

📄 EmoTra-TTS: Smooth Intra-Utterance Emotion Transitions for Speech Synthesis 标签:#语音合成 #流匹配 #生成模型 #可解释性 9.6/10 | 创新 1.7/2 | 严谨 1.4/1.5 | 实验 1.5/1.5 | 清晰 0.9/1 | 影响 1.2/1.5 | 开源 1.2/1.5 | 复现 0.4/0.5 | 工程 1.3/1.5 🔥 9.6/10 | 前10% | 文档类型:方法研究 | 评分置信度:高 | #语音合成 | #流匹配 | #生成模型 #可解释性 | arxiv 👥 作者与机构 第一作者:Tianchi Liu(LIGHTSPEED) 通讯作者:Tianchi Liu;Zeyang Song 作者列表:Tianchi Liu、Zeyang Song、Tianrui Wang、Zhipeng Li、Chenglin Xu、Yiwen Guo(机构:LIGHTSPEED;National University of Singapore;Nanyang Technological University;Independent Researcher) ...

 · 更新于 2026-09-05 · 约 4 分钟 · 708 字 阅读 →
研究条目

EXAM²: Extending Audio Understanding in Multilingual and Multimodal Analysis

📄 EXAM²: Extending Audio Understanding in Multilingual and Multimodal Analysis 标签:#模型评估 #基准测试 #音频理解 #多语言 #多模态模型 8.7/10 | 创新 1.7/2 | 严谨 1.2/1.5 | 实验 1.3/1.5 | 清晰 0.9/1 | 影响 1.3/1.5 | 开源 1.5/1.5 | 复现 0.4/0.5 | 工程 0.4/1.5 🔥 8.7/10 | 前25% | 文档类型:数据集与基准 | 评分置信度:高 | #音频理解 | #多模态模型 | #模型评估 #基准测试 | arxiv 👥 作者与机构 第一作者:Jiawen Wang(LMU Munich, Germany) 通讯作者:正文未明确标注通讯作者;仅列 Jiawen Wang 邮箱 作者列表:Jiawen Wang、Xiaoxue Gao、Zi Haur Pang、Nancy F. Chen(机构:LMU Munich, Germany;CUHK-Shenzhen, China;Kyoto University, Japan;A*STAR, Singapore) ...

 · 更新于 2026-09-05 · 约 3 分钟 · 549 字 阅读 →
研究条目

FireRedAudio: A General-Purpose Audio Language Model with Decoupled Continuous Representations for Understanding and Generation

📄 FireRedAudio: A General-Purpose Audio Language Model with Decoupled Continuous Representations for Understanding and Generation 标签:#统一音频模型 #流匹配 #音频理解 #语音合成 #语音编辑 8.7/10 | 创新 1.7/2 | 严谨 1.3/1.5 | 实验 1.2/1.5 | 清晰 0.9/1 | 影响 1.3/1.5 | 开源 1/1.5 | 复现 0.3/0.5 | 工程 1/1.5 🔥 8.7/10 | 前25% | 文档类型:模型报告 | 评分置信度:高 | #音频理解 | #流匹配 | #统一音频模型 #语音合成 | arxiv 👥 作者与机构 第一作者:Junjie Li(Xiaohongshu(正文仅给出统一机构行,未逐作者映射)) 通讯作者:Fenglong Xie(正文脚注给出通讯邮箱) 作者列表:Junjie Li、Xuelong Geng、Kun Xie、Feiyu Shen、Yichen Wu、Ziqi Dai、Yichen Han、Yan Jia、Kai Huang、Junjie Chen、Yixuan Li、Manzhen Wei、Fenglong Xie、Lei Xie、Xu Tang、Yao Hu(机构:Xiaohongshu) ...

 · 更新于 2026-09-05 · 约 4 分钟 · 742 字 阅读 →
研究条目

From local kernels to global form: modeling the emergence of musical content

📄 From local kernels to global form: modeling the emergence of musical content 标签:#音乐理解 #理论分析 #音乐生成 #可解释性 8.2/10 | 创新 1.5/2 | 严谨 1.3/1.5 | 实验 1.1/1.5 | 清晰 0.9/1 | 影响 1/1.5 | 开源 1.2/1.5 | 复现 0.4/0.5 | 工程 0.8/1.5 🔥 8.2/10 | 前25% | 文档类型:理论研究 | 评分置信度:高 | #音乐理解 | #理论分析 | #音乐生成 #可解释性 | arxiv 👥 作者与机构 第一作者:Francesco Vitucci(受控全文未说明) 通讯作者:受控全文未明确标注 作者列表:Francesco Vitucci、Michele Lorusso、Francesco Scagliola(机构:受控全文未说明) 📌 核心摘要 这篇论文的核心判断很明确:音乐形式不必靠更长的马尔可夫历史才进入模型;只要让同一符号在不同乐谱位置调用不同的转移核,1 阶链也能携带位置依赖的局部语法。它面对的矛盾是,齐次矩阵把全曲同一状态的所有后继混在一起,因而丢掉形式位置;而把窗口缩短以恢复位置,又会让转移计数稀疏、距离曲线受滑窗几何支配。作者的选择是从一首单声部 MusicXML 的重叠窗口估计局部核轨迹,分析时读相邻核的变化,生成时把局部行与全局回退核交给时间调度器。 ...

 · 更新于 2026-09-05 · 约 3 分钟 · 490 字 阅读 →
研究条目

Investigating voiced and unvoiced regions of speech for audio deepfake detection

📄 Investigating voiced and unvoiced regions of speech for audio deepfake detection 标签:#语音伪造检测 #图神经网络 #模型融合 #模型评估 6.4/10 | 创新 1.2/2 | 严谨 1.1/1.5 | 实验 1.2/1.5 | 清晰 0.9/1 | 影响 1/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 0.7/1.5 ✅ 6.4/10 | 前50% | 文档类型:方法研究 | 评分置信度:中 | #语音伪造检测 | #图神经网络 | #模型融合 #模型评估 | arxiv 👥 作者与机构 第一作者:Ganesh Sivaraman(Pindrop, Atlanta, USA) 通讯作者:正文未明确标注通讯作者 作者列表:Ganesh Sivaraman、Hemlata Tak、Elie Khoury(机构:Pindrop, Atlanta, USA) ...

 · 更新于 2026-09-05 · 约 5 分钟 · 994 字 阅读 →
研究条目

LAION-BVD: A 10-Million-Hour Open Video Dataset for Multimodal Pre-training

📄 LAION-BVD: A 10-Million-Hour Open Video Dataset for Multimodal Pre-training 标签:#音视频理解 #数据集 #预训练 #对比学习 #多模态模型 9.4/10 | 创新 1.7/2 | 严谨 1.3/1.5 | 实验 1.4/1.5 | 清晰 0.9/1 | 影响 1.5/1.5 | 开源 1.2/1.5 | 复现 0.4/0.5 | 工程 1/1.5 🔥 9.4/10 | 前10% | 文档类型:数据集与基准 | 评分置信度:高 | #音视频理解 | #预训练 | #数据集 #对比学习 | arxiv 👥 作者与机构 第一作者:Andreas Hochlehnert(University of Tübingen, Tübingen AI Center) 通讯作者:正文未明确标注通讯作者;A. Sophia Koepke、Jenia Jitsev、Matthias Bethge 标为共同末位作者 作者列表:Andreas Hochlehnert、Marianna Nezhurina、Mehdi Cherti、Andrej Radonjic、Thaddäus Wiedemer、Christoph Schuhmann、Romain Beaumont、Wieland Brendel、Bernhard Schölkopf、A. Sophia Koepke、Jenia Jitsev、Matthias Bethge(机构:University of Tübingen, Tübingen AI Center;LAION;JSC, FZJ;Wynd Labs;MPI for Intelligent Systems, ELLIS Institute Tübingen;Technical University of Munich, MCML) ...

 · 更新于 2026-09-05 · 约 5 分钟 · 888 字 阅读 →
研究条目

Lost in Speech: Trilingual Spoken Hallucination Detection Across Audio and Transcripts

📄 Lost in Speech: Trilingual Spoken Hallucination Detection Across Audio and Transcripts 标签:#音频理解 #多语言 #基准测试 #低资源 #鲁棒性 8.2/10 | 创新 1.6/2 | 严谨 1.2/1.5 | 实验 1.3/1.5 | 清晰 0.9/1 | 影响 1.3/1.5 | 开源 0.5/1.5 | 复现 0.4/0.5 | 工程 1/1.5 🔥 8.2/10 | 前25% | 文档类型:数据集与基准 | 评分置信度:高 | #音频理解 | #多语言 | #基准测试 #低资源 | arxiv 👥 作者与机构 第一作者:Meruyert Aristombayeva(Satbayev University, Almaty, Kazakhstan) 通讯作者:Meruyert Aristombayeva 作者列表:Meruyert Aristombayeva、Jason S. Lucas、Chaewan Chun、Dongwon Lee(机构:Satbayev University;University of Colorado Boulder;The Pennsylvania State University) ...

 · 更新于 2026-09-05 · 约 4 分钟 · 834 字 阅读 →
研究条目

OmniJudge or OmniBias? Diagnosing Multimodal Judges through Balanced, Decoupled Lenses

📄 OmniJudge or OmniBias? Diagnosing Multimodal Judges through Balanced, Decoupled Lenses 标签:#模型评估 #基准测试 #多模态模型 #音频质量评估 #可解释性 7.4/10 | 创新 1.7/2 | 严谨 1.2/1.5 | 实验 1.2/1.5 | 清晰 0.9/1 | 影响 1.2/1.5 | 开源 0/1.5 | 复现 0.4/0.5 | 工程 0.8/1.5 ✅ 7.4/10 | 前50% | 文档类型:数据集与基准 | 评分置信度:高 | #音频质量评估 | #多模态模型 | #模型评估 #基准测试 | arxiv 👥 作者与机构 第一作者:Guangzheng Hu(Alibaba Group;University of Melbourne) 通讯作者:Hu Wei;Jin Xu 作者列表:Guangzheng Hu、Ziyue Jiang、Weixu Qiao、Lixin Zhang、Jianye Kang、Yuru Wu、Rong Bao、Niantong Li、Wei Wang、Ziyi Cheng、Xinfa Zhu、HangRui Hu、Ting He、Bing Zhao、Lin Qu、Hu Wei、Jin Xu(机构:Alibaba Group;Qwen Team;Alibaba DAMO Academy;University of Melbourne;Zhejiang University) ...

 · 更新于 2026-09-05 · 约 4 分钟 · 716 字 阅读 →
研究条目

On the Robustness of Audio Deepfake Detection under Audio Watermarking

📄 On the Robustness of Audio Deepfake Detection under Audio Watermarking 标签:#音频伪造检测 #音频水印 #鲁棒性 #模型评估 7.7/10 | 创新 1.3/2 | 严谨 1/1.5 | 实验 1.2/1.5 | 清晰 0.8/1 | 影响 1.1/1.5 | 开源 1.2/1.5 | 复现 0.3/0.5 | 工程 0.8/1.5 ✅ 7.7/10 | 前25% | 文档类型:方法研究 | 评分置信度:中 | #音频伪造检测 | #音频水印 | #鲁棒性 #模型评估 | arxiv 👥 作者与机构 第一作者:Zi Qian Yong(School of Information Technology, Monash University, Malaysia campus) 通讯作者:正文未明确标注通讯作者 作者列表:Zi Qian Yong、Ajinkya Kulkarni、Julia K. Lau、Hwa Hui Tew、Shu-Min Leong、Raphaël C.-W. Phan、Sébastien Marcel(机构:School of Information Technology, Monash University, Malaysia campus;Idiap Research Institute, Switzerland) ...

 · 更新于 2026-09-05 · 约 4 分钟 · 763 字 阅读 →
研究条目

One Timeline, Many Renderings: A Wolfram Language Paclet for heterogeneous musical output

📄 One Timeline, Many Renderings: A Wolfram Language Paclet for heterogeneous musical output 标签:#音乐生成 #端到端 #开源工具 #实时处理 7.0/10 | 创新 1.4/2 | 严谨 1.1/1.5 | 实验 0.8/1.5 | 清晰 0.9/1 | 影响 1.1/1.5 | 开源 0.5/1.5 | 复现 0.3/0.5 | 工程 0.9/1.5 ✅ 7.0/10 | 前50% | 文档类型:系统技术报告 | 评分置信度:中 | #音乐生成 | #端到端 | #开源工具 #实时处理 | arxiv 👥 作者与机构 第一作者:Francesco Vitucci(Conservatorio di Musica “N. Piccinni” di Bari) 通讯作者:正文未明确标注通讯作者,仅列出 3 位作者邮箱 作者列表:Francesco Vitucci、Michele Lorusso、Francesco Scagliola(机构:正文只明确给出 Conservatorio di Musica “N. Piccinni” di Bari,其余机构栏为空) ...

 · 更新于 2026-09-05 · 约 7 分钟 · 1313 字 阅读 →
研究条目

Preference Optimization for Non-Verbal Vocalization Synthesis

📄 Preference Optimization for Non-Verbal Vocalization Synthesis 标签:#语音合成 #后训练 #模型评估 #SFT 7.1/10 | 创新 1.3/2 | 严谨 1.3/1.5 | 实验 1.3/1.5 | 清晰 0.9/1 | 影响 1.1/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 0.9/1.5 ✅ 7.1/10 | 前50% | 文档类型:方法研究 | 评分置信度:中 | #语音合成 | #后训练 | #模型评估 #SFT | arxiv 👥 作者与机构 第一作者:Haoyang Li(Nanyang Technological University, Singapore) 通讯作者:Chenglin Xu 作者列表:Haoyang Li、Chenglin Xu、Junchuan Zhao、Yuang Cao、Liumeng Xue、Yiwen Guo、Eng Siong Chng(机构:Nanyang Technological University, Singapore;LIGHTSPEED, Singapore;National University of Singapore, Singapore;Nanjing University, China;Independent researcher) ...

 · 更新于 2026-09-05 · 约 4 分钟 · 760 字 阅读 →