语音/音乐/音频论文速递 是面向中文研究者的论文发现与深度解读工作台。本站希望回答三个问题:今天有什么值得读、论文真正做了什么、复现前还需要核查什么。

内容如何产生

  1. 公开来源抓取:从 arXiv、HuggingFace 及会议公开页面获取候选论文。
  2. 相关性筛选:先按语音、音乐、音频及多模态相关信号预筛,再进行模型辅助判断。
  3. 证据驱动分析:围绕问题、方法、实验、局限、资源与复现条件生成结构化解读。
  4. 发布前校验:检查页面结构、论文身份、内部链接和公开资源状态后发布。

自动流程会提高覆盖速度,但不能替代作者原文和同行评审。涉及关键结论、数字或工程决策时,请点击单篇页的 arXiv 原文核对。

研读、下载与 Zotero 工具

单篇论文页提供原文、引用和研读工具:

  • 点击“阅读 / 保存 PDF”打开 arXiv 官方文件,再用浏览器下载按钮保存;手机可使用分享菜单中的“存储到文件”。
  • 新版发布页提供 Citation JSON、BibTeX 和 RIS。历史页可下载包含已有标题、arXiv ID 和官方链接的简要引用;缺失的作者和日期不会猜测补齐,正式引用前请到原文核对。
  • 保存引用时,可以下载页面提供的 BibTeX / RIS,也可以打开 arXiv 页面后点击浏览器工具栏中的 Zotero Connector 图标。网页本身不能替你点击浏览器扩展。
  • 所有论文型页面都可选择最多 2000 字符正文,或直接粘贴文字。点击“复制 AI 提问”,把含论文标题、来源链接和选段的提问粘贴到你使用的 AI 中;手机也可使用。本站只帮你整理和复制提问,不发送模型请求。

这些网页工具不要求安装或启动额外助手,也不要求填写 API key。浏览器禁止自动复制时,会显示可手动选择的文字。没有可验证 arXiv 标识的历史页仍提供复制 AI 提问,但不展示猜测的 PDF 或文献记录。

评分如何理解

本站评分是一种帮助排序的编辑性研究评价,不是论文录用判断。评分关注创新、技术严谨、实验充分、表达清晰、潜在影响、开源、可复现和工程价值。不同文档类型使用相应证据边界;缺少证据不会被写成技术错误。

分数适合回答“先读哪篇”,不适合脱离评分理由做精确横向排名。单篇页会尽可能给出逐维依据、扣分边界和置信度。

资源状态

代码、模型、数据集和 Demo 分别核查,常见状态包括:

  • 可用:发现明确链接且发布时可访问。
  • 未披露:论文没有给出相关资源。
  • 受限访问:需要申请、协议或资格。
  • 暂时不可达:有链接,但发布时网络验证失败。
  • 未验证:缺少足够信息,不能据此宣称已开源。

资源状态是发布时快照,后续可能变化;请以项目页最新说明和许可证为准。

内容版本与勘误

论文可能在 arXiv 更新版本,项目资源也可能在发布后开放。页面显示的分析日期和论文标识用于帮助判断时效。若发现题目、作者、数字、公式、链接或结论边界有误,请在文章评论区指出,或通过页面底部“提交勘误”提供可核查证据。

覆盖领域

  • 语音识别、合成、增强、分离与转换
  • 音频理解、分类、生成、检索与安全
  • 音乐信息检索、理解与生成
  • 多模态语音/音频模型与实时交互
  • 神经音频编解码、空间音频与信号处理
  • 医疗声学、生物声学及行业应用

会议追踪

订阅与发现