{
  "absUrl": "https://arxiv.org/abs/2609.28206",
  "arxivId": "2609.28206",
  "arxivVersion": null,
  "arxivVersionedId": null,
  "authors": [
    {
      "affiliations": [
        "机构信息未在 arXiv HTML 中可靠披露"
      ],
      "name": "Runwu Shi"
    },
    {
      "affiliations": [
        "机构信息未在 arXiv HTML 中可靠披露"
      ],
      "name": "Kai Li"
    },
    {
      "affiliations": [
        "机构信息未在 arXiv HTML 中可靠披露"
      ],
      "name": "Yujin Wang"
    },
    {
      "affiliations": [
        "机构信息未在 arXiv HTML 中可靠披露"
      ],
      "name": "Dong Yang"
    },
    {
      "affiliations": [
        "机构信息未在 arXiv HTML 中可靠披露"
      ],
      "name": "Jiahui Li"
    },
    {
      "affiliations": [
        "机构信息未在 arXiv HTML 中可靠披露"
      ],
      "name": "Jiang Wang"
    },
    {
      "affiliations": [
        "机构信息未在 arXiv HTML 中可靠披露"
      ],
      "name": "Chang Zeng"
    },
    {
      "affiliations": [
        "机构信息未在 arXiv HTML 中可靠披露"
      ],
      "name": "Benjamin Yen"
    },
    {
      "affiliations": [
        "机构信息未在 arXiv HTML 中可靠披露"
      ],
      "name": "Ashizawa Takeshi"
    },
    {
      "affiliations": [
        "机构信息未在 arXiv HTML 中可靠披露"
      ],
      "name": "Chunxiang Jin"
    },
    {
      "affiliations": [
        "机构信息未在 arXiv HTML 中可靠披露"
      ],
      "name": "Kazuhiro Nakadai"
    }
  ],
  "contract": "researcher-sidecars-v1",
  "id": "2609.28206",
  "originalTitle": "UNITE-AUDIO: Joint Learning of Continuous Tokenization and Latent Flow Matching for Text-to-Audio Generation",
  "pdfUrl": "https://arxiv.org/pdf/2609.28206.pdf",
  "schemaVersion": 1,
  "type": "preprint"
}
