@misc{arxiv_2609_34381,
  title = {Joint and Cross-Modal Video-Audio Generation and Editing: A Unified Formulation and Design Taxonomy},
  author = {{Abhinav Sharma} and {Sai Karthik Navuluru} and {Wang Wei} and {Daksh Dangi} and {Xiangbo Gao} and {Li Li} and {Bo Ni} and {Vardhan Dongre} and {Junda Wu} and {Xiyang Hu} and {Jiuxiang Gu} and {Seunghyun Yoon} and {Tong Yu} and {Chien Van Nguyen} and {Mohamed Elmoghany} and {Nedim Lipka} and {Hoda Eldardiry} and {Hongjie Chen} and {Tyler Derr} and {Thien Huu Nguyen} and {Zhengzhong Tu} and {Nesreen K. Ahmed} and {Franck Dernoncourt} and {Ryan A. Rossi}},
  eprint = {2609.34381},
  archivePrefix = {arXiv},
  url = {https://arxiv.org/abs/2609.34381}
}
