Takashi Shibuya

Research Scientist Β· Creative AI Lab, Sony

I lead a team focused on Cinematic Technologies .

My interests include Generative AI, Protective AI, and Multimodal Learning.

Protective AI focuses on developing techniques to ensure the traceability and integrity of creator- or AI-generated content, including methods such as provenance tracking, training data attribution, and concept erasure. As generative models rapidly improve, safeguarding creators' rights and mitigating broader societal risks are indispensable for the responsible AI deployment.

Selected Papers

  1. Dongseok Shim, Julian Tanke, Kengo Uchida, Christian Simon, Koichi Saito, Takashi Shibuya, Shusuke Takahashi, Yuki Mitsufuji, "Odoriko: A Shape-Aware Multimodal Diffusion Framework for Human Motion," European Conference on Computer Vision (ECCV), 2026. [arXiv] [demo]
  2. Yuya Kobayashi, Masato Ishii, Yuhta Takida, Takashi Shibuya, Yuki Mitsufuji, "Spectral Prior for Reducing Exposure Bias in Diffusion Models," European Conference on Computer Vision (ECCV), 2026.
  3. Akio Hayakawa, Masato Ishii, Takashi Shibuya, Yuki Mitsufuji, "Step-by-Step Video-to-Audio Synthesis via Negative Audio Guidance," European Conference on Computer Vision (ECCV), 2026. [arXiv] [demo]
  4. Christian Simon, Masato Ishii, Wei-Yao Wang, Koichi Saito, Akio Hayakawa, Dongseok Shim, Zhi Zhong, Shuyang Cui, Takashi Shibuya, Shusuke Takahashi, Yuki Mitsufuji, "Echoes Over Time: Unlocking Length Generalization in Video-to-Audio Generation Models," IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), pp. 15840–15849, 2026. [CVF] [arXiv] [demo]
  5. Yuhta Takida, Satoshi Hayakawa, Takashi Shibuya, Masaaki Imaizumi, Naoki Murata, Bac Nguyen, Toshimitsu Uesaka, Chieh-Hsin Lai, Yuki Mitsufuji, "SONA: Learning Conditional, Unconditional, and Matching-Aware Discriminator," International Conference on Learning Representations (ICLR), 2026. [OpenReview] [arXiv]
  6. Christian Simon, Masato Ishii, Akio Hayakawa, Zhi Zhong, Shusuke Takahashi, Takashi Shibuya, Yuki Mitsufuji, "TITAN-Guide: Taming Inference-Time Alignment for Guided Text-to-Video Diffusion Models," International Conference on Computer Vision (ICCV), pp. 16662–16671, 2025. [CVF] [IEEE] [arXiv] [demo]
  7. Anubhav Jain, Yuya Kobayashi, Takashi Shibuya, Yuhta Takida, Nasir Memon, Julian Togelius, Yuki Mitsufuji, "Classifier-Free Guidance inside the Attraction Basin May Cause Memorization," IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), pp. 12871–12879, 2025. [CVF] [IEEE] [arXiv] [code]
  8. Ho Kei Cheng, Masato Ishii, Akio Hayakawa, Takashi Shibuya, Alexander Schwing, Yuki Mitsufuji, "MMAudio: Taming Multimodal Joint Training for High-Quality Video-to-Audio Synthesis," IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), pp. 28901–28911, 2025. [CVF] [IEEE] [arXiv] [code] [demo] [colab]

Publications

Journal Papers

  1. Kazuki Shimada, Kengo Uchida, Yuichiro Koyama, Takashi Shibuya, Shusuke Takahashi, Yuki Mitsufuji, Tatsuya Kawahara, "Open-Vocabulary Sound Event Localization and Detection with Joint Learning of CLAP Embedding and Activity-Coupled Cartesian DOA Vector," IEEE Transactions on Audio, Speech, and Language Processing (TASLP), pp. 2946–2960, 2025. [IEEE] [code]
  2. Yuhta Takida, Yukara Ikemiya, Takashi Shibuya, Kazuki Shimada, Woosung Choi, Chieh-Hsin Lai, Naoki Murata, Toshimitsu Uesaka, Kengo Uchida, Wei-Hsiang Liao, Yuki Mitsufuji, "HQ-VAE: Hierarchical Discrete Representation Learning with Variational Bayes," Transactions on Machine Learning Research (TMLR), 2024. [OpenReview] [arXiv]
  3. Takashi Shibuya, Eduard Hovy, "Nested Named Entity Recognition via Second-best Sequence Learning and Decoding," Transactions of the Association for Computational Linguistics (TACL), pp. 605–620, 2020. [MIT Press] [ACL] [arXiv]
  4. Takashi Shibuya, Tatsuya Harada, Yasuo Kuniyoshi, "Reliable Index for Measuring Information Flow," Physical Review E (Phys. Rev. E), pp. 061109, 2011. [APS]

Conference Papers

  1. Dongseok Shim, Julian Tanke, Kengo Uchida, Christian Simon, Koichi Saito, Takashi Shibuya, Shusuke Takahashi, Yuki Mitsufuji, "Odoriko: A Shape-Aware Multimodal Diffusion Framework for Human Motion," European Conference on Computer Vision (ECCV), 2026. [arXiv] [demo]
  2. Yuya Kobayashi, Masato Ishii, Yuhta Takida, Takashi Shibuya, Yuki Mitsufuji, "Spectral Prior for Reducing Exposure Bias in Diffusion Models," European Conference on Computer Vision (ECCV), 2026.
  3. Akio Hayakawa, Masato Ishii, Takashi Shibuya, Yuki Mitsufuji, "Step-by-Step Video-to-Audio Synthesis via Negative Audio Guidance," European Conference on Computer Vision (ECCV), 2026. [arXiv] [demo]
  4. Christian Simon, Masato Ishii, Wei-Yao Wang, Koichi Saito, Akio Hayakawa, Dongseok Shim, Zhi Zhong, Shuyang Cui, Takashi Shibuya, Shusuke Takahashi, Yuki Mitsufuji, "Echoes Over Time: Unlocking Length Generalization in Video-to-Audio Generation Models," IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), pp. 15840–15849, 2026. [CVF] [arXiv] [demo]
  5. Yuhta Takida, Satoshi Hayakawa, Takashi Shibuya, Masaaki Imaizumi, Naoki Murata, Bac Nguyen, Toshimitsu Uesaka, Chieh-Hsin Lai, Yuki Mitsufuji, "SONA: Learning Conditional, Unconditional, and Matching-Aware Discriminator," International Conference on Learning Representations (ICLR), 2026. [OpenReview] [arXiv]
  6. Zachary Novack, Koichi Saito, Zhi Zhong, Takashi Shibuya, Shuyang Cui, Julian McAuley, Taylor Berg-Kirkpatrick, Christian Simon, Shusuke Takahashi, Yuki Mitsufuji, "FlashFoley: Fast Interactive Sketch2Audio Generation," IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), pp. 15497–15501, 2026. [IEEE] [demo]
  7. Kazuki Shimada*, Christian Simon*, Takashi Shibuya, Shusuke Takahashi, Yuki Mitsufuji, "SAVGBench: Benchmarking Spatially Aligned Audio-Video Generation," IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), pp. 11977–11981, 2026. [IEEE] [arXiv] [code] [dataset]
  8. Azalea Gui, Woosung Choi, Junghyun Koo, Kazuki Shimada, Takashi Shibuya, Joan SerrΓ , Wei-Hsiang Liao, Yuki Mitsufuji, "Towards Blind Data Cleaning: A Case Study in Music Source Separation," IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), pp. 14882–14886, 2026. [IEEE] [arXiv]
  9. Junyoung Seo*, Jisang Han*, Jaewoo Jung*, Siyoon Jin, Joungbin Lee, Takuya Narihira, Kazumi Fukuda, Takashi Shibuya, Donghoon Ahn, Shoukang Hu, Seungryong Kim, Yuki Mitsufuji, "Video Camera Trajectory Editing with Generative Rendering from Estimated Geometry," AAAI Conference on Artificial Intelligence (AAAI), pp. 8787–8795, 2026. [AAAI] [arXiv] [code] [demo]
  10. Yuanhong Chen, Kazuki Shimada, Christian Simon, Yukara Ikemiya, Takashi Shibuya, Yuki Mitsufuji, "CCStereo: Audio-Visual Contextual and Contrastive Learning for Binaural Audio Generation," ACM International Conference on Multimedia (ACMMM), pp. 7510–7518, 2025. [ACM] [arXiv] [code] – ACM Showcase
  11. Christian Simon, Masato Ishii, Akio Hayakawa, Zhi Zhong, Shusuke Takahashi, Takashi Shibuya, Yuki Mitsufuji, "TITAN-Guide: Taming Inference-Time Alignment for Guided Text-to-Video Diffusion Models," International Conference on Computer Vision (ICCV), pp. 16662–16671, 2025. [CVF] [IEEE] [arXiv] [demo]
  12. Masato Ishii, Akio Hayakawa, Takashi Shibuya, Yuki Mitsufuji, "A Simple but Strong Baseline for Sounding Video Generation: Effective Adaptation of Audio and Video Diffusion Models for Joint Generation," IEEE International Joint Conference on Neural Networks (IJCNN), 2025. [IEEE] [arXiv] [code]
  13. Yuya Kobayashi, Yuhta Takida, Takashi Shibuya, Yuki Mitsufuji, "Efficiency without Compromise: CLIP-aided Text-to-Image GANs with Increased Diversity," IEEE International Joint Conference on Neural Networks (IJCNN), 2025. [IEEE] [arXiv]
  14. Christian Marinoni*, Riccardo Fosco Gramaccioni*, Kazuki Shimada, Takashi Shibuya, Yuki Mitsufuji, Danilo Comminiello, "StereoSync: Spatially-Aware Stereo Audio Generation from Video," IEEE International Joint Conference on Neural Networks (IJCNN), 2025. [IEEE] [arXiv]
  15. Anubhav Jain, Yuya Kobayashi, Takashi Shibuya, Yuhta Takida, Nasir Memon, Julian Togelius, Yuki Mitsufuji, "Classifier-Free Guidance inside the Attraction Basin May Cause Memorization," IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), pp. 12871–12879, 2025. [CVF] [IEEE] [arXiv] [code]
  16. Ho Kei Cheng, Masato Ishii, Akio Hayakawa, Takashi Shibuya, Alexander Schwing, Yuki Mitsufuji, "MMAudio: Taming Multimodal Joint Training for High-Quality Video-to-Audio Synthesis," IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), pp. 28901–28911, 2025. [CVF] [IEEE] [arXiv] [code] [demo] [colab]
  17. Ayano Hiranaka*, Shang-Fu Chen*, Chieh-Hsin Lai*, Dongjun Kim, Naoki Murata, Takashi Shibuya, Wei-Hsiang Liao, Shao-Hua Sun, Yuki Mitsufuji, "HERO: Human-Feedback Efficient Reinforcement Learning for Online Diffusion Model Finetuning," International Conference on Learning Representations (ICLR), pp. 54942–54971, 2025. [ICLR] [OpenReview] [arXiv] [code] [demo]
  18. Akio Hayakawa, Masato Ishii, Takashi Shibuya, Yuki Mitsufuji, "MMDisCo: Multi-Modal Discriminator-Guided Cooperative Diffusion for Joint Audio and Video Generation," International Conference on Learning Representations (ICLR), pp. 54368–54393, 2025. [ICLR] [OpenReview] [arXiv] [code]
  19. Koichi Saito, Dongjun Kim, Takashi Shibuya, Chieh-Hsin Lai, Zhi Zhong, Yuhta Takida, Yuki Mitsufuji, "SoundCTM: Unifying Score-based and Consistency Models for Full-band Text-to-Sound Generation," International Conference on Learning Representations (ICLR), pp. 57803–57832, 2025. [ICLR] [OpenReview] [arXiv] [code] [demo]
  20. Junyoung Seo, Kazumi Fukuda, Takashi Shibuya, Takuya Narihira, Naoki Murata, Shoukang Hu, Chieh-Hsin Lai, Seungryong Kim, Yuki Mitsufuji, "GenWarp: Single Image to Novel Views with Semantic-Preserving Generative Warping," Neural Information Processing Systems (NeurIPS), pp. 80220–80243, 2024. [NeurIPS] [arXiv] [code] [demo]
  21. Marco ComunitΓ *, Zhi Zhong*, Akira Takahashi, Shiqi Yang, Mengjie Zhao, Koichi Saito, Yukara Ikemiya, Takashi Shibuya, Shusuke Takahashi, Yuki Mitsufuji, "SpecMaskGIT: Masked Generative Modeling of Audio Spectrograms for Efficient Audio Synthesis and Beyond," International Society for Music Information Retrieval Conference (ISMIR), pp. 420–428, 2024. [ISMIR] [arXiv] [demo]
  22. Mengjie Zhao, Junya Ono, Zhi Zhong, Chieh-Hsin Lai, Yuhta Takida, Naoki Murata, Wei-Hsiang Liao, Takashi Shibuya, Hiromi Wakaki, Yuki Mitsufuji, "On the Language Encoder of Contrastive Cross-modal Models," Findings of the Annual Meeting of the Association for Computational Linguistics (ACL Findings), pp. 4923–4940, 2024. [ACL] [arXiv]
  23. Yuhta Takida, Masaaki Imaizumi, Takashi Shibuya, Chieh-Hsin Lai, Toshimitsu Uesaka, Naoki Murata, Yuki Mitsufuji, "SAN: Inducing Metrizability of GAN with Discriminative Normalized Linear Layer," International Conference on Learning Representations (ICLR), pp. 9609–9641, 2024. [ICLR] [OpenReview] [arXiv] [code] [demo]
  24. Takashi Shibuya, Yuhta Takida, Yuki Mitsufuji, "BigVSAN: Enhancing GAN-based Neural Vocoders with Slicing Adversarial Network," IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), pp. 10121–10125, 2024. [IEEE] [arXiv] [demo] [code]
  25. Hao Shi, Kazuki Shimada, Masato Hirano, Takashi Shibuya, Yuichiro Koyama, Zhi Zhong, Shusuke Takahashi, Tatsuya Kawahara, Yuki Mitsufuji, "Diffusion-Based Speech Enhancement with Joint Generative and Predictive Decoders," IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), pp. 12951–12955, 2024. [IEEE] [arXiv]
  26. Kazuki Shimada, Kengo Uchida, Yuichiro Koyama, Takashi Shibuya, Shusuke Takahashi, Yuki Mitsufuji, Tatsuya Kawahara, "Zero- and Few-shot Sound Event Localization and Detection," IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), pp. 636–640, 2024. [IEEE] [arXiv]
  27. Zhi Zhong, Hao Shi, Masato Hirano, Kazuki Shimada, Kazuya Tateishi, Takashi Shibuya, Shusuke Takahashi, Yuki Mitsufuji, "Extending Audio Masked Autoencoders Toward Audio Restoration," IEEE Workshop on Applications of Signal Processing to Audio and Acoustics (WASPAA), 2023. [IEEE] [arXiv] [demo]
  28. Ryosuke Sawata, Naoki Murata, Yuhta Takida, Toshimitsu Uesaka, Takashi Shibuya, Shusuke Takahashi, Yuki Mitsufuji, "Diffiner: A Versatile Diffusion-based Generative Refiner for Speech Enhancement," Annual Conference of the International Speech Communication Association (INTERSPEECH), pp. 3824–3828, 2023. [ISCA] [arXiv] [code]
  29. Yuhta Takida, Takashi Shibuya, Wei-Hsiang Liao, Chieh-Hsin Lai, Junki Ohmura, Toshimitsu Uesaka, Naoki Murata, Shusuke Takahashi, Toshiyuki Kumakura, Yuki Mitsufuji, "SQ-VAE: Variational Bayes on Discrete Representation with Self-annealed Stochastic Quantization," International Conference on Machine Learning (ICML), pp. 20987–21012, 2022. [PMLR] [arXiv] [code]
  30. Dong-Ho Lee, Akshen Kadakia, Kangmin Tan, Mahak Agarwal, Xinyu Feng, Takashi Shibuya, Ryosuke Mitani, Toshiyuki Sekiya, Jay Pujara, Xiang Ren, "Good Examples Make a Faster Learner: Simple Demonstration-based Learning for Low-resource NER," Annual Meeting of the Association for Computational Linguistics (ACL), pp. 2687–2700, 2022. [ACL] [arXiv] [code]
  31. Takashi Shibuya, Mototsugu Abe, Masayuki Nishiguchi, "Audio Fingerprinting Robust against Reverberation and Noise based on Quantification of Sinusoidality," IEEE International Conference on Multimedia and Expo (ICME), 2013. [IEEE]
  32. Takatsugu Kuriyama, Takashi Shibuya, Tatsuya Harada, Yasuo Kuniyoshi, "Learning Interaction Rules through Compression of Sensori-Motor Causality Space," International Conference on Epigenetic Robotics (EPIROB), pp. 57–64, 2010.
  33. Takashi Shibuya, Tatsuya Harada, Yasuo Kuniyoshi, "Causality Quantification and Its Applications: Structuring and Modeling of Multivariate Time Series," ACM SIGKDD International Conference on Knowledge Discovery and Data Mining (KDD), pp. 787–796, 2009. [ACM]

Workshop Papers and Demos

  1. Zachary Novack, Koichi Saito, Zhi Zhong, Takashi Shibuya, Shuyang Cui, Julian McAuley, Taylor Berg-Kirkpatrick, Christian Simon, Shusuke Takahashi, Yuki Mitsufuji, "FlashFoley: Fast Interactive Sketch2Audio Generation," NeurIPS Workshop on AI for Music (NeurIPS AI4Music), 2025. [OpenReview] [demo]
  2. Zachary Novack, Koichi Saito, Zhi Zhong, Takashi Shibuya, Shuyang Cui, Julian McAuley, Taylor Berg-Kirkpatrick, Christian Simon, Shusuke Takahashi, Yuki Mitsufuji, "FlashFoley: Fast Interactive Sketch2Audio Generation," NeurIPS Workshop on Generative and Protective AI for Content Creation (NeurIPS GenProCC), 2025. [OpenReview] [demo]
  3. Kazuki Shimada, Archontis Politis, Iran R. Roman, Parthasaarathy Sudarsanam, David Diaz-Guerra, Ruchi Pandey, Kengo Uchida, Yuichiro Koyama, Naoya Takahashi, Takashi Shibuya, Shusuke Takahashi, Tuomas Virtanen, Yuki Mitsufuji, "Stereo Sound Event Localization and Detection with Onscreen/Offscreen Classification," Workshop on Detection and Classification of Acoustic Scenes and Events (DCASE Workshop), 2025. [DCASE] [arXiv] [code] [dataset]
  4. Kazuki Shimada*, Christian Simon*, Takashi Shibuya, Shusuke Takahashi, Yuki Mitsufuji, "SAVGBench: Benchmarking Spatially Aligned Audio-Video Generation," CVPR Workshop Sight and Sound (CVPR WSS), 2025. [arXiv]
  5. Julian Tanke, Takashi Shibuya, Kengo Uchida, Koichi Saito, Yuki Mitsufuji, "Dyadic Mamba: Long-term Dyadic Human Motion Synthesis," CVPR Workshop on Human Motion Generation (CVPR HuMoGen), 2025. [arXiv]
  6. Kengo Uchida, Takashi Shibuya, Yuhta Takida, Naoki Murata, Julian Tanke, Shusuke Takahashi, Yuki Mitsufuji, "MoLA: Motion Generation and Editing with Latent Diffusion Enhanced by Adversarial Training," CVPR Workshop on Human Motion Generation (CVPR HuMoGen), 2025. [arXiv] [code] [demo]
  7. Takashi Shibuya, Takehito Utsuro, "Embedded Topic Models Enhanced by Wikification," EMNLP Workshop on Advancing Natural Language Processing for Wikipedia (EMNLP WikiNLP), pp. 80–90, 2024. [ACL] [arXiv]
  8. David Diaz-Guerra, Archontis Politis, Parthasaarathy Sudarsanam, Kazuki Shimada, Daniel A. Krause, Kengo Uchida, Yuichiro Koyama, Naoya Takahashi, Shusuke Takahashi, Takashi Shibuya, Yuki Mitsufuji, Tuomas Virtanen, "Baseline Models and Evaluation of Sound Event Localization and Detection with Distance Estimation in DCASE2024 Challenge," Workshop on Detection and Classification of Acoustic Scenes and Events (DCASE Workshop), pp. 41–45, 2024. [DCASE]
  9. Koichi Saito, Dongjun Kim, Takashi Shibuya, Chieh-Hsin Lai, Zhi Zhong, Yuhta Takida, Yuki Mitsufuji, "SoundCTM: Uniting Score-based and Consistency Models for Text-to-Sound Generation," NeurIPS Workshop on AI-Driven Speech, Music, and Sound Generation (NeurIPS Audio Imagination), 2024. [arXiv] [code] [demo]
  10. Masato Ishii, Akio Hayakawa, Takashi Shibuya, Yuki Mitsufuji, "A Simple but Strong Baseline for Sounding Video Generation: Effective Adaptation of Audio and Video Diffusion Models for Joint Generation," ECCV Workshop Audio-Visual Generation and Learning (ECCV AVGenL), 2024. [arXiv]
  11. Dong-Ho Lee, Akshen Kadakia, Brihi Joshi, Aaron Chan, Ziyi Liu, Kiran Narahari, Takashi Shibuya, Ryosuke Mitani, Toshiyuki Sekiya, Jay Pujara, Xiang Ren, "XMD: An End-to-End Framework for Interactive Explanation-Based Debugging of NLP Models," Annual Meeting of the Association for Computational Linguistics, System Demonstrations (ACL Demo), pp. 264–273, 2023. [ACL] [arXiv] [code] [demo]

Preprints

  1. Oh Hyun-Bin, Kazuki Shimada, Yuhta Takida, Kim Sung-Bin, Toshimitsu Uesaka, Takashi Shibuya, Kyeongyoon Lee, Tae-Hyun Oh, Yuki Mitsufuji, "Spatio-Temporal Audio Language Modeling for Dynamic Sound Sources," 2026. [arXiv]
  2. Weihan Xu*, Kan Jen Cheng*, Koichi Saito, Muhammad Jehanzeb Mirza, Tingle Li, Yisi Liu, Alexander H. Liu, Liming Wang, Masato Ishii, Takashi Shibuya, Yuki Mitsufuji, Gopala Anumanchipalli, Paul Pu Liang, "Schrodinger Audio-Visual Editor: Object-Level Audiovisual Removal," 2025. [arXiv]
  3. Zhengyang Yu, Akio Hayakawa, Masato Ishii, Qingtao Yu, Takashi Shibuya, Jing Zhang, Yuki Mitsufuji, "AutoRefiner: Improving Autoregressive Video Diffusion Models via Reflective Refinement Over the Stochastic Sampling Path," 2025. [arXiv]
  4. Masato Ishii, Akio Hayakawa, Takashi Shibuya, Yuki Mitsufuji, "Coherent Audio-Visual Editing via Conditional Audio Generation Following Video Edits," 2025. [arXiv]
  5. Koichi Saito, Julian Tanke, Christian Simon, Masato Ishii, Kazuki Shimada, Zachary Novack, Zhi Zhong, Akio Hayakawa, Takashi Shibuya, Yuki Mitsufuji, "SoundReactor: Frame-level Online Video-to-Audio Generation," 2025. [arXiv] [demo]
  6. Anubhav Jain, Yuya Kobayashi, Naoki Murata, Yuhta Takida, Takashi Shibuya, Yuki Mitsufuji, Niv Cohen, Nasir Memon, Julian Togelius, "Forging and Removing Latent-Noise Diffusion Watermarks Using a Single Image," 2025. [arXiv] [code]
  7. Shoukang Hu, Takuya Narihira, Kazumi Fukuda, Ryosuke Sawata, Takashi Shibuya, Yuki Mitsufuji, "HumanGif: Single-View Human Diffusion with Generative Prior," 2025. [arXiv] [code] [demo]
  8. Anubhav Jain, Yuya Kobayashi, Takashi Shibuya, Yuhta Takida, Nasir Memon, Julian Togelius, Yuki Mitsufuji, "TraSCE: Trajectory Steering for Concept Erasure," 2024. [arXiv] [code]
  9. Shiqi Yang, Zhi Zhong, Mengjie Zhao, Shusuke Takahashi, Masato Ishii, Takashi Shibuya, Yuki Mitsufuji, "Visual Echoes: A Simple Unified Transformer for Audio-Visual Generation," 2024. [arXiv]

Granted Patents

Academic Services and Activities

Workshop Organizer

  1. Organizer at ECCV 2026 Workshop on Generative AI for Audio-Visual Content Creation (Gen4AVC) [URL]
  2. Organizer at NeurIPS 2025 Workshop on Generative and Protective AI for Content Creation (GenProCC) [URL]
  3. Organizer at ICCV 2025 Workshop on AI for Content Generation, Quality Enhancement and Streaming (AIGENS) [URL]
  4. Organizer at ICCV 2025 Workshop on Generative AI for Audio-Visual Content Creation (Gen4AVC) [URL]