Yutong Wang

University of Sydney Ph.D. student, University of Sydney

I am Yutong Wang, a second-year Ph.D. student from the University of Sydney under the supervision of Prof. Chang Xu. Before that, I received my M.S. and B.S. degrees from Beijing Institute of Technology under the supervision of Prof. Dixin Luo and Prof. Hongteng Xu. My research interest mainly focuses on machine learning, especially multi-modal learning, optimal transport, video understanding and generation.


Education
  • University of Sydney

    University of Sydney

    Ph.D. in Computer Science Sep. 2025 - Present

  • Beijing Institute of Technology

    Beijing Institute of Technology

    M.S. in Computer Science Sep. 2022 - Jun. 2025

  • Beijing Institute of Technology

    Beijing Institute of Technology

    B.S. in Computer Science Sep. 2018 - Jun. 2022

Experience
  • Shanghai AI Lab

    Shanghai AI Lab

    Research Intern Apr. 2025 - Present

  • Ant Group

    Ant Group

    Research Intern Apr. 2024 - Oct. 2024

  • VRC Inc.

    VRC Inc.

    Research Intern Jul. 2023 - Sep. 2023

Selected Publications (view all )
VDOT++: Unified Few-Step Video Generation via Unbalanced Optimal Transport Distillation
VDOT++: Unified Few-Step Video Generation via Unbalanced Optimal Transport Distillation

Yutong Wang, Xingtong Ge, Enhuai Liu, Yunke Wang, Tianfan Xue, Yu Qiao, Yaohui Wang, Xinyuan Chen†, Chang Xu†(† corresponding author)

arXiv 2610.03221

-

VDOT++: Unified Few-Step Video Generation via Unbalanced Optimal Transport Distillation
VDOT++: Unified Few-Step Video Generation via Unbalanced Optimal Transport Distillation

Yutong Wang, Xingtong Ge, Enhuai Liu, Yunke Wang, Tianfan Xue, Yu Qiao, Yaohui Wang, Xinyuan Chen†, Chang Xu†(† corresponding author)

arXiv 2610.03221

-

PulseQuant: Propagation-Guided Subspace Correction for 4-Bit Video Diffusion Transformers
PulseQuant: Propagation-Guided Subspace Correction for 4-Bit Video Diffusion Transformers

Yutong Wang, Xingtong Ge, Enhuai Liu, Yunke Wang, Tianfan Xue, Xinyuan Chen†, Chang Xu†(† corresponding author)

arXiv 2609.33384

-

PulseQuant: Propagation-Guided Subspace Correction for 4-Bit Video Diffusion Transformers
PulseQuant: Propagation-Guided Subspace Correction for 4-Bit Video Diffusion Transformers

Yutong Wang, Xingtong Ge, Enhuai Liu, Yunke Wang, Tianfan Xue, Xinyuan Chen†, Chang Xu†(† corresponding author)

arXiv 2609.33384

-

BEAT: Rhythm-Elastic Alignment for Agentic Music-guided Movie Trailer Generation
BEAT: Rhythm-Elastic Alignment for Agentic Music-guided Movie Trailer Generation

Yutong Wang, Yunke Wang, Xinyuan Chen†, Chang Xu†(† corresponding author)

arXiv 2605.27067

-

BEAT: Rhythm-Elastic Alignment for Agentic Music-guided Movie Trailer Generation
BEAT: Rhythm-Elastic Alignment for Agentic Music-guided Movie Trailer Generation

Yutong Wang, Yunke Wang, Xinyuan Chen†, Chang Xu†(† corresponding author)

arXiv 2605.27067

-

PARE: Pruning and Adaptive Routing for Efficient Video Generation
PARE: Pruning and Adaptive Routing for Efficient Video Generation

Yutong Wang, Yunke Wang, Tianfan Xue, Yu Qiao, Yaohui Wang, Xinyuan Chen†, Chang Xu†(† corresponding author)

International Conference on Neural Information and Processing Systems, NeurIPS 2026 Conference

-

PARE: Pruning and Adaptive Routing for Efficient Video Generation
PARE: Pruning and Adaptive Routing for Efficient Video Generation

Yutong Wang, Yunke Wang, Tianfan Xue, Yu Qiao, Yaohui Wang, Xinyuan Chen†, Chang Xu†(† corresponding author)

International Conference on Neural Information and Processing Systems, NeurIPS 2026 Conference

-

VDOT: Efficient Unified Video Creation via Optimal Transport Distillation
VDOT: Efficient Unified Video Creation via Optimal Transport Distillation

Yutong Wang, Haiyu Zhang, Tianfan Xue, Yu Qiao, Yaohui Wang†, Chang Xu†, Xinyuan Chen†(† corresponding author)

Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, CVPR 2026 Conference

-

VDOT: Efficient Unified Video Creation via Optimal Transport Distillation
VDOT: Efficient Unified Video Creation via Optimal Transport Distillation

Yutong Wang, Haiyu Zhang, Tianfan Xue, Yu Qiao, Yaohui Wang†, Chang Xu†, Xinyuan Chen†(† corresponding author)

Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, CVPR 2026 Conference

-

Efficient Video Face Enhancement with Enhanced Spatial-Temporal Consistency
Efficient Video Face Enhancement with Enhanced Spatial-Temporal Consistency

Yutong Wang, Jiajie Teng, Jiajiong Cao, Yuming Li, Chenguang Ma, Hongteng Xu, Dixin Luo†(† corresponding author)

Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, CVPR 2025 Conference

-

Efficient Video Face Enhancement with Enhanced Spatial-Temporal Consistency
Efficient Video Face Enhancement with Enhanced Spatial-Temporal Consistency

Yutong Wang, Jiajie Teng, Jiajiong Cao, Yuming Li, Chenguang Ma, Hongteng Xu, Dixin Luo†(† corresponding author)

Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, CVPR 2025 Conference

-

An Inverse Partial Optimal Transport Framework for Music-guided Movie Trailer Generation
An Inverse Partial Optimal Transport Framework for Music-guided Movie Trailer Generation

Yutong Wang*, Sidan Zhu*, Hongteng Xu, Dixin Luo†(† corresponding author)

Proceedings of the 32th ACM International Conference on Multimedia, ACMMM 2024 Conference

-

An Inverse Partial Optimal Transport Framework for Music-guided Movie Trailer Generation
An Inverse Partial Optimal Transport Framework for Music-guided Movie Trailer Generation

Yutong Wang*, Sidan Zhu*, Hongteng Xu, Dixin Luo†(† corresponding author)

Proceedings of the 32th ACM International Conference on Multimedia, ACMMM 2024 Conference

-

Self-supervised Video Summarization Guided by Semantic Inverse Optimal Transport
Self-supervised Video Summarization Guided by Semantic Inverse Optimal Transport

Yutong Wang, Hongteng Xu, Dixin Luo†(† corresponding author)

Proceedings of the 31st ACM International Conference on Multimedia, ACMMM 2023 Conference

-

Self-supervised Video Summarization Guided by Semantic Inverse Optimal Transport
Self-supervised Video Summarization Guided by Semantic Inverse Optimal Transport

Yutong Wang, Hongteng Xu, Dixin Luo†(† corresponding author)

Proceedings of the 31st ACM International Conference on Multimedia, ACMMM 2023 Conference

-

All publications