-
Hong Kong University of Science and Technology
- Hong Kong
- https://yiyangcai.github.io/
Stars
Code for the paper HOMIE: Human-object Centric Video Personalization via Multimodal Intelligent Enhancement
Infinite Worlds with Versatile Interactions
EchoStyle: Unlocking High-Fidelity Video Stylization with Reverse Data Synthesis
DomainShuttle: Freeform Open Domain Subject-driven Text-to-video Generation
A Minimal and Elegant Framework & Tutorial for Real-Time Interactive World Models
[ICLR 2026 Oral] DiffusionNFT: Online Diffusion Reinforcement with Forward Process
DreamX-World: A General-Purpose Interactive World Model
HY-World 2.0: A Multi-Modal World Model for Reconstructing, Generating, and Simulating 3D Worlds
Phantom-Data: Towards a General Subject-Consistent Video Generation Dataset
[ECCV 2026] Official PyTorch implementation of RefAlign: Representation Alignment for Reference-to-Video Generation
[ICLR 26 Oral] Stable Video Infinity: Infinite-Length Video Generation with Error Recycling
VILA is a family of state-of-the-art vision language models (VLMs) for diverse multimodal AI tasks across the edge, data center, and cloud.
[NeurIPS 2025] Codes for paper Foundation Cures Personalization: Improving Personalized Models' Prompt Consistency via Hidden Foundation Knowledge
[ACM SIGGRAPH 2025] DAM-VSR: Disentanglement of Appearance and Motion for Video Super-Resolution
Echo-4o: Harnessing Proprietary Models’ Synthetic Images for Improved Image Generation
"rsync for cloud storage" - Google Drive, S3, Dropbox, Backblaze B2, One Drive, Swift, Hubic, Wasabi, Google Cloud Storage, Azure Blob, Azure Files, Yandex Files
A simple and elegant Jekyll theme for an academic personal website
A simple Github Pages template for academic personal websites.
[CVPR2024 Highlight] VBench - We Evaluate Video Generation
A Distributed Attention Towards Linear Scalability for Ultra-Long Context, Heterogeneous Data Training
DeepSpeed is a deep learning optimization library that makes distributed training and inference easy, efficient, and effective.
🤗 PEFT: State-of-the-art Parameter-Efficient Fine-Tuning.
Emu Series: Generative Multimodal Models from BAAI
[CVPR 2025 Highlight🔥] Identity-Preserving Text-to-Video Generation by Frequency Decomposition
HunyuanVideo: A Systematic Framework For Large Video Generation Model
text and image to video generation: CogVideoX (2024) and CogVideo (ICLR 2023)
A minimal and beautiful Jekyll theme best for writing and note-taking.