Stars
PaddleOCR inference in PyTorch. Converted from [PaddleOCR](https://github.com/PaddlePaddle/PaddleOCR)
InternLM-XComposer2.5-OmniLive: A Comprehensive Multimodal System for Long-term Streaming Video and Audio Interactions
Hunyuan-DiT : A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding
Emote Portrait Alive: Generating Expressive Portrait Videos with Audio2Video Diffusion Model under Weak Conditions
Official implementation code of the paper <AnyText: Multilingual Visual Text Generation And Editing>
Release for Improved Denoising Diffusion Probabilistic Models
Official PyTorch Implementation of "Scalable Diffusion Models with Transformers"
[ICLR 2025] HD-Painter: High-Resolution and Prompt-Faithful Text-Guided Image Inpainting with Diffusion Models
The image prompt adapter is designed to enable a pretrained text-to-image diffusion model to generate images with image prompt.
Smooth Diffusion: Crafting Smooth Latent Spaces in Diffusion Models arXiv 2023 / CVPR 2024
This repository contains the source code for the paper First Order Motion Model for Image Animation
[ICLR 2024 Spotlight] Official implementation of ScaleCrafter for higher-resolution visual generation at inference time.
FreeU: Free Lunch in Diffusion U-Net (CVPR2024 Oral)
DreamSim: Learning New Dimensions of Human Visual Similarity using Synthetic Data (NeurIPS 2023 Spotlight) / / / / When Does Perceptual Alignment Benefit Vision Representations? (NeurIPS 2024)
[NeurIPS'23 Oral] Visual Instruction Tuning (LLaVA) built towards GPT-4V level capabilities and beyond.
[CVPR 2024] PAIR Diffusion: A Comprehensive Multimodal Object-Level Image Editor
Official PyTorch implementation of the paper "In-Context Learning Unlocked for Diffusion Models"
Prompt-Free Diffusion: Taking "Text" out of Text-to-Image Diffusion Models, arxiv 2023 / CVPR 2024
Forget-Me-Not: Learning to Forget in Text-to-Image Diffusion Models, 2023
[CVPR 2023] Official repository of Generative Semantic Segmentation
Code and models for the paper "One Transformer Fits All Distributions in Multi-Modal Diffusion"
Official Implementation for "Attend-and-Excite: Attention-Based Semantic Guidance for Text-to-Image Diffusion Models" (SIGGRAPH 2023)
Versatile Diffusion: Text, Images and Variations All in One Diffusion Model, arXiv 2022 / ICCV 2023
Build and share delightful machine learning apps, all in Python. 🌟 Star to support our work!