- Singapore
-
12:22
(UTC +08:00) - https://ruijiezhu94.github.io/ruijiezhu/
- in/ruijie-zhu-2969332a2
- @zhruji101109
Lists (12)
Sort Name ascending (A-Z)
Stars
[arxiv'26] GAE: Learning a Geometry-Native Latent Space for 3D-Consistent World Generation
AgentSTAR: Agentic Shape Tracking and Reconstruction from Monocular Videos
HyperFlow: Video Rebirth's 8-step LoRA for MiniMax-H3 on the diffusers Modular Pipeline
A comprehensive open-source 3A game-generation skill and asset framework.
A source-aware AI copilot for NTU freshmen, built with Next.js and Vercel AI SDK.
Marigold V2: Revisiting Diffusion Transformers for Monocular Depth Estimation
SoL-Pi: Scaling Auto-Research Loops for Efficient Agent Harnesses
Open source evals for physical AI. Run any LLM/VLA on any arm/humanoid against any real/sim benchmark.
Agentic 3D Modeling with Procedural Control — turns a text prompt into an editable parametric program, with optional per-part materials and articulation.
Code as World: Agentic Discovery of Executable World Representations for Physical Reasoning
StreamPI: Streaming Multimodal Temporal Modeling for Vision-Language-Action Models
Zing-0.5: Toward Playable Worlds with Real-Time Joint Action and Text Control
[RSS'26] Welcome to Psi-Zero, a Humanoid VLA towards Universal Humanoid Intelligence.
Block3D: Efficient Text-to-3D Generation via Block-Wise Diffusion
BEHAVIOR-1K: a platform for accelerating Embodied AI research. Join our Discord for support: https://discord.gg/bccR5vGFEx
[CVPR 2026 Highlight] A Frame is Worth One Token: Efficient Generative World Modeling with Delta Tokens
[SIGGRAPH Asia 2026] 4DAnyone: Create Anyone in 4D from a Casual Monocular Video
DeepSeek Harness: Everything is a Plugin.
HarnessEval-W: Agentifying the Evaluation of Visual Worlds
SCoPE: Sightline-Coordinate Positional Encoding for 3D-Aware Video Generation
Sekai2: From World Exploration to Interactive World Modeling
[Tech Report] Context Scaling: Scaling Properties of Text Conditioning in Visual Generation
[SIGGRAPH Asia 2026][TOG 2026] InfiniSplat: Implicit Gaussian Decoding for Large-Baseline Monocular View Synthesis