VideoCoCo는 물리 과정을 먼저 코드로 실행하고, 그 다음 영상을 만든다
VideoCoCo는 Blender 코드로 물리 과정의 저해상도 초안을 먼저 실행한 뒤 비디오 편집 모델로 사실적 영상을 만드는 Code-as-CoT 이중 엔진 접근으로, 물리 일관성 비디오 생성의 제어 가능한 중간 표현을 제안한다.
Blog
VideoCoCo는 Blender 코드로 물리 과정의 저해상도 초안을 먼저 실행한 뒤 비디오 편집 모델로 사실적 영상을 만드는 Code-as-CoT 이중 엔진 접근으로, 물리 일관성 비디오 생성의 제어 가능한 중간 표현을 제안한다.
Qwen-UI-Agent는 실제 기기 런타임, GUI·CLI 혼합 행동, 100턴 이상 온라인 RL, 능동형 harness를 하나의 폐루프로 묶어 모바일·컴퓨터·웹을 넘나드는 GUI 에이전트를 제안한다.
arXiv 2607.28527의 MANTA는 agent role·통신 link·실행 순서·정보 가시성·검증 경로를 inference-time trace에 맞춰 제한적으로 갱신하는 Multi-Agent Networ...
Moonshot AI의 Kimi K3는 2.8T parameter·104B activated MoE, 1M context, native vision을 내세운 모델이다. 96개 safetensors shard의 f...
Nanbeige4.2-3B는 반복 레이어를 쓰는 Looped Transformer와 실행 환경 기반 SFT·다단계 RL을 결합해 3B non-embedding parameter 안에서 코드 agent, offic...
Experience Distillation(EPD)은 agent가 실제 환경에서 모은 긴 시행착오 기록을 경험 context로 읽는 교사의 다음 결정으로 바꾼 뒤, 새 환경 상호작용이나 world model ro...
SetwiseEvalKit은 relevance·authenticity·quality부터 complementarity·redundancy·conflict, completeness·density·reachabilit...
NVIDIA-labs Object-Oriented Agents(NOOA)는 field를 state, method를 capability, docstring을 prompt, type annotation을 contra...
Visual Contrastive Self-Distillation(VCSD)은 EMA teacher가 원본 이미지와 content-erased control에서 낸 token distribution의 차이를 이용...
ReferTrack은 자연어로 지정된 보행자를 indexed bounding box 중 하나로 먼저 고르는 Refer-CoT와, 선택한 box의 시간적 궤적을 보존하는 TVBI memory를 결합해 단일 전방 카...
BAAI의 AREX는 provisional answer를 제약별로 감사해 accept·refine·restart를 고르고, 검증된 근거와 미해결 조건만 남기는 autonomous context update로 긴...
Sionic은 B300에서 753B MoE GLM-5.2의 batch-1 생성을 600~1000 tok/s로 끌어올렸다고 보고한다. 핵심은 SASS·TMEM 기반 커널, live FP8 quantization,...
DocOps는 XLSX·DOCX·PPTX·PDF의 native state를 직접 검사하는 deterministic verifier와 210개 Harbor task로, 문서 에이전트의 장기 상태 추적·의미 검증·비...