AGENT SANDBOX · ROLLOUT · AI INFRA

Agent 环境与
训练基础设施

我是刘辉。主要做大规模 Agent 沙箱、评测与 RL rollout 平台:把环境隔离、资源调度、轨迹生产和训练对接,做成稳定、可复现的系统。

180+单集群并行沙箱
99.5%采样任务成功率
15万+日均高质量轨迹
5.5×环境利用率提升

NEW SERIES · 9 CHAPTERS + LONGFORM

从 Manus 到 DART-GUI

我们如何为“会做事的智能体”造出强化学习基础设施。从方向判断、OSWorld、VERL 和 Rollout 瓶颈,一直写到 DART 四模块架构、环境平台、7B SOTA 与开源。

进入专题
  1. 01为什么训练会做事的 Agent
  2. 02OSWorld 与 VERL
  3. 03Rollout 性能墙
  4. 04DART 解耦架构
  5. 05环境、数据与训练闭环

SELECTED WORK

代表工作

从资源供给到轨迹回收,我关心的是整条链路能否规模化运行、快速定位问题,并在失败后自动恢复。

OPEN SOURCE

agent-env-pool

通过一个 API 批量管理 Docker / Kubernetes 环境:并行启动、健康检查、配额、复用和自动回收。

查看 GitHub
RESEARCH

DART-GUI

高效多轮 GUI Agent 强化学习框架。负责系统平台、环境与采样基础设施,并作为论文合作作者参与工程化落地。

项目、论文与模型

KNOWLEDGE MAP

长期实践的系统边界

环境不是一个容器,而是一组关于隔离、状态、时序、成本和正确性的工程契约。

01

Agent Runtime

GUI / Code / Browser 环境的生命周期、隔离、回收与可复现性。

  • Docker / runc
  • Kata / microVM
  • KubeVirt / QEMU
02

Rollout Infra

异步采样、轨迹调度、Reward 回传、模型池与训练侧对接。

  • veRL / Ray
  • vLLM
  • OSWorld
03

Resource Platform

CPU / GPU 资源台账、集群交付、状态机和失败恢复。

  • OpenStack / Ironic
  • Kubernetes
  • Ansible
04

Reliability

容量、压测、可观测、降级和自动止损,用系统能力替代人工值守。

  • 30 万 QPS
  • 99.99% 可用性
  • on-call

EXPERIENCE

做过什么

关于我
九章云极

Agentic RL Infra

建设 Agent 沙箱、评测与 rollout 平台;把 OpenStack、Kubernetes、Kata / KubeVirt、模型服务和训练链路接成可持续运行的基础设施。

金山云

云堡垒机 SaaS

负责云堡垒机 SaaS 化、一键开通、高可用部署与 Kafka 审计链路,让传统安全产品具备云上交付和免运维能力。

懂球帝

高并发与稳定性

参与世界杯全站 30 万 QPS 流量保障,建设压测、监控、限流降级和缓存治理体系,并完成关键接口性能优化。

FIELD NOTES

独立文章

全部文章
NOTE

从单机 Demo 到 180+ 并行沙箱:Agent 环境规模化的四个转折点

Agent 沙箱一旦进入大规模 rollout,真正困难的就不再是启动容器,而是状态、隔离、时序和失败恢复。

NOTE

Rollout 基础设施的核心不是并发,而是生命周期

从 observation 到 reward,如何用状态机、幂等和可观测性守住一条轨迹的正确性。

NOTE

把集群交付从脚本集合升级为可恢复的状态机

Precheck、Stage、Postcheck 不是流程文档,而应成为可以失败续跑、审计和复现的交付协议。

LET'S BUILD RELIABLE SYSTEMS

Agent 环境、RL Infra 与云原生平台