流式训练,随训随起
数据分片按需流入 PyTRIO 后端,模型权重随分片更新,任务可随时启动、暂停和恢复。
supported models
why PyTRIO
PyTRIO 不是黑盒微调服务——它把训练循环的每一个原语交还给你,同时把集群、调度与容错藏到水面之下。
损失函数、优化器、训练循环全部显式可见。你失去的只有黑盒,得到的是研究级的自由度。
forward_backward()
前向反向计算,损失函数随你定义
optim_step()
Adam 优化器更新,超参显式传入
sample()
对任意权重采样,评估即时可得
save_state()
权重与优化器状态,随存随取
不碰 CUDA、不管集群。一次 forward_backward,引擎负责把它铺到所有卡上。
训练与采样权重统一管理:可下载、可续训、可直接挂载推理。
训练完的权重就是一个 model 字符串,现有应用一行配置直接切换。
client = OpenAI(base_url="https://pytrio.com/api/openai/v1",api_key=TRIO_API_KEY,)resp = client.chat.completions.create(model="trio://what-is-trio/0015",)
按 token 计费,用量实时可查,每一分钱都能对到训练步。
本月已训练 tokens
loss 曲线、吞吐与事件流实时回到你的终端和工作台,亦可一键接入 SwanLab。
0.842
loss / token
12,480
tokens / s
96%
GPU util
streaming workflow
传统训练把环境、模型、代码和算力全部塞进一次性容器;PyTRIO 把数据、训练脚本、GPU 集群与推理调用拆成可流动的链路,让实验可以随时启动、随时调整、随时接入评测。
数据分片按需流入 PyTRIO 后端,模型权重随分片更新,任务可随时启动、暂停和恢复。
已验证 DeepSeek V4 LoRA,并支持 Qwen、Kimi、GLM 等主流开源模型。
训练精度对齐传统 GPU 容器方案,同时保留指标、检查点与训练轨迹。
覆盖 RL、SFT 等后训练方式,并兼容 PPO、GRPO、DAPO 等主流训练方法。
model coverage
覆盖 Qwen、Kimi、DeepSeek 等主流开源基模,统一支持 Dense、MoE 与多模态 VLM,从快速微调到大规模后训练都可以直接接入。
api primitives
从连接云端算力、创建训练客户端,到梯度更新、采样与状态保存,PyTRIO 提供清晰可组合的底层 API,让研究者保留实验控制权,也让工程团队更容易把训练流程产品化。
import pytrio as trioclient = trio.ServiceClient()training_client = client.create_lora_training_client( base_model="Qwen/Qwen3.6-27B", rank=32,)...for batch in dataloader: ... fwd = training_client.forward_backward(...) step_result = training_client.optim_step(...)...training_client.sample("What can PyTRIO help me build today?")training_client.save_state("quickstart-train-state")创建与云端计算引擎的连接
创建 LoRA 训练客户端,选择基础模型与 rank
执行前向传播和后向传播,累积梯度
根据累积的梯度更新权重
生成用于人机交互、模型评估或强化学习动作的 token
保存训练进度以备未来续训
virtual environments
通过统一训练 API 连接世界模型、工业仿真、游戏世界、UI 设计、芯片设计与 AR 显示环境,让模型训练从单一任务扩展到更广的交互场景与评估闭环。
“通往 AGI,研究效率是关键。糟糕的基础设施和由此产生的海量重复脏活,是创新研究的敌人。PyTRIO 希望让研究者专注于算法本身,而不是被复杂环境干扰思考、拖慢进展。把专注留给用户,把困难留给我们。”
Zeyi-Lin
PyTRIO产品负责人
creation scenarios
从持续学习、Agentic RL 到在线 Agent 和具身智能,PyTRIO 用同一套训练接口承接数据、环境、反馈与策略更新。
faq
从模型支持、算力调度到训练恢复,快速了解 PyTRIO 的核心使用方式。
适合 LLM 后训练任务:SFT、RL/GRPO、DPO/偏好优化、RLHF、多轮/多智能体 RL,以及数学、代码、推理、Agent、垂直领域数据适配等场景。PyTRIO 文档把主流程定位为 SFT 和 RL,并提供 DPO、RLHF、多智能体等教程。
支持主流开放权重模型,覆盖 dense 和 MoE、文本和视觉模型;切换模型通常只需改 base_model 字符串。我们支持 Qwen 系列等大模型。
不需要。你在本地写训练循环和算法逻辑,PyTRIO 负责分布式训练、GPU 调度、资源管理和基础设施可靠性。
训练可通过 SDK/CLI 查看运行状态、保存/加载权重与 checkpoint;底层硬件故障和分布式训练可靠性由 PyTRIO 处理。
可以。PyTorch 训练循环通常保留在本地,将梯度计算、优化、采样等步骤替换为 PyTRIO API 调用;已有 LoRA 工作流也可迁移,PyTRIO 原生支持 LoRA 微调。
支持开源基模
单任务弹性 GPU
调度可用性
从安装到首次连接