连上WiFi,
即可训练大模型

PyTRIO 把底层训练逻辑、LoRA 与全托管 GPU 集群装进一个干净的 SDK——你写训练循环,引擎处理调度、容错与算力的一切。

Powered by

Built by

sft_qwen3.pypytrio sdk
1import pytrio as trio
2
3# 连接 PyTRIO 训练引擎
4service = trio.ServiceClient()
5
6# 创建 LoRA 训练客户端
7tc = service.create_lora_training_client(
8 base_model="Qwen/Qwen3.6-27B", rank=32,
9)
10
11# 训练循环,每一步都在你手里
12for batch in dataset:
13 tc.forward_backward(batch, "cross_entropy")
14 tc.optim_step(trio.AdamParams(learning_rate=1e-4))
15
16# 保存权重,立刻可推理
17sampler = tc.save_weights_and_get_sampling_client(
18 name="what-is-trio",
19)

supported models

主流开源模型,开箱即训

Qwen3.6 27BQwen/Qwen3.6-27B
Qwen3 8BQwen/Qwen3-8B
Gemma 4 12Bgoogle/gemma-4-12B
Llama 3.1 8Bmeta-llama/Llama-3.1-8B
DeepSeek V4 Flashdeepseek-ai/DeepSeek-V4-Flash
Gemma 3 27Bgoogle/gemma-3-27b-it
更多模型持续接入 …
forward_backward()optim_step()sample()save_state()load_state()get_tokenizer()AdamParams()save_weights_and_get_sampling_client()create_lora_training_client()load_weights()resume_state()get_training_metrics()

why PyTRIO

创新的大模型后训练体验

PyTRIO 不是黑盒微调服务——它把训练循环的每一个原语交还给你,同时把集群、调度与容错藏到水面之下。

训练原语,完全掌控

损失函数、优化器、训练循环全部显式可见。你失去的只有黑盒,得到的是研究级的自由度。

forward_backward()

前向反向计算,损失函数随你定义

optim_step()

Adam 优化器更新,超参显式传入

sample()

对任意权重采样,评估即时可得

save_state()

权重与优化器状态,随存随取

全托管分布式引擎

不碰 CUDA、不管集群。一次 forward_backward,引擎负责把它铺到所有卡上。

权重即资产

训练与采样权重统一管理:可下载、可续训、可直接挂载推理。

TRAINqwen3.5-14b-sft/01202 分钟前
SAMPLERqwen3.5-14b-sft/sampler刚刚
TRAINgemma4-12b-dpo/0064昨天

OpenAI 兼容推理

训练完的权重就是一个 model 字符串,现有应用一行配置直接切换。

client = OpenAI(
base_url="https://pytrio.com/api/openai/v1",
api_key=TRIO_API_KEY,
)
resp = client.chat.completions.create(
model="trio://what-is-trio/0015",
)

透明用量与计费

按 token 计费,用量实时可查,每一分钱都能对到训练步。

1,284,032

本月已训练 tokens

训练过程,实时回传

loss 曲线、吞吐与事件流实时回到你的终端和工作台,亦可一键接入 SwanLab。

0.842

loss / token

12,480

tokens / s

96%

GPU util

streaming workflow

和 AI Infra 复杂性说再见

传统训练把环境、模型、代码和算力全部塞进一次性容器;PyTRIO 把数据、训练脚本、GPU 集群与推理调用拆成可流动的链路,让实验可以随时启动、随时调整、随时接入评测。

传统大模型开发流程与使用 PyTRIO 训练的对比流程图

流式训练,随训随起

数据分片按需流入 PyTRIO 后端,模型权重随分片更新,任务可随时启动、暂停和恢复。

支持万亿参数 LLM LoRA 训练

已验证 DeepSeek V4 LoRA,并支持 Qwen、Kimi、GLM 等主流开源模型。

精度对齐传统方案

训练精度对齐传统 GPU 容器方案,同时保留指标、检查点与训练轨迹。

支持Agentic RL、SFT等范式

覆盖 RL、SFT 等后训练方式,并兼容 PPO、GRPO、DAPO 等主流训练方法。

model coverage

支持丰富的模型

覆盖 Qwen、Kimi、DeepSeek 等主流开源基模,统一支持 Dense、MoE 与多模态 VLM,从快速微调到大规模后训练都可以直接接入。

Qwen8 models
Qwen3.5-4BDense
Qwen3.6-27BDense
Qwen3.5-35B-A3BMoE
Qwen3.5-397B-A17BMoE
Qwen3-8B-BaseDense
Qwen3-4B-Instruct-2507Dense
Qwen3-VL-30B-A3B-InstructVLM, MoE
Qwen3-VL-235B-A22B-InstructVLM, MoE
Kimi2 models
Kimi-K2.7-CodeMoE
Kimi-K2.6MoE
DeepSeek2 models
DeepSeek-V4-FlashMoE
DeepSeek-V4-ProMoE

api primitives

灵活强大的 API,PyTorch 般精确定义训练行为

从连接云端算力、创建训练客户端,到梯度更新、采样与状态保存,PyTRIO 提供清晰可组合的底层 API,让研究者保留实验控制权,也让工程团队更容易把训练流程产品化。

import pytrio as trioclient = trio.ServiceClient()training_client = client.create_lora_training_client(    base_model="Qwen/Qwen3.6-27B",    rank=32,)...for batch in dataloader:    ...    fwd = training_client.forward_backward(...)    step_result = training_client.optim_step(...)...training_client.sample("What can PyTRIO help me build today?")training_client.save_state("quickstart-train-state")

ServiceClient

创建与云端计算引擎的连接

create_lora_training_client

创建 LoRA 训练客户端,选择基础模型与 rank

forward_backward

执行前向传播和后向传播,累积梯度

optim_step

根据累积的梯度更新权重

sample

生成用于人机交互、模型评估或强化学习动作的 token

save_state

保存训练进度以备未来续训

virtual environments

灵活接入虚拟环境的潜力

通过统一训练 API 连接世界模型、工业仿真、游戏世界、UI 设计、芯片设计与 AR 显示环境,让模型训练从单一任务扩展到更广的交互场景与评估闭环。

PyTRIO API 连接世界模型自动训练与评估、垂域零部件设计模型训练、AI 驱动的游戏世界、自动训练个性化 UI 设计风格模型、芯片自动设计模型训练、个人性智能眼镜 AR 显示模型
“通往 AGI,研究效率是关键。糟糕的基础设施和由此产生的海量重复脏活,是创新研究的敌人。PyTRIO 希望让研究者专注于算法本身,而不是被复杂环境干扰思考、拖慢进展。把专注留给用户,把困难留给我们。

creation scenarios

在这些场景为你创造价值

从持续学习、Agentic RL 到在线 Agent 和具身智能,PyTRIO 用同一套训练接口承接数据、环境、反馈与策略更新。

持续学习
Agentic RL
SFT
在线 Agent
训练策略验证
具身智能

faq

常见问题

从模型支持、算力调度到训练恢复,快速了解 PyTRIO 的核心使用方式。

PyTRIO 适合哪些训练任务?

适合 LLM 后训练任务:SFT、RL/GRPO、DPO/偏好优化、RLHF、多轮/多智能体 RL,以及数学、代码、推理、Agent、垂直领域数据适配等场景。PyTRIO 文档把主流程定位为 SFT 和 RL,并提供 DPO、RLHF、多智能体等教程。

支持哪些开源模型?

支持主流开放权重模型,覆盖 dense 和 MoE、文本和视觉模型;切换模型通常只需改 base_model 字符串。我们支持 Qwen 系列等大模型。

需要自己管理 GPU 集群吗?

不需要。你在本地写训练循环和算法逻辑,PyTRIO 负责分布式训练、GPU 调度、资源管理和基础设施可靠性。

训练过程如何监控和恢复?

训练可通过 SDK/CLI 查看运行状态、保存/加载权重与 checkpoint;底层硬件故障和分布式训练可靠性由 PyTRIO 处理。

已有 PyTorch 或 LoRA 代码能迁移吗?

可以。PyTorch 训练循环通常保留在本地,将梯度计算、优化、采样等步骤替换为 PyTRIO API 调用;已有 LoRA 工作流也可迁移,PyTRIO 原生支持 LoRA 微调。

12+

支持开源基模

1,024

单任务弹性 GPU

99.9%

调度可用性

<60s

从安装到首次连接

Training Is On

开始你的第一次训练

一条命令安装 SDK,几行代码连上训练引擎。剩下的,交给 PyTRIO。