Open models forproduction agents
One OpenAI-compatible endpoint for reasoning, coding, multimodal, and low-latency workloads.20+ models serverless today. 110+ more as dedicated endpoints.
Showing 137 models
DeepSeek V3.2
Context
160K
Params
685B MoE (37B active)
Min H100s
16
GLM 5
Context
195K
Params
744B MoE (40B active)
Min H100s
16
Kimi K2.5
Context
256K
Params
1T MoE (32B active)
Min H100s
24
GLM 4.7 Flash
Context
198K
Params
~106B MoE (lite)
Min H100s
1
DeepSeek R1
Context
160K
Params
685B MoE (37B active)
Min H100s
16
Qwen3-Embedding-8B
Context
40K
Params
8B
Min H100s
1
Qwen3.5 35B A3B
Context
256K
Params
35.95B MoE (3B active)
Min H100s
1
Qwen3-30B-A3B-Instruct-2507
Context
256K
Params
30B MoE (3B active)
Min H100s
1
Qwen3-VL 30B A3B Instruct
Context
256K
Params
30B MoE (3B active)
Min H100s
1
Laguna XS 2.1
Context
256K
Params
33.4B MoE (~3B active, est.)
Min H100s
1
Qwen3-Embedding-4B
Context
40K
Params
4B
Min H100s
1
Laguna M.1
Context
256K
Params
~230B MoE (est)
Min H100s
4
Ling 2.6 Flash
Context
128K
Params
~103B MoE (~6B active)
Min H100s
2
Qwen2.5 Coder 32B Instruct
Context
128K
Params
32B
Min H100s
1
Nomic Embed Text v1.5
Context
8K
Params
137M
Min H100s
1
DeepSeek R1 Distill Qwen 32B
Context
32K
Params
32B
Min H100s
1
DeepSeek R1 Distill Qwen 1.5B
Context
32K
Params
1.5B
Min H100s
1
MiniMax M2.5
Context
192K
Params
~456B MoE (45B active)
Min H100s
4
Phi 4 Multi Modal Instruct
Context
128K
Params
14B
Min H100s
1
MiMo V2.5
Context
1.0M
Params
311B MoE (8/256 experts active)
Min H100s
8
Gemma 3n E4B Instruct
Context
32K
Params
~5B (selective)
Min H100s
1
GPT-OSS Safeguard 20B
Context
128K
Params
21.51B dense
Min H100s
1
Qwen3-Next 80B A3B Instruct
Context
256K
Params
80B MoE (3B active)
Min H100s
2
Qwen3 235B A22B 2507
Context
256K
Params
235B MoE (22B active)
Min H100s
4
BERT Base Uncased
Context
512
Params
110M
Min H100s
1
mxbai Embed Large v1
Context
512
Params
0.34B
Min H100s
1
Qwen3-VL 235B A22B Instruct
Context
256K
Params
235B MoE (22B active)
Min H100s
4
Voxtral Small 24B
Context
128K
Params
24.26B dense
Min H100s
1
UI-TARS 1.5 7B
Context
125K
Params
8.29B dense
Min H100s
1
Granite 4.0 H Micro
Context
128K
Params
3.19B dense
Min H100s
1
GLM 4.7
Context
198K
Params
~355B MoE (32B active)
Min H100s
8
Qwen3.5 122B A10B
Context
256K
Params
125.09B MoE (10B active)
Min H100s
4
Qwen3 Coder Next
Context
256K
Params
80B MoE (3B active)
Min H100s
4
Qwen3.5 397B A17B
Context
256K
Params
397B MoE (17B active)
Min H100s
8
Nex-N2-Pro
Context
256K
Params
397B MoE (17B active)
Min H100s
8
Nemotron 3 Ultra 550B A55B
Context
256K
Params
550B MoE (55B active)
Min H100s
16
Qwen3 Coder 480B A35B
Context
256K
Params
480B MoE (35B active)
Min H100s
8
DeepSeek V4 Pro
Context
1.0M
Params
1.6T MoE (49B active)
Min H100s
24
DeepSeek V3 0324
Context
160K
Params
685B MoE (37B active)
Min H100s
16
DeepSeek V3.1
Context
160K
Params
684.53B MoE (37B active)
Min H100s
16
Kimi 2.6
Context
256K
Params
1T MoE (32B active)
Min H100s
24
DeepSeek R1 0528
Context
160K
Params
685B MoE (37B active)
Min H100s
16
Hunyuan A13B Instruct
Context
128K
Params
80B MoE (13B active)
Min H100s
2
Llama 4 Maverick
Context
1.0M
Params
400B MoE (17B active)
Min H100s
16
Mistral 7B Instruct v0.2
Context
128K
Params
7B
Min H100s
1
DeepSeek V3
Context
32K
Params
685B MoE (37B active)
Min H100s
16
Hy3-preview
Context
256K
Params
295B MoE (21B active)
Min H100s
8
Kimi K2.7-Code
Context
256K
Params
1T MoE (32B active)
Min H100s
24
Llama 4 Scout 17B 16E
Context
9.5M
Params
109B MoE (17B active, 16 experts)
Min H100s
16
NVIDIA Nemotron 3 Nano 30B A3B FP8
Context
256K
Params
30B MoE (3B active)
Min H100s
1
Voxtral Mini 4B Realtime
Context
128K
Params
4B (3.4B LM + 0.97B audio enc)
Min H100s
1
Distil-Whisper Large V3
Params
756M
Min H100s
1
Trinity Large Thinking
Context
256K
Params
~70B (est)
Min H100s
8
Kimi K2 Thinking
Context
128K
Params
1T MoE (32B active)
Min H100s
16
Nemotron 3.5 ASR Streaming 0.6B
Params
600M
Min H100s
1
Inkling
Context
1.0M
Params
~952B MoE
Min H100s
24
Kimi K2 Instruct
Context
128K
Params
1T MoE (32B active)
Min H100s
16
MiMo V2 Flash
Context
256K
Params
~30B MoE (5B active est)
Min H100s
8
Qwen-AgentWorld-35B-A3B
Context
256K
Params
35B MoE (3B active)
Min H100s
1
Agents-A1 4B
Context
256K
Params
4.5B dense
Min H100s
1
LongCat 2.0
Context
256K
Params
~1.78T MoE (768 routed experts)
Min H100s
32
Nemotron Speech Streaming 0.6B
Params
600M
Min H100s
1
MOSS Transcribe Diarize
Params
0.91B
Min H100s
1
Nanbeige 4.2 3B
Context
256K
Params
4.2B dense
Min H100s
1
Serverless pricing is the live Token Factory rate card, per million tokens unless otherwise noted, same rates as the Token Factory catalog. Dedicated endpoints are billed per GPU-hour. See pricing or compare options in serverless vs dedicated.
Don't see a model you're interested in?