asiai speedometer logo Open source · Apache 2.0 · Zero dependencies

Apple Silicon 本地 LLM 的速度测试让你的AI智能体
洞察推理状态

让 Ollama、LM Studio、mlx-lm、llama.cpp 及另外六个引擎一对一对决 — tok/s、TTFT、功耗与温度,一条命令搞定。asiai的REST API让你的AI智能体自主监控、诊断和优化本地LLM基础设施。

$pip install asiai
$asiai bench# 15s → your first comparison
Python 3.11+ · stdlib only · 10 engines auto-detected · agent-ready API
GET /api/status ≤ 500ms
{
  "chip": "Apple M4 Pro",
  "ram_gb": 64.0,
  "memory_pressure": "normal",
  "gpu_utilization_percent": 45.2,
  "engines": {
    "ollama": { "running": true, "models_loaded": 2 },
    "lmstudio": { "running": true, "models_loaded": 1 }
  }
}
GET /api/snapshot Full state
{
  "system": {
    "chip": "Apple M4 Pro",
    "gpu_cores": 20,
    "gpu_utilization_percent": 45.2,
    "thermal_state": "nominal"
  },
  "engines": [{
    "name": "ollama",
    "models": [{ "name": "qwen3.5:latest", "size_params": "35B" }]
  }]
}

本地LLM的问题

听起来熟悉吗?

01

碎片化

Ollama、LM Studio、mlx-lm — 各有各的CLI、格式和指标。毫无统一标准。

02

盲目

没有实时VRAM监控,没有功耗追踪,没有温度告警。完全在盲飞。

03

手动

跑分意味着curl脚本、复制粘贴数字、用电子表格比较。

一个 CLI,四种界面。

一切随二进制文件安装 — 无需插件,无需配置文件即可开始。

asiai Benchmark screen — one-click Quick Bench with live progress

跑分任意引擎

7种跑分类型 — 吞吐、突发、智能体、质量、上下文、能耗、版本。MLPerf风格:预热、中位数、greedy解码、CI95。

$ asiai bench
asiai live web dashboard — CPU load, memory, GPU power and loaded models

实时仪表盘

通过被动IOReport实时监控GPU、VRAM、功耗和温度 — 实时仪表、迷你图、跑分控制。

$ asiai web
asiai fleet cockpit — engines, models, KV cache and power across every Mac on the network

机队驾驶舱

网络中的每台Mac尽收一屏 — 引擎、已加载模型、KV缓存、功耗与告警,附操作员控制。

$ asiai fleet

社区排行榜

匿名分享跑分,看看其他Mac在相同芯片上的表现 — 终端或网页均可。

$ asiai leaderboard

你会发现什么?

来自r/LocalLLaMA的真实问题,一条命令解答。

“哪个引擎最快?”

一对一对比 — r/LocalLLaMA上的头号问题。

“监控多智能体集群”

LLM全天候运行AI智能体 — 追踪VRAM、温度和性能。

“对比能效”

不同引擎间的tok/s每瓦特。对7x24小时Mac Mini家庭实验室至关重要。

“更新后检测回归”

Ollama或macOS更新导致性能下降?通过SQLite自动检测。

“测试长上下文支持”

--context-size 64k跑分。你的模型能扛住256k上下文吗?

“我的Mac是否在温度降频?”

跨跑分轮次的漂移检测。asiai独有功能。

“可复现的跑分”

MLPerf/SPEC方法论。预热、中位数、greedy解码。放心分享。

“一条命令健康检查”

asiai doctor诊断系统、引擎和数据库,并提供修复建议。

“可视化仪表盘”

深色/浅色Web仪表盘,实时图表、SSE进度、跑分控制。

“LLM一对一比较”

同一引擎,不同模型。哪种量化方案胜出?

“Prometheus + Grafana监控”

暴露/metrics,用Prometheus抓取,在Grafana中可视化。生产级可观测性。

“追踪AI智能体推理”

GPU活动、TCP连接、KV缓存 — 了解你的智能体何时在推理、空闲或过载。API可直接对接集群编排器。

60秒启动运行

三条命令,搞定。

1

安装

$ brew install druide67/tap/asiai
# or: pip install asiai
2

检测

$ asiai detect
ollama (11434)
lmstudio (1234)
mlx-lm (8080)
→ 发现3个引擎
3

跑分

$ asiai bench -m qwen3.5
ENGINETOK/STTFT
lmstudio71.242ms
ollama54.861ms
mlx-lm30.138ms

真实发现

Apple Silicon上真实跑分的数据。

2.3×

MLX vs llama.cpp

在Apple Silicon上,MLX对MoE架构(Qwen3.5-35B-A3B)快2.3倍。

Flat

VRAM: 64k → 256k

使用DeltaNet时,VRAM从64k到256k上下文保持不变 — 其他地方从未记录。

30 vs 71

引擎 > 模型

同一模型,同一Mac:一个引擎30 tok/s,另一个71 tok/s。引擎比模型更重要。

我们测量什么

8项指标,一致的方法论,每次运行。

tok/s

生成速度 (tokens/sec)

TTFT

首token延迟

Power (W)

GPU功耗(瓦特)

tok/s/W

能效

Stability

跨轮次方差

VRAM

GPU显存占用

Thermal

降频状态

Context

长上下文性能伸缩

社区最速榜

来自真实Mac的实时数据,90天窗口。设计即匿名。

完整排行榜 →
01 llama-3.2-3b-instruct-4bit mlxlm Apple M4 Max · 64 GB 228.0 88 ms
02 qwen3.6:35b-a3b-nvfp4 ollama Apple M5 Max · 128 GB 124.9 39 ms
03 gemma-4-31b-it ollama Apple M5 Max · 128 GB 115.8 64 ms
贡献你的成绩: asiai bench --share

一条命令,一张可分享卡片。

每种跑分类型都生成1200×630图片 — 模型、芯片、实测中位数、诚实性关卡。专为Reddit、X和Discord打造。

asiai bench --card
asiai throughput card — mtplx-qwen36-27b-optimized-speed on mlx-lm at 48.2 tok/s median (±1 CI95, n=5), Apple M5 Max
asiai agentic card — prefix-cache reuse fraction 0.80 across cold, warm and prefix phases, Qwen3.6-27B on llama.cpp asiai code-quality card — tool_call, recovery and thinking suites at 100%, deterministic grading, Qwen3.6-27B on llama.cpp
🌍 本页翻译由机器生成,可能不完全准确。欢迎通过 GitHub Issue 提交修正。