Apple Silicon 本地 LLM 的速度测试。让你的AI智能体
洞察推理状态
让 Ollama、LM Studio、mlx-lm、llama.cpp 及另外六个引擎一对一对决 — tok/s、TTFT、功耗与温度,一条命令搞定。asiai的REST API让你的AI智能体自主监控、诊断和优化本地LLM基础设施。
{
"chip": "Apple M4 Pro",
"ram_gb": 64.0,
"memory_pressure": "normal",
"gpu_utilization_percent": 45.2,
"engines": {
"ollama": { "running": true, "models_loaded": 2 },
"lmstudio": { "running": true, "models_loaded": 1 }
}
}
{
"system": {
"chip": "Apple M4 Pro",
"gpu_cores": 20,
"gpu_utilization_percent": 45.2,
"thermal_state": "nominal"
},
"engines": [{
"name": "ollama",
"models": [{ "name": "qwen3.5:latest", "size_params": "35B" }]
}]
}
本地LLM的问题
听起来熟悉吗?
碎片化
Ollama、LM Studio、mlx-lm — 各有各的CLI、格式和指标。毫无统一标准。
盲目
没有实时VRAM监控,没有功耗追踪,没有温度告警。完全在盲飞。
手动
跑分意味着curl脚本、复制粘贴数字、用电子表格比较。
一个 CLI,四种界面。
一切随二进制文件安装 — 无需插件,无需配置文件即可开始。
跑分任意引擎
7种跑分类型 — 吞吐、突发、智能体、质量、上下文、能耗、版本。MLPerf风格:预热、中位数、greedy解码、CI95。
$ asiai bench实时仪表盘
通过被动IOReport实时监控GPU、VRAM、功耗和温度 — 实时仪表、迷你图、跑分控制。
$ asiai web机队驾驶舱
网络中的每台Mac尽收一屏 — 引擎、已加载模型、KV缓存、功耗与告警,附操作员控制。
$ asiai fleet社区排行榜
匿名分享跑分,看看其他Mac在相同芯片上的表现 — 终端或网页均可。
$ asiai leaderboard你会发现什么?
来自r/LocalLLaMA的真实问题,一条命令解答。
“哪个引擎最快?”
一对一对比 — r/LocalLLaMA上的头号问题。
“监控多智能体集群”
LLM全天候运行AI智能体 — 追踪VRAM、温度和性能。
“对比能效”
不同引擎间的tok/s每瓦特。对7x24小时Mac Mini家庭实验室至关重要。
“更新后检测回归”
Ollama或macOS更新导致性能下降?通过SQLite自动检测。
“测试长上下文支持”
--context-size 64k跑分。你的模型能扛住256k上下文吗?
“我的Mac是否在温度降频?”
跨跑分轮次的漂移检测。asiai独有功能。
“可复现的跑分”
MLPerf/SPEC方法论。预热、中位数、greedy解码。放心分享。
“一条命令健康检查”
asiai doctor诊断系统、引擎和数据库,并提供修复建议。
“可视化仪表盘”
深色/浅色Web仪表盘,实时图表、SSE进度、跑分控制。
“LLM一对一比较”
同一引擎,不同模型。哪种量化方案胜出?
“Prometheus + Grafana监控”
暴露/metrics,用Prometheus抓取,在Grafana中可视化。生产级可观测性。
“追踪AI智能体推理”
GPU活动、TCP连接、KV缓存 — 了解你的智能体何时在推理、空闲或过载。API可直接对接集群编排器。
60秒启动运行
三条命令,搞定。
安装
检测
跑分
真实发现
Apple Silicon上真实跑分的数据。
MLX vs llama.cpp
在Apple Silicon上,MLX对MoE架构(Qwen3.5-35B-A3B)快2.3倍。
VRAM: 64k → 256k
使用DeltaNet时,VRAM从64k到256k上下文保持不变 — 其他地方从未记录。
引擎 > 模型
同一模型,同一Mac:一个引擎30 tok/s,另一个71 tok/s。引擎比模型更重要。
支持的引擎
自动检测,无需配置。
端口8000由oMLX、vllm-mlx、vMLX和Rapid-MLX共用 — asiai通过/v1/models区分它们。
我们测量什么
8项指标,一致的方法论,每次运行。
tok/s
生成速度 (tokens/sec)
TTFT
首token延迟
Power (W)
GPU功耗(瓦特)
tok/s/W
能效
Stability
跨轮次方差
VRAM
GPU显存占用
Thermal
降频状态
Context
长上下文性能伸缩
社区最速榜
来自真实Mac的实时数据,90天窗口。设计即匿名。
一条命令,一张可分享卡片。
每种跑分类型都生成1200×630图片 — 模型、芯片、实测中位数、诚实性关卡。专为Reddit、X和Discord打造。