asiai speedometer logo Open source · Apache 2.0 · Zero dependencies

Apple SiliconローカルLLMのスピードテストAIエージェントに
推論の可視性を

Ollama、LM Studio、mlx-lm、llama.cppほか6つのエンジンを直接対決 — tok/s、TTFT、電力、温度をコマンド一発で。asiaiのREST APIにより、AIエージェントがローカルLLMインフラを自律的に監視・診断・最適化できます。

$pip install asiai
$asiai bench# 15s → your first comparison
Python 3.11+ · stdlib only · 10 engines auto-detected · agent-ready API
GET /api/status ≤ 500ms
{
  "chip": "Apple M4 Pro",
  "ram_gb": 64.0,
  "memory_pressure": "normal",
  "gpu_utilization_percent": 45.2,
  "engines": {
    "ollama": { "running": true, "models_loaded": 2 },
    "lmstudio": { "running": true, "models_loaded": 1 }
  }
}
GET /api/snapshot Full state
{
  "system": {
    "chip": "Apple M4 Pro",
    "gpu_cores": 20,
    "gpu_utilization_percent": 45.2,
    "thermal_state": "nominal"
  },
  "engines": [{
    "name": "ollama",
    "models": [{ "name": "qwen3.5:latest", "size_params": "35B" }]
  }]
}

ローカルLLMの課題

心当たりありませんか?

01

断片化

Ollama、LM Studio、mlx-lm — それぞれ独自のCLI、フォーマット、指標。共通基盤なし。

02

盲目

リアルタイムVRAM監視なし、電力追跡なし、温度アラートなし。完全に盲目飛行。

03

手動

ベンチマーク=curlスクリプト、数値のコピペ、スプレッドシートで比較。

1つのCLI、4つのサーフェス。

すべてバイナリと一緒にインストール — プラグイン不要、設定ファイル不要で開始。

asiai Benchmark screen — one-click Quick Bench with live progress

あらゆるエンジンをベンチ

7種類のベンチ — スループット、バースト、エージェント、品質、コンテキスト、エネルギー、バージョン。MLPerf流:ウォームアップ、中央値、greedy decoding、CI95。

$ asiai bench
asiai live web dashboard — CPU load, memory, GPU power and loaded models

ライブダッシュボード

パッシブIOReportでGPU、VRAM、電力、温度をリアルタイム表示 — ライブゲージ、スパークライン、ベンチ操作。

$ asiai web
asiai fleet cockpit — engines, models, KV cache and power across every Mac on the network

フリートコックピット

ネットワーク上のすべてのMacを1画面に — エンジン、ロード済みモデル、KVキャッシュ、電力、アラート、オペレーター操作付き。

$ asiai fleet

コミュニティリーダーボード

ベンチマークを匿名で共有し、同じチップの他のMacの結果を確認 — ターミナルでもWebでも。

$ asiai leaderboard

何を発見できる?

r/LocalLLaMAからのリアルな疑問に、コマンド一発で回答。

“どのエンジンが最速?”

直接対決 — r/LocalLLaMAで最も多い質問。

“マルチエージェント群の監視”

AIエージェント用LLMを24時間稼働 — VRAM、温度、パフォーマンスを追跡。

“エネルギー効率を比較”

エンジン間のワットあたりtok/s。24時間稼働のMac Miniホームラボに不可欠。

“更新後のリグレッション検出”

OllamaやmacOSのアップデートでパフォーマンスが低下?SQLiteで自動検出。

“ロングコンテキスト対応をテスト”

--context-size 64kベンチマーク。あなたのモデルは256kコンテキストに耐えられる?

“Macがサーマルスロットリングしてる?”

ベンチマーク間のドリフト検出。asiai独自の機能。

“再現可能なベンチマーク”

MLPerf/SPEC準拠の方法論。ウォームアップ、中央値、greedy decoding。自信を持って共有。

“コマンド一発でヘルスチェック”

asiai doctorがシステム、エンジン、データベースを診断し修正案を提示。

“ビジュアルダッシュボード”

ダーク/ライト対応Webダッシュボード。ライブチャート、SSE進捗、ベンチマーク操作。

“LLMを直接対決で比較”

同じエンジン、異なるモデル。どの量子化が勝つ?

“Prometheus + Grafana監視”

/metricsを公開、Prometheusでスクレイプ、Grafanaで可視化。本番品質の可観測性。

“AIエージェント推論を追跡”

GPUアクティビティ、TCP接続、KVキャッシュ — エージェントが推論中か、アイドルか、過負荷かを把握。スウォームオーケストレーターに対応するAPI。

60秒で稼働開始

コマンド3つ。以上。

1

インストール

$ brew install druide67/tap/asiai
# or: pip install asiai
2

検出

$ asiai detect
ollama (11434)
lmstudio (1234)
mlx-lm (8080)
→ 3つのエンジンを検出
3

ベンチマーク

$ asiai bench -m qwen3.5
ENGINETOK/STTFT
lmstudio71.242ms
ollama54.861ms
mlx-lm30.138ms

実際の発見

Apple Silicon上での実際のベンチマークデータ。

2.3×

MLX vs llama.cpp

Apple SiliconでMoEアーキテクチャ(Qwen3.5-35B-A3B)にはMLXが2.3倍高速。

Flat

VRAM: 64k → 256k

DeltaNetでは64kから256kコンテキストでもVRAMが一定 — 他のどこにも文書化されていない。

30 vs 71

エンジン > モデル

同じモデル、同じMac:一方のエンジンで30 tok/s、別のエンジンで71 tok/s。エンジンの方が重要。

何を測定するか

8つの指標、一貫した方法論、毎回。

tok/s

生成速度 (tokens/sec)

TTFT

最初のトークンまでの時間

Power (W)

GPU消費電力(ワット)

tok/s/W

エネルギー効率

Stability

実行間バラつき

VRAM

GPUメモリ使用量

Thermal

スロットリング状態

Context

ロングコンテキスト性能スケーリング

コミュニティ最速

実機Macのライブデータ、90日間ウィンドウ。設計から匿名。

ランキング全体 →
01 llama-3.2-3b-instruct-4bit mlxlm Apple M4 Max · 64 GB 228.0 88 ms
02 qwen3.6:35b-a3b-nvfp4 ollama Apple M5 Max · 128 GB 124.9 39 ms
03 gemma-4-31b-it ollama Apple M5 Max · 128 GB 115.8 64 ms
あなたの結果も共有: asiai bench --share

コマンド1つ、共有カード1枚。

すべてのベンチタイプが1200×630画像を生成 — モデル、チップ、実測中央値、オネスティゲート。Reddit、X、Discord向け。

asiai bench --card
asiai throughput card — mtplx-qwen36-27b-optimized-speed on mlx-lm at 48.2 tok/s median (±1 CI95, n=5), Apple M5 Max
asiai agentic card — prefix-cache reuse fraction 0.80 across cold, warm and prefix phases, Qwen3.6-27B on llama.cpp asiai code-quality card — tool_call, recovery and thinking suites at 100%, deterministic grading, Qwen3.6-27B on llama.cpp
🌍 このページは機械翻訳です。正確でない場合があります。修正は GitHub Issue でお寄せください。