Apple SiliconローカルLLMのスピードテスト。AIエージェントに
推論の可視性を
Ollama、LM Studio、mlx-lm、llama.cppほか6つのエンジンを直接対決 — tok/s、TTFT、電力、温度をコマンド一発で。asiaiのREST APIにより、AIエージェントがローカルLLMインフラを自律的に監視・診断・最適化できます。
{
"chip": "Apple M4 Pro",
"ram_gb": 64.0,
"memory_pressure": "normal",
"gpu_utilization_percent": 45.2,
"engines": {
"ollama": { "running": true, "models_loaded": 2 },
"lmstudio": { "running": true, "models_loaded": 1 }
}
}
{
"system": {
"chip": "Apple M4 Pro",
"gpu_cores": 20,
"gpu_utilization_percent": 45.2,
"thermal_state": "nominal"
},
"engines": [{
"name": "ollama",
"models": [{ "name": "qwen3.5:latest", "size_params": "35B" }]
}]
}
ローカルLLMの課題
心当たりありませんか?
断片化
Ollama、LM Studio、mlx-lm — それぞれ独自のCLI、フォーマット、指標。共通基盤なし。
盲目
リアルタイムVRAM監視なし、電力追跡なし、温度アラートなし。完全に盲目飛行。
手動
ベンチマーク=curlスクリプト、数値のコピペ、スプレッドシートで比較。
1つのCLI、4つのサーフェス。
すべてバイナリと一緒にインストール — プラグイン不要、設定ファイル不要で開始。
あらゆるエンジンをベンチ
7種類のベンチ — スループット、バースト、エージェント、品質、コンテキスト、エネルギー、バージョン。MLPerf流:ウォームアップ、中央値、greedy decoding、CI95。
$ asiai benchライブダッシュボード
パッシブIOReportでGPU、VRAM、電力、温度をリアルタイム表示 — ライブゲージ、スパークライン、ベンチ操作。
$ asiai webフリートコックピット
ネットワーク上のすべてのMacを1画面に — エンジン、ロード済みモデル、KVキャッシュ、電力、アラート、オペレーター操作付き。
$ asiai fleetコミュニティリーダーボード
ベンチマークを匿名で共有し、同じチップの他のMacの結果を確認 — ターミナルでもWebでも。
$ asiai leaderboard何を発見できる?
r/LocalLLaMAからのリアルな疑問に、コマンド一発で回答。
“どのエンジンが最速?”
直接対決 — r/LocalLLaMAで最も多い質問。
“マルチエージェント群の監視”
AIエージェント用LLMを24時間稼働 — VRAM、温度、パフォーマンスを追跡。
“エネルギー効率を比較”
エンジン間のワットあたりtok/s。24時間稼働のMac Miniホームラボに不可欠。
“更新後のリグレッション検出”
OllamaやmacOSのアップデートでパフォーマンスが低下?SQLiteで自動検出。
“ロングコンテキスト対応をテスト”
--context-size 64kベンチマーク。あなたのモデルは256kコンテキストに耐えられる?
“Macがサーマルスロットリングしてる?”
ベンチマーク間のドリフト検出。asiai独自の機能。
“再現可能なベンチマーク”
MLPerf/SPEC準拠の方法論。ウォームアップ、中央値、greedy decoding。自信を持って共有。
“コマンド一発でヘルスチェック”
asiai doctorがシステム、エンジン、データベースを診断し修正案を提示。
“ビジュアルダッシュボード”
ダーク/ライト対応Webダッシュボード。ライブチャート、SSE進捗、ベンチマーク操作。
“LLMを直接対決で比較”
同じエンジン、異なるモデル。どの量子化が勝つ?
“Prometheus + Grafana監視”
/metricsを公開、Prometheusでスクレイプ、Grafanaで可視化。本番品質の可観測性。
“AIエージェント推論を追跡”
GPUアクティビティ、TCP接続、KVキャッシュ — エージェントが推論中か、アイドルか、過負荷かを把握。スウォームオーケストレーターに対応するAPI。
60秒で稼働開始
コマンド3つ。以上。
インストール
検出
ベンチマーク
実際の発見
Apple Silicon上での実際のベンチマークデータ。
MLX vs llama.cpp
Apple SiliconでMoEアーキテクチャ(Qwen3.5-35B-A3B)にはMLXが2.3倍高速。
VRAM: 64k → 256k
DeltaNetでは64kから256kコンテキストでもVRAMが一定 — 他のどこにも文書化されていない。
エンジン > モデル
同じモデル、同じMac:一方のエンジンで30 tok/s、別のエンジンで71 tok/s。エンジンの方が重要。
対応エンジン
自動検出、設定不要。
ポート8000はoMLX、vllm-mlx、vMLX、Rapid-MLXで共有 — asiaiは/v1/modelsで判別。
何を測定するか
8つの指標、一貫した方法論、毎回。
tok/s
生成速度 (tokens/sec)
TTFT
最初のトークンまでの時間
Power (W)
GPU消費電力(ワット)
tok/s/W
エネルギー効率
Stability
実行間バラつき
VRAM
GPUメモリ使用量
Thermal
スロットリング状態
Context
ロングコンテキスト性能スケーリング
コミュニティ最速
実機Macのライブデータ、90日間ウィンドウ。設計から匿名。
コマンド1つ、共有カード1枚。
すべてのベンチタイプが1200×630画像を生成 — モデル、チップ、実測中央値、オネスティゲート。Reddit、X、Discord向け。