asiai speedometer logo Open source · Apache 2.0 · Zero dependencies

Apple Silicon 로컬 LLM의 스피드테스트.AI 에이전트에게
추론 가시성을 부여하세요

Ollama, LM Studio, mlx-lm, llama.cpp 및 6개 엔진을 1:1로 비교 — tok/s, TTFT, 전력, 온도를 명령어 하나로.asiai의 REST API로 AI 에이전트가 로컬 LLM 인프라를 자율적으로 모니터링, 진단, 최적화할 수 있습니다.

$pip install asiai
$asiai bench# 15s → your first comparison
Python 3.11+ · stdlib only · 10 engines auto-detected · agent-ready API
GET /api/status ≤ 500ms
{
  "chip": "Apple M4 Pro",
  "ram_gb": 64.0,
  "memory_pressure": "normal",
  "gpu_utilization_percent": 45.2,
  "engines": {
    "ollama": { "running": true, "models_loaded": 2 },
    "lmstudio": { "running": true, "models_loaded": 1 }
  }
}
GET /api/snapshot Full state
{
  "system": {
    "chip": "Apple M4 Pro",
    "gpu_cores": 20,
    "gpu_utilization_percent": 45.2,
    "thermal_state": "nominal"
  },
  "engines": [{
    "name": "ollama",
    "models": [{ "name": "qwen3.5:latest", "size_params": "35B" }]
  }]
}

로컬 LLM의 문제

익숙하지 않으세요?

01

파편화

Ollama, LM Studio, mlx-lm — 각각 다른 CLI, 형식, 지표. 공통 기반 없음.

02

맹목

실시간 VRAM 모니터링 없음, 전력 추적 없음, 온도 알림 없음. 눈을 감고 날고 있는 셈.

03

수동

벤치마크란 curl 스크립트, 숫자 복붙, 스프레드시트에서 비교하는 것.

하나의 CLI, 네 가지 화면.

모든 것이 바이너리와 함께 설치 — 플러그인 없이, 설정 파일 없이 시작.

asiai Benchmark screen — one-click Quick Bench with live progress

모든 엔진 벤치마크

7가지 벤치 유형 — 처리량, 버스트, 에이전트, 품질, 컨텍스트, 에너지, 버전. MLPerf 스타일: 워밍업, 중앙값, greedy decoding, CI95.

$ asiai bench
asiai live web dashboard — CPU load, memory, GPU power and loaded models

라이브 대시보드

패시브 IOReport로 GPU, VRAM, 전력, 온도를 실시간 표시 — 라이브 게이지, 스파크라인, 벤치마크 컨트롤.

$ asiai web
asiai fleet cockpit — engines, models, KV cache and power across every Mac on the network

플릿 콕핏

네트워크의 모든 Mac을 한 화면에 — 엔진, 로드된 모델, KV 캐시, 전력, 알림, 오퍼레이터 컨트롤 포함.

$ asiai fleet

커뮤니티 리더보드

벤치마크를 익명으로 공유하고 같은 칩의 다른 Mac 결과를 확인 — 터미널이나 웹에서.

$ asiai leaderboard

무엇을 발견하게 될까?

r/LocalLLaMA의 실제 질문, 명령어 하나로 해결.

“어떤 엔진이 가장 빠를까?”

1:1 비교 — r/LocalLLaMA에서 가장 많은 질문.

“멀티 에이전트 스웜 모니터링”

AI 에이전트용 LLM 24시간 가동 — VRAM, 온도, 성능 추적.

“에너지 효율 비교”

엔진 간 와트당 tok/s. 24시간 Mac Mini 홈랩에 필수.

“업데이트 후 회귀 감지”

Ollama 또는 macOS 업데이트로 성능이 떨어졌나요? SQLite로 자동 감지.

“긴 컨텍스트 지원 테스트”

--context-size 64k 벤치마크. 당신의 모델이 256k 컨텍스트를 견딜 수 있을까?

“내 Mac이 서멀 스로틀링 중인가?”

벤치마크 실행 간 드리프트 감지. asiai만의 고유 기능.

“재현 가능한 벤치마크”

MLPerf/SPEC 방법론. 워밍업, 중앙값, greedy decoding. 자신있게 공유.

“명령어 하나로 상태 점검”

asiai doctor가 시스템, 엔진, 데이터베이스를 진단하고 수정 제안.

“시각적 대시보드”

다크/라이트 웹 대시보드. 실시간 차트, SSE 진행률, 벤치마크 컨트롤.

“LLM 1:1 비교”

같은 엔진, 다른 모델. 어떤 양자화가 이길까?

“Prometheus + Grafana 모니터링”

/metrics 노출, Prometheus로 스크레이프, Grafana에서 시각화. 프로덕션 수준 관측성.

“AI 에이전트 추론 추적”

GPU 활동, TCP 연결, KV 캐시 — 에이전트가 추론 중인지, 유휴 상태인지, 과부하인지 파악. 스웜 오케스트레이터용 API 지원.

60초 만에 실행

명령어 세 개. 끝.

1

설치

$ brew install druide67/tap/asiai
# or: pip install asiai
2

감지

$ asiai detect
ollama (11434)
lmstudio (1234)
mlx-lm (8080)
→ 엔진 3개 발견
3

벤치마크

$ asiai bench -m qwen3.5
ENGINETOK/STTFT
lmstudio71.242ms
ollama54.861ms
mlx-lm30.138ms

실제 발견

Apple Silicon에서의 실제 벤치마크 수치.

2.3×

MLX vs llama.cpp

Apple Silicon에서 MoE 아키텍처(Qwen3.5-35B-A3B)에 MLX가 2.3배 빠름.

Flat

VRAM: 64k → 256k

DeltaNet 사용 시 64k에서 256k 컨텍스트까지 VRAM 일정 — 다른 곳에서는 문서화되지 않음.

30 vs 71

엔진 > 모델

같은 모델, 같은 Mac: 한 엔진에서 30 tok/s, 다른 엔진에서 71 tok/s. 엔진이 더 중요.

측정 항목

8개 지표, 일관된 방법론, 매 실행마다.

tok/s

생성 속도 (tokens/sec)

TTFT

첫 토큰까지 시간

Power (W)

GPU 전력 소비 (와트)

tok/s/W

에너지 효율

Stability

실행 간 분산

VRAM

GPU 메모리 사용량

Thermal

스로틀링 상태

Context

긴 컨텍스트 성능 스케일링

커뮤니티 최고 속도

실제 Mac의 라이브 데이터, 90일 윈도우. 설계부터 익명.

전체 리더보드 →
01 llama-3.2-3b-instruct-4bit mlxlm Apple M4 Max · 64 GB 228.0 88 ms
02 qwen3.6:35b-a3b-nvfp4 ollama Apple M5 Max · 128 GB 124.9 39 ms
03 gemma-4-31b-it ollama Apple M5 Max · 128 GB 115.8 64 ms
당신의 결과도 공유: asiai bench --share

명령어 하나, 공유 카드 하나.

모든 벤치 유형이 1200×630 이미지를 생성 — 모델, 칩, 실측 중앙값, 정직성 게이트. Reddit, X, Discord용.

asiai bench --card
asiai throughput card — mtplx-qwen36-27b-optimized-speed on mlx-lm at 48.2 tok/s median (±1 CI95, n=5), Apple M5 Max
asiai agentic card — prefix-cache reuse fraction 0.80 across cold, warm and prefix phases, Qwen3.6-27B on llama.cpp asiai code-quality card — tool_call, recovery and thinking suites at 100%, deterministic grading, Qwen3.6-27B on llama.cpp
🌍 이 페이지는 기계 번역입니다. 정확하지 않을 수 있습니다. 수정 사항은 GitHub Issue로 제출해 주세요.