Apple Silicon 로컬 LLM의 스피드테스트.AI 에이전트에게
추론 가시성을 부여하세요
Ollama, LM Studio, mlx-lm, llama.cpp 및 6개 엔진을 1:1로 비교 — tok/s, TTFT, 전력, 온도를 명령어 하나로.asiai의 REST API로 AI 에이전트가 로컬 LLM 인프라를 자율적으로 모니터링, 진단, 최적화할 수 있습니다.
{
"chip": "Apple M4 Pro",
"ram_gb": 64.0,
"memory_pressure": "normal",
"gpu_utilization_percent": 45.2,
"engines": {
"ollama": { "running": true, "models_loaded": 2 },
"lmstudio": { "running": true, "models_loaded": 1 }
}
}
{
"system": {
"chip": "Apple M4 Pro",
"gpu_cores": 20,
"gpu_utilization_percent": 45.2,
"thermal_state": "nominal"
},
"engines": [{
"name": "ollama",
"models": [{ "name": "qwen3.5:latest", "size_params": "35B" }]
}]
}
로컬 LLM의 문제
익숙하지 않으세요?
파편화
Ollama, LM Studio, mlx-lm — 각각 다른 CLI, 형식, 지표. 공통 기반 없음.
맹목
실시간 VRAM 모니터링 없음, 전력 추적 없음, 온도 알림 없음. 눈을 감고 날고 있는 셈.
수동
벤치마크란 curl 스크립트, 숫자 복붙, 스프레드시트에서 비교하는 것.
하나의 CLI, 네 가지 화면.
모든 것이 바이너리와 함께 설치 — 플러그인 없이, 설정 파일 없이 시작.
모든 엔진 벤치마크
7가지 벤치 유형 — 처리량, 버스트, 에이전트, 품질, 컨텍스트, 에너지, 버전. MLPerf 스타일: 워밍업, 중앙값, greedy decoding, CI95.
$ asiai bench라이브 대시보드
패시브 IOReport로 GPU, VRAM, 전력, 온도를 실시간 표시 — 라이브 게이지, 스파크라인, 벤치마크 컨트롤.
$ asiai web플릿 콕핏
네트워크의 모든 Mac을 한 화면에 — 엔진, 로드된 모델, KV 캐시, 전력, 알림, 오퍼레이터 컨트롤 포함.
$ asiai fleet커뮤니티 리더보드
벤치마크를 익명으로 공유하고 같은 칩의 다른 Mac 결과를 확인 — 터미널이나 웹에서.
$ asiai leaderboard무엇을 발견하게 될까?
r/LocalLLaMA의 실제 질문, 명령어 하나로 해결.
“어떤 엔진이 가장 빠를까?”
1:1 비교 — r/LocalLLaMA에서 가장 많은 질문.
“멀티 에이전트 스웜 모니터링”
AI 에이전트용 LLM 24시간 가동 — VRAM, 온도, 성능 추적.
“에너지 효율 비교”
엔진 간 와트당 tok/s. 24시간 Mac Mini 홈랩에 필수.
“업데이트 후 회귀 감지”
Ollama 또는 macOS 업데이트로 성능이 떨어졌나요? SQLite로 자동 감지.
“긴 컨텍스트 지원 테스트”
--context-size 64k 벤치마크. 당신의 모델이 256k 컨텍스트를 견딜 수 있을까?
“내 Mac이 서멀 스로틀링 중인가?”
벤치마크 실행 간 드리프트 감지. asiai만의 고유 기능.
“재현 가능한 벤치마크”
MLPerf/SPEC 방법론. 워밍업, 중앙값, greedy decoding. 자신있게 공유.
“명령어 하나로 상태 점검”
asiai doctor가 시스템, 엔진, 데이터베이스를 진단하고 수정 제안.
“시각적 대시보드”
다크/라이트 웹 대시보드. 실시간 차트, SSE 진행률, 벤치마크 컨트롤.
“LLM 1:1 비교”
같은 엔진, 다른 모델. 어떤 양자화가 이길까?
“Prometheus + Grafana 모니터링”
/metrics 노출, Prometheus로 스크레이프, Grafana에서 시각화. 프로덕션 수준 관측성.
“AI 에이전트 추론 추적”
GPU 활동, TCP 연결, KV 캐시 — 에이전트가 추론 중인지, 유휴 상태인지, 과부하인지 파악. 스웜 오케스트레이터용 API 지원.
60초 만에 실행
명령어 세 개. 끝.
설치
감지
벤치마크
실제 발견
Apple Silicon에서의 실제 벤치마크 수치.
MLX vs llama.cpp
Apple Silicon에서 MoE 아키텍처(Qwen3.5-35B-A3B)에 MLX가 2.3배 빠름.
VRAM: 64k → 256k
DeltaNet 사용 시 64k에서 256k 컨텍스트까지 VRAM 일정 — 다른 곳에서는 문서화되지 않음.
엔진 > 모델
같은 모델, 같은 Mac: 한 엔진에서 30 tok/s, 다른 엔진에서 71 tok/s. 엔진이 더 중요.
지원 엔진
자동 감지, 설정 불필요.
포트 8000은 oMLX, vllm-mlx, vMLX, Rapid-MLX가 공유 — asiai가 /v1/models로 구분.
측정 항목
8개 지표, 일관된 방법론, 매 실행마다.
tok/s
생성 속도 (tokens/sec)
TTFT
첫 토큰까지 시간
Power (W)
GPU 전력 소비 (와트)
tok/s/W
에너지 효율
Stability
실행 간 분산
VRAM
GPU 메모리 사용량
Thermal
스로틀링 상태
Context
긴 컨텍스트 성능 스케일링
커뮤니티 최고 속도
실제 Mac의 라이브 데이터, 90일 윈도우. 설계부터 익명.
명령어 하나, 공유 카드 하나.
모든 벤치 유형이 1200×630 이미지를 생성 — 모델, 칩, 실측 중앙값, 정직성 게이트. Reddit, X, Discord용.