원문출처 : https://ollama.com/blog/mlx

오늘은 Apple의 머신러닝 프레임워크인 MLX를 사용하여 Apple Silicon에서 Ollama를 가장 빠르게 실행하는 방법을 미리 살펴보겠습니다.
이를 통해 macOS에서 가장 까다로운 작업도 가속화 할 수 있는 새로운 성능이 구현됩니다 .
- OpenClaw와 같은 개인 비서
- Claude Code, OpenCode, Codex와 같은 코딩 에이전트
Pi나 Claude Code와 같은 코딩 에이전트의 속도를 향상시키세요.
OpenClaw의 응답 속도가 훨씬 빨라졌습니다.
MLX로 구동되는 Apple Silicon에서 가장 빠른 성능
애플 실리콘 기반 Ollama는 이제 애플의 머신 러닝 프레임워크인 MLX를 기반으로 구축되어 통합 메모리 아키텍처의 이점을 활용합니다.
이로 인해 모든 Apple Silicon 기기에서 Ollama의 속도가 크게 향상됩니다. Apple의 M5, M5 Pro 및 M5 Max 칩에서 Ollama는 새로운 GPU 신경 가속기를 활용하여 첫 번째 토큰 생성 시간(TTFT)과 생성 속도(초당 토큰 수)를 모두 가속화합니다.
사전 충전 성능
디코딩 성능
2026년 3월 29일에 Alibaba의 Qwen3.5-35B-A3B 모델을 `NVFP4`로 양자화하고, Ollama의 이전 구현을 `Q4_K_M`으로 양자화하여 Ollama 0.18 버전으로 테스트했습니다. Ollama 0.19 버전에서는 성능이 더욱 향상될 것으로 예상됩니다(`int4`로 실행 시 프리필 1851 토큰/초, 디코딩 134 토큰/초).
NVFP4 지원: 더 높은 품질의 응답 및 생산 동등성 확보
Ollama는 이제 NVIDIA의 NVFP4 형식을 활용하여 모델 정확도를 유지하면서 추론 워크로드에 필요한 메모리 대역폭과 스토리지 요구 사항을 줄입니다.
더 많은 추론 제공업체가 NVFP4 형식을 사용하여 추론을 확장함에 따라 Ollama 사용자는 프로덕션 환경에서와 동일한 결과를 공유할 수 있습니다.
이를 통해 Ollama는 NVIDIA의 모델 최적화 도구 로 최적화된 모델을 실행할 수 있게 됩니다 . Ollama의 연구진과 하드웨어 파트너의 설계 및 사용 의도에 따라 추가적인 세부 기능이 제공될 예정입니다.
캐싱 기능 개선으로 응답 속도 향상
Ollama의 캐시가 업그레이드되어 코딩 및 에이전트 작업의 효율성이 향상되었습니다.
-
메모리 사용량 감소: Ollama는 이제 대화 전반에 걸쳐 캐시를 재사용하므로 메모리 사용량이 줄어들고 Claude Code와 같은 도구에서 공유 시스템 프롬프트를 사용할 때 분기 시 캐시 적중률이 높아집니다.
-
지능형 체크포인트: Ollama는 이제 프롬프트의 지능적인 위치에 캐시 스냅샷을 저장하여 프롬프트 처리량을 줄이고 응답 속도를 높입니다.
-
더욱 스마트한 삭제: 공유 접두사는 오래된 분기가 삭제되더라도 더 오래 유지됩니다.
시작하기
이번 Ollama 프리뷰 릴리스에서는 코딩 작업에 최적화된 샘플링 매개변수를 사용하여 새로운 Qwen3.5-35B-A3B 모델의 성능을 향상시켰습니다.
통합 메모리가 32GB 이상인 Mac을 사용하고 있는지 확인하십시오.
클로드 코드:
ollama launch claude --model qwen3.5:35b-a3b-coding-nvfp4
오픈클로:
ollama launch openclaw --model qwen3.5:35b-a3b-coding-nvfp4
모델과 채팅하세요:
ollama run qwen3.5:35b-a3b-coding-nvfp4
미래 모델
저희는 향후 출시될 모델들을 지원하기 위해 적극적으로 노력하고 있습니다. 지원되는 아키텍처에 맞춰 최적화된 사용자 정의 모델을 보유한 사용자들을 위해, Ollama로 모델을 더 쉽게 가져올 수 있는 방법을 도입할 예정입니다. 그동안 지원되는 아키텍처 목록을 확장해 나갈 것입니다.
감사의 말씀
다음 분들께 감사드립니다:
- 놀라운 가속화 프레임워크를 구축한 MLX 기여자 팀
- NVIDIA는 NVFP4 양자화, NVFP4 모델 최적화 도구, MLX CUDA 지원, Ollama 최적화 및 테스트에 기여했습니다.
- GGML 및 llama.cpp 팀은 활발한 로컬 프레임워크와 커뮤니티를 구축했습니다.
- 알리바바 큐웬 팀은 훌륭한 모델을 오픈소스로 공개하고 협업하는 데 기여했습니다.