메뉴 건너뛰기

SayClub.org

AI

원문출처 : https://ollama.com/blog/mlx

 

올라마가 일상 주행용으로도, 레이스에서도 우승할 수 있는 고성능 자동차 옆에 서 있는 일러스트입니다. 올라마는 애플 실리콘의 뛰어난 성능을 보여주기 위해 이 자리에 섰습니다.

오늘은 Apple의 머신러닝 프레임워크인 MLX를 사용하여 Apple Silicon에서 Ollama를 가장 빠르게 실행하는 방법을 미리 살펴보겠습니다.

이를 통해 macOS에서 가장 까다로운 작업도 가속화 할 수 있는 새로운 성능이 구현됩니다 .

  • OpenClaw와 같은 개인 비서
  • Claude Code, OpenCode, Codex와 같은 코딩 에이전트
     

    Pi나 Claude Code와 같은 코딩 에이전트의 속도를 향상시키세요.

     

    OpenClaw의 응답 속도가 훨씬 빨라졌습니다.

MLX로 구동되는 Apple Silicon에서 가장 빠른 성능

애플 실리콘 기반 Ollama는 이제 애플의 머신 러닝 프레임워크인 MLX를 기반으로 구축되어 통합 메모리 아키텍처의 이점을 활용합니다.

이로 인해 모든 Apple Silicon 기기에서 Ollama의 속도가 크게 향상됩니다. Apple의 M5, M5 Pro 및 M5 Max 칩에서 Ollama는 새로운 GPU 신경 가속기를 활용하여 첫 번째 토큰 생성 시간(TTFT)과 생성 속도(초당 토큰 수)를 모두 가속화합니다.

사전 충전 성능

0500100015002000tokens/s1810Ollama 0.191154Ollama 0.18

디코딩 성능

04080120160tokens/s112Ollama 0.1958Ollama 0.18

2026년 3월 29일에 Alibaba의 Qwen3.5-35B-A3B 모델을 `NVFP4`로 양자화하고, Ollama의 이전 구현을 `Q4_K_M`으로 양자화하여 Ollama 0.18 버전으로 테스트했습니다. Ollama 0.19 버전에서는 성능이 더욱 향상될 것으로 예상됩니다(`int4`로 실행 시 프리필 1851 토큰/초, 디코딩 134 토큰/초).

NVFP4 지원: 더 높은 품질의 응답 및 생산 동등성 확보

Ollama는 이제 NVIDIA의 NVFP4 형식을 활용하여 모델 정확도를 유지하면서 추론 워크로드에 필요한 메모리 대역폭과 스토리지 요구 사항을 줄입니다.

더 많은 추론 제공업체가 NVFP4 형식을 사용하여 추론을 확장함에 따라 Ollama 사용자는 프로덕션 환경에서와 동일한 결과를 공유할 수 있습니다.

이를 통해 Ollama는 NVIDIA의 모델 최적화 도구 로 최적화된 모델을 실행할 수 있게 됩니다 . Ollama의 연구진과 하드웨어 파트너의 설계 및 사용 의도에 따라 추가적인 세부 기능이 제공될 예정입니다.

캐싱 기능 개선으로 응답 속도 향상

Ollama의 캐시가 업그레이드되어 코딩 및 에이전트 작업의 효율성이 향상되었습니다.

  • 메모리 사용량 감소: Ollama는 이제 대화 전반에 걸쳐 캐시를 재사용하므로 메모리 사용량이 줄어들고 Claude Code와 같은 도구에서 공유 시스템 프롬프트를 사용할 때 분기 시 캐시 적중률이 높아집니다.

  • 지능형 체크포인트: Ollama는 이제 프롬프트의 지능적인 위치에 캐시 스냅샷을 저장하여 프롬프트 처리량을 줄이고 응답 속도를 높입니다.

  • 더욱 스마트한 삭제: 공유 접두사는 오래된 분기가 삭제되더라도 더 오래 유지됩니다.

시작하기

Ollama 0.19 다운로드

이번 Ollama 프리뷰 릴리스에서는 코딩 작업에 최적화된 샘플링 매개변수를 사용하여 새로운 Qwen3.5-35B-A3B 모델의 성능을 향상시켰습니다.

통합 메모리가 32GB 이상인 Mac을 사용하고 있는지 확인하십시오.

클로드 코드:

ollama launch claude --model qwen3.5:35b-a3b-coding-nvfp4

오픈클로:

ollama launch openclaw --model qwen3.5:35b-a3b-coding-nvfp4

모델과 채팅하세요:

ollama run qwen3.5:35b-a3b-coding-nvfp4

미래 모델

저희는 향후 출시될 모델들을 지원하기 위해 적극적으로 노력하고 있습니다. 지원되는 아키텍처에 맞춰 최적화된 사용자 정의 모델을 보유한 사용자들을 위해, Ollama로 모델을 더 쉽게 가져올 수 있는 방법을 도입할 예정입니다. 그동안 지원되는 아키텍처 목록을 확장해 나갈 것입니다.

감사의 말씀

다음 분들께 감사드립니다:

  • 놀라운 가속화 프레임워크를 구축한 MLX 기여자 팀
  • NVIDIA는 NVFP4 양자화, NVFP4 모델 최적화 도구, MLX CUDA 지원, Ollama 최적화 및 테스트에 기여했습니다.
  • GGML 및 llama.cpp 팀은 활발한 로컬 프레임워크와 커뮤니티를 구축했습니다.
  • 알리바바 큐웬 팀은 훌륭한 모델을 오픈소스로 공개하고 협업하는 데 기여했습니다.
번호 제목 글쓴이 날짜 조회 수
공지 퍼플렉시티용 글 작성 프롬프트 미르다테 2026.04.29 24
공지 SayClub 스타일 포스팅 생성 프롬프트 미르다테 2026.04.29 26
27 클로드 코드(Claude Code) 입문: 설치부터 LLM·Agent 바이브 코딩까지 미르다테 2026.05.04 8
26 Claude로 일하는 법 — 업무 활용 가이드 기본편 미르다테 2026.05.04 7
25 허깅페이스 사이트 사용방법 및 모델명 구분 방법 완전 실무 백서 미르다테 2026.04.29 14
24 GitHub 개념, 명령어 사용법, 협업 흐름, 실전 예제 초정밀 가이드 미르다테 2026.04.29 10
23 Hermes Agent 설치 및 명령어 운용 백서 미르다테 2026.04.29 35
22 Hermes 에러 로그 조치 미르다테 2026.04.29 17
21 힉스필드(동영상 생성 AI) 미르다테 2026.04.27 8
20 허깅페이스 AI모델 추천(https://huggingface.co/majentik) 미르다테 2026.04.27 15
19 Hermes Agent: 성장하는 AI 에이전트 실전 가이드 미르다테 2026.04.27 11
18 Unsloth Qwen 3.6 미르다테 2026.04.22 8
17 openclaw ollama/qwen3.6:35b-a3b-q4_K_M 모델 최적화 설정값 미르다테 2026.04.20 9
16 Mac Studio M4 Max + qwen3.6-35b OpenClaw 최적화 설정 공유 미르다테 2026.04.19 18
15 macOS에서 Ollama 구동 전 반드시 설정해야 하는 환경변수 3가지 미르다테 2026.04.19 27
14 April 2026 TLDR Setup for Ollama + Gemma 4 on a Mac mini (Apple Silicon) 미르다테 2026.04.06 14
» Ollama는 현재 Apple Silicon 기반 MLX로 구동되는 프리뷰 버전으로 제공됩니다. 미르다테 2026.03.31 9
12 OpenClaw (구 Moltbot, 구 Clawdbot) 리뷰(10) : OpenClaw 에이전트를 위한 보안 설정 : 당신의 AI 에이전트가 해킹당하지 않으려면? file 미르다테 2026.02.23 15
11 OpenClaw (구 Moltbot, 구 Clawdbot) 리뷰(9) : OpenClaw가 똑똑한 이유는 'Pi' 때문? (OpenClaw의 심장, Pi: Self-extending 아키텍처 살펴보기) file 미르다테 2026.02.23 12
10 OpenClaw (구 Moltbot, 구 Clawdbot) 리뷰(8) : ClawHub 스킬 마켓플레이스와 Moltbook AI 소셜 네트워크, 그리고 보안(ClawHavoc 사태와 Moltbook 보안 침해) file 미르다테 2026.02.23 14
9 OpenClaw (구 Moltbot, 구 Clawdbot) 리뷰(7) : OpenClaw 24시간 가동하기 - 잠들지 않는 나만의 자비스 만들기()홈랩부터 클라우드(VPS)까지 file 미르다테 2026.02.23 15
8 OpenClaw (구 Moltbot, 구 Clawdbot) 리뷰(6) : Ollama 연동 가이드 - 로컬 LLM Ollama로 무료 AI 비서 만들기 file 미르다테 2026.02.23 22
위로