Lokale KI-Modelle auf dem Mac mini M4: die Speicherrechnung
·
Ein KI-Modell lokal auszuführen heißt, dass seine Gewichte auf Ihrem Mac liegen und die Berechnung auf dem Chip Ihres Mac stattfindet, ohne dass nach dem Download etwas über das Netzwerk geht. Zwei verschiedene Dinge bestimmen, was Sie damit tun können, und sie werden leicht verwechselt: Der Arbeitsspeicher entscheidet, welches Modell überhaupt läuft, festgelegt am Tag des Kaufs, und der Speicher entscheidet, wie viele Modelle und wie viel Werkzeug drumherum Sie gleichzeitig auf dem Gerät behalten können. Dieser Ratgeber handelt überwiegend vom Zweiten.
Was es heißt, KI lokal auf einem Mac auszuführen
Vier Namen fallen immer, wenn es darum geht, und jeder löst einen anderen Teil des Problems.
- Ollama: ein Kommandozeilenwerkzeug und Hintergrunddienst, der Modelle mit einem Befehl aus der eigenen Bibliothek lädt und hinter einer lokalen API ausführt (github.com/ollama/ollama, geprüft im September 2026).
- LM Studio: eine Desktop-App, um „download and run local LLMs“, mit einer Chat-Oberfläche und einem lokalen Server, der anderen Apps „serve local models on OpenAI-like endpoints“ kann (lmstudio.ai/docs/app, geprüft im September 2026).
- MLX: laut eigenem Repository „an array framework for machine learning on Apple silicon, brought to you by Apple machine learning research“, aufgebaut um ein gemeinsames Speichermodell: „Arrays in MLX live in shared memory. Operations on MLX arrays can be performed on any of the supported device types without transferring data“ (github.com/ml-explore/mlx, geprüft im September 2026). Es ist Apples eigenes Projekt, keine Portierung von Dritten.
- llama.cpp: beschreibt sich als „LLM inference in C/C++“, gebaut „to enable LLM (and VLM) inference with minimal setup and state-of-the-art performance on a wide range of hardware“, und hält fest, dass „Apple silicon is a first-class citizen“ über ARM NEON, Accelerate und Metal (github.com/ggml-org/llama.cpp, geprüft im September 2026).
Die vier überschneiden sich mehr, als die Liste vermuten lässt: Ollama führt llama.cpp unter seinen unterstützten Backends (github.com/ollama/ollama, geprüft im September 2026), und LM Studio führt „llama.cpp (GGUF) or MLX models“ aus (lmstudio.ai/docs/app, geprüft im September 2026). Wählen Sie ein Werkzeug danach, wie Sie arbeiten möchten, und denken Sie daran, dass jedes seine eigene Kopie dessen behält, was es lädt; hier kommt der Speicher ins Spiel.
Die zwei Grenzen: Der Arbeitsspeicher entscheidet, was läuft, der Speicher, wie viel Sie behalten
Die Gewichte eines Modells und der Arbeitsspeicher für das, was es gerade verarbeitet, müssen zusammen mit macOS und allem anderen, was geöffnet ist, in den gemeinsamen Arbeitsspeicher des Mac mini M4 passen: 16 GB standardmäßig, konfigurierbar auf 24 GB oder 32 GB (support.apple.com/en-us/121555, geprüft im September 2026). Diese Wahl ist endgültig: Laut Apple ist der Arbeitsspeicher im Mac mini M4 im Chipgehäuse integriert und lässt sich nicht aufrüsten (support.apple.com/en-us/102328, geprüft im September 2026).
Der Speicher ist eine weichere Grenze, die mit der Zeit leise wächst. Ein einzelnes Modell braucht davon nicht viel, aber in diesem Arbeitsablauf wird auch nichts gelöscht, und neben den Modellen selbst sammelt sich einiges an:
- Modell-Downloads: Jedes geladene Modell ist eine vollständige lokale Kopie, und dasselbe Modell zum Vergleich in einer zweiten Quantisierung zu laden, ist eine zweite vollständige Kopie.
- Der Hugging-Face-Cache: Werkzeuge, die Modelle direkt von Hugging Face laden statt über Ollama oder LM Studio, halten standardmäßig einen eigenen Cache unter
~/.cache/huggingface/hub, verschiebbar über die UmgebungsvariableHF_HOME(huggingface.co/docs/huggingface_hub/guides/manage-cache, geprüft im September 2026). Schnell liegen dieselben Gewichte doppelt im Cache, einmal von einer App und einmal in diesem Cache. - Modelle für Spracherkennung und Bilderzeugung: Wenn Sie auch Transkription oder Bilderzeugung lokal ausführen, halten diese Modelle eigene Dateien auf dem Laufwerk, getrennt von den Caches der Textmodelle oben.
- Python-Umgebungen: MLX hat neben den APIs für C++, C und Swift eine Python-API (github.com/ml-explore/mlx, geprüft im September 2026), und die Bibliotheken transformers und diffusers sind Python-Bibliotheken. Jede virtuelle Umgebung hat „their own independent set of Python packages“ (docs.python.org/3/library/venv.html, geprüft im September 2026), jedes Projekt installiert also eine eigene Kopie von PyTorch, MLX oder ähnlichen Bibliotheken.
Nichts davon fällt auf, bevor es schon passiert ist. Ein Modell neben einem 256-GB- oder gar 2-TB-Laufwerk wirkt unbedeutend; ein Arbeitssatz aus mehreren Modellen, ein Hugging-Face-Cache, der einige davon doppelt hält, und eine oder zwei Python-Umgebungen sind es nicht.
Was gängige Modelle tatsächlich als Download kosten
Die Modellgröße wächst mit der Zahl der Parameter, und jedes Modell in Ollamas Bibliothek hat einen Standard-Download; bei den Modellen unten ist das eine 4-Bit-Quantisierung, Q4_K_M, außer bei gemma2:9b mit Q4_0. Die Werte unten sind Parameterzahl und Standard-Download-Größe jedes Modells, abgelesen von seiner eigenen Seite in Ollamas Bibliothek im September 2026.
| Modell (Tag in der Ollama-Bibliothek) | Parameter | Standard-Quantisierung | Standard-Download |
|---|---|---|---|
| llama3.2:3b | 3,21 Mrd. | Q4_K_M | 2,0 GB |
| mistral:7b | 7,25 Mrd. | Q4_K_M | 4,4 GB |
| llama3.1:8b | 8,03 Mrd. | Q4_K_M | 4,9 GB |
| gemma2:9b | 9,24 Mrd. | Q4_0 | 5,4 GB |
| qwen2.5:14b | 14,8 Mrd. | Q4_K_M | 9,0 GB |
| phi4:14b | 14,7 Mrd. | Q4_K_M | 9,1 GB |
| deepseek-r1:32b | 32,8 Mrd. | Q4_K_M | 20 GB |
| llama3.1:70b | 70,6 Mrd. | Q4_K_M | 43 GB |
Quelle: ollama.com/library, die jeweilige Tag-Seite jedes Modells, geprüft im September 2026. Über diese Tabelle hinweg liegt der Standard-Download bei 0,58 bis 0,62 GB pro Milliarde Parameter, also etwa 0,6 GB, unsere eigene Rechnung aus den Werten oben, und sie ist die Grundlage für die Hinweise zum Arbeitsspeicher weiter unten. Ollamas Bibliothek führt Llama 3.1 auch mit 406 Mrd. Parametern, ein Download von 243 GB bei derselben Q4_K_M-Quantisierung (ollama.com/library/llama3.1, geprüft im September 2026). Diese Datei passt auf ein Laufwerk mit 512 GB oder 2 TB, aber nicht auf ein serienmäßiges mit 256 GB, auf dem das Budget unten nach der Installation von macOS und den Werkzeugen 206 GB übrig lässt. Ausgeschlossen wird es aber nicht vom Speicher: Kein Mac mini M4 hat auch nur annähernd den Arbeitsspeicher, um es auszuführen.
Modellkarten ändern sich. Prüfen Sie die Bibliotheksseite des Modells, das Sie tatsächlich möchten, bevor Sie dafür planen.
Das Speicherbudget: eine Modellbibliothek und alles drumherum
Legen Sie eine Handvoll der Modelle oben auf einen Mac mini M4, dazu die Werkzeuge, die sie ausführen, und die Basiskonfiguration mit 256 GB ist knapp, bevor eine ernsthafte Bibliothek entsteht. Das ist unsere eigene Planungsschätzung, keine Messung eines bestimmten Setups.
| Was es belegt | Eingeplanter Platz (unsere Schätzung) | Rest bei 256 GB | Rest bei 512 GB | Rest bei 2 TB |
|---|---|---|---|---|
| macOS mit den integrierten Apps, dazu Ollama oder LM Studio | 50 GB | 206 GB | 462 GB | 1950 GB |
| Eine Arbeitsbibliothek lokaler Modelle (mehrere aus der Tabelle oben, nebeneinander vorgehalten) | 40 GB | 166 GB | 422 GB | 1910 GB |
| Ein Modell der 30-Mrd.-Klasse für gelegentliche schwerere Aufgaben | 20 GB | 146 GB | 402 GB | 1890 GB |
| Python-Umgebungen für Frameworks, die aus Python genutzt werden (transformers, diffusers, mlx-lm), jede mit eigener Kopie ihrer Abhängigkeiten | 30 GB | 116 GB | 372 GB | 1860 GB |
| Wachstum des Hugging-Face-Caches: zusätzliche Checkpoints, Tokenizer, Embedding- und Reranking-Modelle | 40 GB | 76 GB | 332 GB | 1820 GB |
| Caches von Modellen für Spracherkennung und Bilderzeugung | 20 GB | 56 GB | 312 GB | 1800 GB |
Das sind nach unserer Schätzung 200 GB, zusätzlich zu allem, was das Gerät sonst speichert. Bei der Basiskonfiguration mit 256 GB bleiben 56 GB, und die Installation eines macOS-Updates braucht während der Ausführung eigenen freien Platz (support.apple.com/en-us/102624, geprüft im September 2026); bei 512 GB bleiben 312 GB, auf dem 2-TB-Modul 1800 GB. Das sind Planungszahlen, keine Messung eines bestimmten Setups, und ein einzelner Download der 70-Mrd.-Klasse, 43 GB in der Tabelle oben, reicht allein, um den Großteil dessen zu belegen, was bei 256 GB übrig ist. Wie bei jedem Laufwerk zeigt macOS eine etwas geringere Kapazität als angegeben, weil Formatierung und Betriebssystem einen Teil des Platzes belegen (support.apple.com/en-us/102119, geprüft im September 2026).
Die echten Zahlen auf Ihrem Gerät prüfen
Die Tabelle oben ist eine Planungsschätzung. Zwei Befehle zeigen, was ein bestimmtes Gerät tatsächlich belegt.
du -sh ~/.ollama/models
du -sh ~/.cache/huggingfaceDer erste meldet Ollamas eigene Downloads, standardmäßig unter ~/.ollama/models gespeichert (docs.ollama.com/faq, geprüft im September 2026); der zweite meldet den oben beschriebenen Hugging-Face-Cache. Keiner der beiden Befehle erfasst die Modelle von LM Studio, die in dem Modellordner liegen, der im Tab „My Models“ der App festgelegt ist (lmstudio.ai/docs/app/basics/download-model, geprüft im September 2026).
Warum ein externes Laufwerk für Modell-Caches umständlich ist
Modell-Caches lassen sich vom internen Laufwerk verlegen, aber das Umständliche ist nicht der Platz, sondern das Laufwerk selbst.
- Caches werden pro Werkzeug verlegt, nicht global: Ollama zieht mit der Umgebungsvariable
OLLAMA_MODELSum (docs.ollama.com/faq, geprüft im September 2026), der Hugging-Face-Cache mitHF_HOME(huggingface.co/docs/huggingface_hub/guides/manage-cache, geprüft im September 2026), und den Modellordner von LM Studio ändern Sie im Tab „My Models“ (lmstudio.ai/docs/app/basics/download-model, geprüft im September 2026); eine einzelne Einstellung, die alle drei verlegt, gibt es nicht. - Ruhezustand und Kabel: macOS kann Festplatten über die Einstellung „Festplatten nach Möglichkeit in den Ruhezustand versetzen“ unter „Energie“ in den Systemeinstellungen schlafen legen (support.apple.com/guide/mac-help/mchle41a6ccd/mac, geprüft im September 2026), und ein externes Laufwerk bringt ein Kabel und ein Gehäuse mit, die beide angeschlossen bleiben müssen. Ein Laufwerk, das abgezogen wird oder den Strom verliert, nimmt jedes Modell darauf mit, bis es wieder da ist.
- Ladezeit: Die Produktseite unseres Moduls nennt 4400 MB/s beim Schreiben und 3000 MB/s beim Lesen (geprüft im September 2026). Ein externes Laufwerk wird über einen der drei Thunderbolt-4-Anschlüsse des M4 mit bis zu 40 Gbit/s verbunden oder über die zwei USB-C-Anschlüsse vorne, USB 3 mit bis zu 10 Gbit/s (support.apple.com/en-us/121555, geprüft im September 2026). 10 Gbit/s sind 1250 MB/s vor jedem Protokoll-Overhead, weniger als die Hälfte der angegebenen Leserate des Moduls. 40 Gbit/s sind die gesamte Verbindungsrate von Thunderbolt 4; die Daten eines Laufwerks laufen über seine PCIe-Verbindung, für die Intel mindestens 32 Gbit/s vorschreibt (intel.com/content/www/us/en/gaming/resources/upgrade-gaming-accessories-thunderbolt-4.html, geprüft im September 2026), etwa 4000 MB/s vor Overhead und damit auf dem Papier noch über dieser Leserate; die tatsächliche Geschwindigkeit hängt von Gehäuse, Kabel und dem Laufwerk darin ab, die Sie selbst kaufen und prüfen müssten. Nach unserer Rechnung dauert das Lesen der 20 GB von deepseek-r1:32b bei 3000 MB/s etwa 7 Sekunden und bei 1250 MB/s mindestens 16 Sekunden. In beiden Fällen ist das nur die Ladezeit, nie die Geschwindigkeit, mit der das Modell nach dem Laden antwortet.
Nichts davon schließt ein externes Laufwerk als kaltes Archiv für selten geladene Modelle aus; beim Arbeitssatz, zwischen dem Sie oft wechseln, kosten das Verlegen der Caches und das Risiko eines Abbruchs mitten im Laden mehr, als der Platz wert ist.
Die ehrlichen Einschränkungen
- Die Basiskonfiguration mit 16 GB führt Modelle mit etwa 7 bis 14 Mrd. Parametern in 4 Bit aus: Bei etwa 0,6 GB pro Milliarde Parameter ist ein 7-Mrd.-Modell etwa 4,4 GB groß (mistral:7b) und ein 14-Mrd.-Modell etwa 9 GB (qwen2.5:14b, phi4:14b). Ein 9-GB-Modell lässt von 16 GB etwa 7 GB für sein Kontextfenster, macOS und jede andere geöffnete App, unsere eigene Rechnung; deshalb ist 14 Mrd. bei 16 GB die obere Grenze. Ein größeres Modell lässt sich zwar trotzdem laden, lässt aber wenig Platz für Kontext.
- 32 GB erreichen die 30-Mrd.-Klasse; 24 GB reichen nicht. Beides sind Optionen bei der Konfiguration auf Bestellung (support.apple.com/en-us/121555, geprüft im September 2026). Der 20-GB-Download von deepseek-r1:32b lässt bei einem Gerät mit 32 GB etwa 12 GB für Kontext und macOS, mehr als ein 14-Mrd.-Modell bei 16 GB übrig lässt; bei 24 GB bleiben etwa 4 GB, unter der Grenze von 7 GB, wieder unsere eigene Rechnung. Das GPU-Budget ist noch knapper: llama.cpp bezieht sein GPU-Speicherbudget auf einem Mac aus Metals
recommendedMaxWorkingSetSize, nicht aus dem installierten Gesamtwert (github.com/ggml-org/llama.cpp, Quelltext des Metal-Backends, geprüft im September 2026), und ein llama.cpp-Log von einem Mac mini mit M2-Chip und 24 GB meldet dafür 16384 MiB (github.com/ggml-org/llama.cpp/issues/3911, geprüft im September 2026), nach unserer Umrechnung etwa 17,2 GB, weniger als das 20-GB-Modell. Die Grenze für den festen Arbeitsspeicher des Systems mit einemsysctlanzuheben, ist ein Schritt für Fortgeschrittene, den die Dokumentation von mlx-lm für ein Modell beschreibt, das in den Arbeitsspeicher passt, aber langsam läuft (github.com/ml-explore/mlx-lm, geprüft im September 2026); an den 24 GB insgesamt ändert er nichts. - Ein 70-Mrd.-Modell ist eine Frage des Arbeitsspeichers, die diese SSD nicht beantworten kann: Der Standard-Download von llama3.1:70b ist 43 GB groß, mehr als die maximal 32 GB gemeinsamer Arbeitsspeicher des Mac mini M4, noch bevor Kontext oder macOS gezählt sind (support.apple.com/en-us/121555, geprüft im September 2026). Der Mac mini M4 Pro lässt sich auf 64 GB konfigurieren (gleiche Quelle), was nach unserer Rechnung etwa 21 GB neben diesen Gewichten übrig ließe, aber das ist ein anderes Gerät, und in dieses passt das Modul nicht. Daran ändert kein Speicher etwas: Es ist eine Obergrenze des Arbeitsspeichers, festgelegt im Moment des Kaufs.
- Die SSD ändert die Ladezeit, nicht die Token-Geschwindigkeit: Sobald die Gewichte eines Modells im Arbeitsspeicher sind, hängt die Geschwindigkeit, mit der es Tokens erzeugt, von der Speicherbandbreite ab, beim M4 120 GB/s (support.apple.com/en-us/121555, geprüft im September 2026), und von der Rechenleistung des Chips, beides durch die gekaufte Konfiguration festgelegt. Die SSD ändert nur, wie lange es dauert, diese Gewichte beim Laden eines Modells vom Laufwerk zu lesen; ein schnelleres Laufwerk startet ein Modell früher, es lässt es nicht schneller denken.
Keine dieser Einschränkungen spricht dagegen, Modelle lokal auszuführen; es sind die Zahlen, die man für ein bestimmtes Modell prüfen sollte, bevor man annimmt, dass es passt.
Verwandte Fragen
Brauche ich eine Internetverbindung, wenn ein Modell geladen ist?
Läuft ein Modell mit mehr Speicher schneller?
Kann ich mehr als ein Modell gleichzeitig ausführen?
Welche Kapazität sollte ich für lokale Modelle bestellen?
Ist das etwas anderes, als einen Mac mini als Heimserver zu betreiben?
Bereit für das Upgrade?
Weitere Ratgeber
- Mac mini M4 als Heimserver: Warum zuerst der Speicher ausgehtWenig Strom im Leerlauf, leise und klein genug, um im Regal zu verschwinden. Was ein Heimserver tatsächlich speichert und warum die 256 GB der Basis weg sind, bevor die eigentliche Arbeit beginnt.
- Programmieren mit KI aus der Ferne auf einem Mac mini M4 mit Tailscale, mosh und herdrTailscale verbindet die beiden Geräte ohne Portweiterleitung, mosh hält die Shell über Ruhezustand und WLAN-Wechsel hinweg am Leben, und herdr lässt KI-Coding-Agenten zwischen den Sitzungen weiterlaufen. Einrichtungsschritte, ehrliche Einschränkungen und ein berechnetes Speicherbudget.
- KI-Coding-Agenten in der Sandbox auf dem Mac mini M4: Tart-VMs, Apple container und der Speicher, den sie brauchenTart klont vollständige virtuelle Maschinen mit macOS oder Linux aus einem einzigen geladenen Image und nutzt dabei APFS-Copy-on-Write, sodass ein Klon günstig bleibt, bis er von seiner Basis abweicht; Apples container und Devcontainer von Claude Code sind leichtere Alternativen mit eigenen Grenzen. Befehle zur Einrichtung, ehrliche Einschränkungen und ein berechnetes Speicherbudget.