01M4 vs M5 KI-Leistung: NPU, Speicher, Bandbreite, Software-Ökosystem
Bei lokalen LLMs limitiert nicht die CPU-Taktfrequenz, sondern Unified-Memory-Kapazität, GPU/NPU-Inferenzpfad und Framework-Optimierung. Die folgende Tabelle fasst die vier entscheidenden Hardware-Dimensionen zusammen — Stand Q2 2026:
| Dimension | Mac mini M4 | Mac mini M5 (Prognose) | Einfluss auf lokale LLM |
|---|---|---|---|
| NPU | 38 TOPS (verifiziert) | 45–50 TOPS | M5 Core ML etwas schneller; MLX primär GPU |
| Unified Memory | 16–32 GB wählbar | 512 GB Einstieg (Gerücht) | M4 16 GB läuft 7B Q4 |
| Speicherbandbreite | 120 GB/s | 120–150 GB/s | 32B-Modelle profitieren bei Prefill |
| Framework-Reife | MLX / Ollama vollständig | Neue Chip-Validierung nötig | M4: beste Docs & Community |
| Anschaffungskosten | Lagernd + 256 GB Option | Höherer Einstiegspreis | M4 Kauf/Miete günstiger |
Architektur-Details: M4 vs M5 Architektur-Kaufberatung. M5-Gerüchte: M5/M5 Pro — alles bisher bekannt.
02Drei Auswahl-Engpässe: Warum «auf M5 warten» bei lokalen LLMs teurer ist
In Post-Mortems wiederholen sich dieselben Fehlentscheidungen — unabhängig vom NPU-Hype:
- Leistungsillusion: +20 % NPU-TOPS bedeuten nicht doppelt so schnelle Token-Generierung. Llama 3 8B Q4 erreicht auf M4 etwa 45–55 tok/s, M5-Prognose 50–65 tok/s — im Dialog-Alltag kaum spürbar. Monatelanges Warten kostet mehr als der Leistungsgewinn einspart.
- Speicher schlägt Chip: 7B Q4 belegt 5–6 GB, 32B benötigt 20 GB+. 16 GB M4 fährt 7B–13B; 24 GB+ für stabile 32B-Inferenz. Auf M5-NPU zu warten, während die RAM-Spezifikation ignoriert wird, ist der häufigere Fehler.
- Versteckte TCO: M4 512 GB Kauf ab ~800 $, M5-Einstieg vermutlich höher; Strom, Kühlung und Leerstand nicht eingerechnet. Kurz-PoC per M4-Miete ab 98,7 $/Monat liegt typisch unter drei Monaten Cloud-GPU.
03Szenario-Matrix: Wo M4 reicht — und M5 erst später Sinn macht
Zuordnung nach Modellgröße und Einsatz — Bewertung Q2 2026, Community-Benchmarks:
| Einsatzszenario | Empfohlener Chip | RAM-Empfehlung | Pragmatischer Pfad |
|---|---|---|---|
| 7B Dialog / RAG-Prototyp | M4 ausreichend | 16 GB | M4 512G zwei Wochen mieten |
| 13B Text / Code-Assistenz | M4 24 GB | 24 GB | neokvm 512G-Paket Dauerbetrieb |
| 32B Private Deployment | M4 32 GB oder M5 | 32 GB+ | Erst M4-Durchsatz messen |
| Multimodal / Heavy Training | M5 / M5 Pro | 32 GB+ | Nach M5-Verfügbarkeit evaluieren |
| Team Multi-Instance API | Mehrere M4-Instanzen | 16–24 GB pro Node | neokvm elastische Skalierung |
Fazit: 80 % der lokalen-LLM-Anforderungen von Solo-Entwicklern und KMU liegen bei 7B–13B — M4 mit MLX/Ollama deckt das ab; M5-Aufpreis rechtfertigt kein Leerstand.
04Fünf Umsetzungsschritte: Lokales LLM auf Mac mini M4 in einer Woche
- Schritt 1 — Modell und RAM-Budget festlegen: Zielmodell wählen (z. B. Llama 3.1 8B, Qwen2.5 7B), quantisierten Speicherbedarf prüfen. 16 GB für 7B, 24 GB für 13B als Sicherheitslinie.
- Schritt 2 — Apple-Silicon-Umgebung bereitstellen: Lokale LLMs erfordern echtes macOS. Ohne Hardware: neokvm M4 per SSH — Homebrew und Python 3.11+ am selben Tag.
- Schritt 3 — Framework wählen und Modell laden: Apple-Ökosystem → MLX; schnellster Einstieg → Ollama (
ollama run llama3.1:8b). llama.cpp für CLI und Embedded-Integration. - Schritt 4 — Durchsatz und Stabilität messen: Prefill/Decode tok/s, 2-Stunden-Dauerlast dokumentieren. Benchmark per
curl localhost:11434/api/generateoder MLX-Skript. - Schritt 5 — Zwei-Wochen-ROI-Review: Cloud-API-Monatskosten, Kaufabschreibung und Miete vergleichen. M5-Upgrade nur bei 32B+-Last mit unzureichendem Durchsatz — keine Sunk-Cost-Falle.
05Referenzdaten: Lokale LLM-Kennzahlen Q2 2026
06Fazit & Kaufempfehlung: Chipwahl ist halbe Miete — Umgebung entscheidet den ROI
Kernfazit: 2026 ist M5-NPU ein inkrementelles Upgrade, M4 das optimale Preis-Leistungs-Verhältnis für lokale LLMs — 38 TOPS reichen für 7B–13B-Alltagsinferenz, MLX/Ollama-Ökosystem ist ausgereift, Mietkosten liegen unter dem Leerstand durch M5-Warten.
Teams, die RAG, private Dialoge oder Agent-Backends schnell validieren wollen, verlieren mit 1–2 Wochen Kauf-Lieferzeit das PoC-Fenster. neokvm Remote-M4 ist der schnellste Einstieg: am selben Tag SSH-Zugang, 512 GB für parallele Inferenz-Instanzen, monatlich kündbar — Ollama oder MLX auf echtem macOS, Monatskosten typisch unter einer Woche gleichwertiger Cloud-GPU.
Kaufweg: kaufen.html → APAC- oder US-West-Node + M4-512-GB-Paket → SSH-Login, MLX/Ollama installieren → Fünf-Schritte-Checkliste in einer Woche abschließen. Tarife: preise.html.
Mac mini M4 monatlich mieten — MLX / Ollama am selben Tag
SSH in ~30 Minuten produktiv; 512 GB für 7B–32B quantisierte Modelle — ohne M5-Warten, ohne Lieferverzögerung.