| LLM auf lokalem PC ausführen | • Aidex • KI • Impressum • Datenschutz |
| KI auf deinem PC
Seit 2025 ist es möglich, Sprachmodelle offline auf einem normalen PC auszuführen, also unabhängig von einem Betreiber im Internet. Beim Betrieb auf dem eigenen PC hat man bezüglich Personendaten und Firmengeheimnissen weniger Probleme mit dem Datenschutz, weil die Eingaben nicht nach außen übertragen werden. Ermöglicht wurde der lokale Betrieb durch die Veröffentlichung kompakter und kostenloser Modelle (Open-Weight-Modelle) basierend auf einem Bündel neuer Techniken zur Verkleinerung, z.B. Distillation und Quantisierung, siehe unten. Die runterladbaren Modelle selbst sind passive Dateien, mit Größen beginnend ab 3 Gigabyte. Um ein Modell quasi "zum Leben" zu erwecken, wird ein Programm benötigt - allgemein kurz als „Model Runner“ oder „LLM Runner“ oder „Local LLM Client“ bezeichnet. Ein solches Anwendungsprogramm besteht aus der Oberfläche, in die man seine Fragen und Aufgaben eingibt, sowie die im Hintergrund arbeitende „LLM Inference Engine“. Die Inference Engine ist ein Berechnungsprogramm, das Texte tokenisiert und mittels Matrizenberechnungen den Antwort-Text erzeugt. Bekannte LLM Runner sind „LM Studio“ und „Ollama“, die beide unten beschrieben werden. Beide Programme sind kostenlos, gehören aber zu kommerziellen Unternehmen. Beide nutzen die Inferenz-Engine ↗llama.cpp bzw. ggml, das seit 2023 als OpenSource entwickelt wird. „Ollama“ ist Open Source, „LM Studio“ ist proprietär. Beide sind kostenlos für die gängigen Betriebssysteme macOS, Windows und Linux verfügbar. Für iOS und Android gibt es andere Projekte, jedoch waren Smartphones bisher nicht leistungsstark genug für größere Modelle. |
| Ausprobiert: LM Studio
Ich habe ↗LM Studio (Chat) heruntergeladen, nicht Bionic (Agent). Der Agent braucht große Sprachmodelle und viel Rechenpower. Ich wollte hingegen einen Chat auf einem kleinen Büro-PC ausprobieren. Es ist wohl das Geschäftsmodell des Herstellers, bei größerem Bedarf doch die kostenpflichtige Cloud anzubieten. Nach dem Installieren von LM-Studio habe ich im Programm als Nutzer-Typ den „Power User“ ausgewählt,
damit alle Optionen angezeigt werden.
Modellsuche: In der normalen Programmoberfläche sieht man links eine Lupe. Nach Klick wird eine Liste verfügbarer Modelle angezeigt. Ich habe mich in der Liste zunächst für ein 4 GB großes Modell entschieden. LM-Studio kann Modelle verwenden, die im GGUF-Format bereitstehen. GGUF (GPT Generated Unified Format) ist ein effizientes Dateiformat und ist ein De-facto-Standard geworden. Nachdem ein Modell heruntergeladen wurde, muss man es aktivieren. Dadurch blockiert das Modell den Arbeitsspeicher so lange, bis man es wieder deaktiviert (oder bis das Programm beendet wird). Im Vergleich zu den bekannten kommerziellen Online-Modellen (ChatGPT, Claude, Vibe u.a.) werden Sie feststellen, dass die Qualität der komprimierten Modelle nicht mithalten kann. Mir ist aufgefallen, dass die kleinen Modelle viel labern und stark abschweifen, ohne genau auf die Frage einzugehen. Manchmal kann man den Laberfluss nur durch den Stop-Button beenden. Mittels der Option „Limit response length“ kann man die Antwortlänge begrenzen, damit sich das Modell nicht endlos verrennt. Wie ich bei einem anderen Test mit Ollama festgestellt habe, verrennen sich größere Modelle nicht dermaßen. Sie bleiben besser beim Thema und finden selber ein Ende. |
| Ausprobiert: Ollama
↗Ollama ist Open Source (im Gegensatz zu LM Studio) und ist seit Mitte 2025 auch als Desktop-App verfügbar. Der Programm-Download ist bereits 1,5 GB groß, weil mehrere Programmbibliotheken für verschiedene CPUs/GPUs enthalten sind. Das Runterladen der ↗Modelle läuft per Kommandozeile, z.B. ollama pull qwen3.5:9b ollama pull gemma4:12b- diese mit 6,6 GB bzw. 7,4 GB Downloadgröße. Die Modelle sind anschließend sofort in der Programmoberfläche verfügbar. Auch in Ollama hatte ich anfangs kleinere Sprachmodelle mit nur 3 GB Größe getestet, habe dabei aber die gleichen schlechten Erfahrungen gemacht wie bei LM Studio, siehe oben. Die kleinen Sprachmodelle sind wie Wirrköpfe mit Laberfluss. Das ist mir den Strom nicht wert. Ich kann mir nicht vorstellen, dass das einen praktischen Nutzen haben kann. ↗Gemma ist ein Modell von Google USA, ↗Qwen ein Modell von Alibaba Singapur (Mutterkonzern in China). Die Offline-Nutzung eines ausländischen Modells auf dem lokalen PC ist unbedenklich. Bei dem von China geprägten Modell kann man evtl. bei der Frage nach dem Tiananmen-Massaker nicht die gleiche Antwort erwarten wie von einem westlichen Sprachmodel. Und ob sich die Modelle aus den USA und China in Fragen von Kapitalismus und Sozialismus unterscheiden, habe ich (noch) nicht getestet. |
| Optimiert: Open-Weight-Modelle
Neue Modell-Architekturen sind so konzipiert, dass sie weniger Ressourcen beanspruchen, etwa durch sparsamere Attention-Mechanismen oder einen modularen Aufbau. Das Zusammenspiel aller Optimierungen ermöglicht es, dass nun Sprachmodelle mit Milliarden Parametern auf normalen PCs lauffähig sind. Ein zentraler Ansatz ist die Modell-Distillation: Dabei überträgt ein großes „Teacher“-Modell sein Wissen auf ein kleineres „Student“-Modell, das mit deutlich weniger Parametern nahezu vergleichbare Ergebnisse liefert. Ergänzend spielt die Quantisierung eine entscheidende Rolle: die Gewichte des Modells werden in kleinere Zahlenformate (z.B. 8 Bit oder 4 Bit) umgerechnet, was den Speicherbedarf und die Rechenzeit massiv reduziert. Darüber hinaus sorgt das Pruning dafür, dass selten genutzte oder redundante Teile des Netzwerks entfernt werden, ohne die Modellgüte stark zu beeinträchtigen. Ergänzt werden diese Methoden durch Frameworks wie MLC-LLM (Optimierung für spezifische Hardware) oder z.B. TensorRT-LLM (herstellerspezifische High-Performance-Library), die die Hardware effizient ausnutzen und CPUs, GPUs oder NPUs gezielt ansprechen. Q4_K_M und ähnliche Abkürzungen findet man in den Dateinamen. Q4 bedeutet eine Quantisierung auf 4 Bit. K-Quantisierung bedeutet eine variable Skalierung, und das M (Medium) steht für selektive Komprimierung. Q4_K_M wird oft als der beste Allround-Kompromiss zwischen Größe, Geschwindigkeit und Qualität für die meisten Benutzer angesehen. |