KI News Kompakt

KI kurz erklärt › Lokale KI & Quantisierung

Lokale KI & Quantisierung

Wie große Sprachmodelle auf Laptop oder Handy laufen – ohne Cloud.

Lokale KI heißt: Das Modell läuft auf deinem eigenen Gerät. Deine Daten verlassen den Rechner nicht, und es fallen keine Gebühren pro Anfrage an. Kostenlose Programme wie LM Studio oder Ollama machen das auch ohne Programmierkenntnisse möglich.

Der Trick: Quantisierung

Normalerweise speichert ein Modell jede seiner Zahlen mit 16 Bit. Bei der Quantisierung werden sie gröber gespeichert – mit 8, 4 oder sogar weniger als 2 Bit. Das Modell braucht dann nur einen Bruchteil des Speichers. Der Preis: Mit jeder Stufe kann die Qualität leiden, und wie stark, zeigen oft erst unabhängige Tests.

Mixture of Experts

Viele neue Modelle bestehen aus vielen „Experten“, von denen pro Wort nur wenige rechnen. Ein Modell mit hunderten Milliarden Parametern nutzt so pro Schritt nur einen kleinen Teil – ein Grund, warum auch sehr große Modelle auf gut ausgestatteten Laptops laufen können.

Mehr dazu im Podcast

Weitere Begriffe

KI-Agent

Eine KI, die nicht nur antwortet, sondern selbst Schritte ausführt – klicken, buchen, Mails schreiben.

Token

Die Recheneinheit von Sprachmodellen – und die Einheit, in der KI-Anbieter abrechnen.

Agenten-Protokolle: MCP, A2A, AP2, UCP

Die gemeinsamen Regeln, über die KI-Agenten mit Werkzeugen, miteinander und mit Shops sprechen.