Zurück zur Übersicht

Begriff

Colibrì: 744B-MoE von Platte streamen

AI Local AI S2
8 Quellen 1 Lernpfad 1 Backlink enriched

Warum wichtig?

Dieser Begriff ist ein Knoten im SengakujiWorks-Wissensnetz. Nutze Level 0 für die erste Einordnung, Level 1 für Praxis, Level 2 für technische Struktur und Level 3 für Grenzen, Fallstricke und Expertenkontext.

Colibrì ist ein Proof-of-Concept für lokale Inferenz, kein Wunderwerkzeug. Es streamt die Experten eines riesigen Mixture-of-Experts-Modells (GLM-5.2, ~744B Parameter) von einer NVMe-SSD statt sie vollständig in den Grafikspeicher oder RAM zu laden. Dadurch sinkt das RAM-Residenzminimum stark, aber die Antwortgeschwindigkeit nicht.

Im Lehrgang gehört dieser Begriff zur Phase lokale AI, Hardware-Grenzen und Modellgrößen. Er eignet sich, um die Grenze zwischen „Modell passt in den Speicher" und „Modell antwortet schnell" zu verstehen. Wer ganz neu einsteigt, sollte drei Dinge mitnehmen: Colibrì ist ein technisches Experiment, „läuft mit 25 GB RAM" ist nicht dasselbe wie „läuft schnell", und das Projekt ist Hersteller-marketed, aber nur teilweise unabhängig bestätigt.

Merksatz: Colibrì zeigt, wie ein 744B-MoE mit wenig RAM resident wird — nicht, wie es damit schnell genug für Chat wird.


Quick-Check

  1. Was ist der Zweck von Colibrì?
    Ein Proof-of-Concept, der die Experten eines ~744B-MoE (GLM-5.2) von NVMe streamt statt sie vollständig resident zu halten.
  2. Bedeutet „läuft mit 25 GB RAM" auch „interaktiv schnell"?
    Nein. Auf der beworbenen Box misst die Community 0,05–0,1 tok/s, also rund 20 Minuten pro Antwort ([COL-03]).
  3. Was ist der dominierende Engpass?
    NVMe-I/O: ~11 GB Lesezugriff pro Token. RAM-Größe und CPU-Matmul sind sekundär.
  4. Ist „production since late June 2026" ein Fakt?
    Nein, das ist ein Projektclaim ohne unabhängige Bestätigung ([COL-06]). Unabhängige Reviews beschreiben Colibrì als „smart but slow" ([COL-07]).
  5. Wann darfst du Colibrì nicht für Produktion einsetzen?
    Solange der „production"-Status nur ein Projektclaim ist, die Geschwindigkeit auf der Zielmaschine bei Minuten pro Antwort liegt und 370 GB Fremd-Weights plus Python-Konvertierung ungeprüft in deinen Build fließen.