Das Wichtigste in Kürze
- Gemma 4 12B bringt multimodale KI auf handelsübliche Laptops
- Das Modell verarbeitet Text, Bild und Audio ohne separate Encoder
- Es läuft lokal mit nur 16 GB RAM und erreicht fast die Leistung des 26B-Modells
Gemma 4 12B von Google DeepMind bringt multimodale KI auf handelsübliche Laptops. Das Modell verarbeitet Text, Bild und Audio ohne separate Encoder direkt im Sprachmodell. Bilder und Audio werden direkt in das Sprachmodell eingespeist, was die Verarbeitungszeit verkürzt. Dadurch sinken Speicherverbrauch und Latenz.
Lokale Leistung
Gemma 4 12B läuft lokal mit nur 16 GB RAM und erreicht laut Google in Benchmarks fast die Leistung des doppelt so großen 26B-Modells. Es ist zudem das erste mittelgroße Gemma-Modell mit nativer Audioverarbeitung.
Anwendungsfälle
Das Modell beherrscht Spracherkennung, Codegenerierung und Videoanalyse. Laut Developer Guide kann es etwa mehrminütige Videoclips verarbeiten, indem es Einzelbilder und Audiospur gemeinsam analysiert. In einem Beispiel wertete das Modell einen fünfminütigen Ausschnitt der Google‑IO‑Keynote mit 313 Frames bei einem Bild pro Sekunde plus Audio aus.
Verfügbarkeit
Gemma 4 12B ist über Hugging Face, Ollama, LM Studio und weitere Plattformen verfügbar. Die Lizenz ist Apache 2.0, damit ist das Modell auch kommerziell nutzbar.
Was die Quelle offen lässt
Die Quelle nennt keine genauen Leistungsdaten, keine Vergleichsbenchmarks mit anderen Modellen und keine Details zur Implementierung der Audioverarbeitung. Auch die Grenzen der Videoanalyse werden nicht beschrieben.
Haeufige Fragen
Was ist Gemma 4 12B?
Ein multimodales KI-Modell von Google DeepMind
Wie viel RAM benötigt Gemma 4 12B?
16 GB RAM
Inhalt zusammengefasst und neu verfasst auf Basis der genannten Quelle. Snowbyte ist nicht der Autor des Original-Beitrags.
