KI News

Neues KI-Modell von Google: Gemma 4 12B vereint Text, Bild und Audio auf Laptops

1 min Lesezeit
Neues KI-Modell von Google: Gemma 4 12B vereint Text, Bild und Audio auf Laptops

Google Deepmind hat ein innovatives KI-Modell namens Gemma 4 12B vorgestellt, das multimodale Funktionen auf handelsüblichen Laptops ermöglicht. Dieses Modell ist in der Lage, Text, Bilder und Audio ohne separate Encoder direkt im Sprachmodell zu verarbeiten. Besonders interessant ist, dass Google KI-Agenten beim Online-Shopping unterstützt, was die Anwendungsmöglichkeiten von Gemma 4 12B erweitert.

Die direkte Einspeisung von Bildern und Audio in das Sprachmodell führt zu einer verkürzten Verarbeitungszeit. Dies hat zur Folge, dass sowohl der Speicherverbrauch als auch die Latenz reduziert werden. Gemma 4 12B kann lokal mit lediglich 16 GB RAM betrieben werden und erreicht laut Google in Benchmarks nahezu die Leistung des größeren 26B-Modells. In diesem Zusammenhang ist es auch spannend zu sehen, dass OpenAI neue Modelle mit verbesserten Fähigkeiten präsentiert hat, die möglicherweise ähnliche Fortschritte in der KI-Technologie fördern.

Darüber hinaus ist es das erste mittelgroße Gemma-Modell, das eine native Audioverarbeitung bietet. Dies könnte auch die Entwicklung von Anwendungen beeinflussen, wie sie in dem Wettbewerb zur Entwicklung eines kompakten Sprachmodells von OpenAI angestrebt werden.

„`


Quellen: the-decoder

Bildquelle: KI generiert

KI Snack