Soofi S 30B-A3B: Ein sparsames deutsches KI-Modell?

Our Podcast with Sven Kramer & Sebastian Karger

Want more analyses & insights like this delivered weekly to your inbox?
Sign up for the Tech Update now!

The digital world moves fast! This article was published more than 180 days ago. While the core ideas may still hold value, some details or data might be outdated. Need up-to-date assessments? Feel free to contact us!

This content has been automatically translated.

Update

Diagramm zur Performancemessung verschiedener Sprachmodelle: Soofi S zeigt die höchste Inferenzgeschwindigkeit (TPS/GPU) über verschiedene Kontextlängen.

Soofi

Ein vom KI Bundesverband koordiniertes Konsortium hat Soofi S 30B-A3B veröffentlicht. Ein Sprachmodell, trainiert in der Industrial AI Cloud der Deutschen Telekom in München. Rund 253.000 GPU-Stunden, gekühlt mit Wasser aus dem Eisbach-Kanal, die Abwärme geht in den Tucherpark.

In Phase zwei des Trainings macht Deutsch 15,3 Prozent des Mixes aus. Im Nemotron-Referenzrezept entfallen rund 5 Prozent auf alle nicht-englischen Sprachen zusammen. Ergebnis: bester Wert unter den vollständig offenen Modellen auf deutschen Benchmarks.

Ein paar technische Rahmendaten: Das Modell hat 31,6 Milliarden Parameter, nutzt pro Token aber nur 3,2 Milliarden davon. Mixture of Experts, hybride Mamba-Transformer-Architektur, übernommen von Nvidias Nemotron 3 Nano. Nur 6 von 52 Layern halten überhaupt einen KV-Cache vor. Praktische Folge: Bei 40.000 Token Kontext und 32 parallelen Anfragen erzeugt Soofi S pro GPU etwa achtmal mehr Token pro Sekunde als dichte Modelle im Bereich 14 bis 24 Milliarden Parameter. Und der Durchsatz bleibt von 4.000 bis 256.000 Token nahezu konstant, während klassische Modelle wegkippen.

Warum ist das wichtig?

Die meisten Souveränitäts-Diskussionen enden bei der Frage, wo der Server steht. Hier bleiben jetzt nur noch die Chips als nicht souveräne Komponente.

Außerdem ist es ein Modell, das bei langen Kontexten nicht einbricht und man damit auf 800 Seiten technische Dokumentation loslassen kann, ohne dass die Inferenzkosten explodieren.

Dazu kommt echte Offenheit. Veröffentlicht sind Gewichte, ausgewählte Zwischencheckpoints, kompletter Trainings- und Evaluationscode sowie eine Datenauflistung mit Rohtokenzahl und effektivem Beitrag pro Quelle. Sogar geprüfte und dann verworfene Quellen sind dokumentiert. Wer schon mal versucht hat, einem Compliance-Team zu erklären, womit ein Modell trainiert wurde, weiß, was das wert ist.

Unsere Einordnung

Ein Ranking unter vollständig offenen Modellen ist ein Ranking in einer überschaubaren Liga. Gegen GPT-5.6 Sol oder Kimi K3 tritt Soofi S nicht an und will es auch nicht. Der Vergleich, der zählt, ist ein anderer: Ist das Modell gut genug für die Aufgabe, die es lösen soll. Für Klassifikation, Extraktion, Zusammenfassung und Vorqualifizierung im deutschsprachigen Kontext lautet die Antwort ziemlich oft ja.

One more: Chinchilla, kurz erklärt

Kaum war Soofi S draußen, kam der Vorwurf, das Modell sei "übertrainiert". Die Chinchilla-Gesetze von Google DeepMind nennen rund 20 Token pro Parameter als recheneffizientes Optimum. Soofi S liegt bei mehreren Hundert zu eins. Die technische Leitung hält dagegen, dass diese Regeln für Mixture-of-Experts-Architekturen nicht mehr gelten und verweist auf Nvidia, das eigene Modelle ebenfalls auf bis zu 25 Billionen Token trainiert hat.

Zum Glück müsst ihr diesen Streit nicht entscheiden. Zwei Gedanken reichen. Erstens: Chinchilla optimiert Trainingskosten. Die zahlt das Konsortium. Ihr zahlt die Inferenz. Zweitens: Ob Benchmark-Werte effizient zustande kamen, ist eine Frage für die Wissenschaft. Ob das Modell eure Dokumente sauber verarbeitet, entscheidet der eigene Test.

Für unsere Kunden geht es an dieser Stelle noch weiter.
Jetzt anmelden!

Dive in!

Sehen Sie Parallelen zu Ihren Herausforderungen? Lassen Sie uns besprechen, wie eine maßgeschneiderte Lösung für Sie aussehen könnte.

Continue Reading

By clicking “Accept”, you agree to the storing of cookies on your device to enhance site navigation, analyze site usage, and assist in our marketing efforts. View our Privacy Policy for more information.