Notizie IA Logo

AITalk

Nachrichten und Analysen zur Künstlichen Intelligenz

Empero und die Destillation: Ich habe ihr Qwen3.8-35B-A3B getestet

Generative AITrainingStartups

empero-qwen38-35b.jpg

Wenn ein unabhängiges Labor verspricht, die Argumentationsfähigkeit eines Frontier-Modells in eine Datei zu übertragen, die man herunterladen und auf dem eigenen PC ausführen kann, lautet die richtige Frage nicht, ob es auf dem Papier gelungen ist, sondern was von diesem Versprechen übrig bleibt, wenn die Datei tatsächlich im Arbeitsspeicher eines Verbraucher-PCs landet. Das war die leitende Frage in den vorherigen Folgen dieser Serie, von Qwen 3.5 9B über Qwen 3.6 35B, und sie kehrt heute mit einem anderen Protagonisten zurück: kein offizielles Modell eines Milliarden-Labors, sondern ein deutsches Projekt namens Empero und eines seiner Destillate, Qwen3.8-35B-A3B-Distill.

Ein deutsches Labor gegenüber der Cloud

Empero beschreibt sich selbst als ein unabhängiges Forschungslabor mit Sitz in Deutschland, das sich der Entwicklung von Sprachmodellen widmet, die effizient genug sind, um auf eigener Hardware des Nutzers zu laufen, ohne über eine Drittanbieter-API zu gehen. Das ist kein isolierter Slogan: Auf ihrer Website erklärt der Bereich für europäische Unternehmen, dass eine wachsende Zahl von Firmen keine regulierten Daten an eine ausländische API senden kann und dass ein lokal ausführbares, unter Apache-2.0-Lizenz stehendes Modell, dessen Gewichte überprüfbar sind, genau dieser Anforderung entspricht. Das ist eine kommerzielle Positionierung vor einer technischen, und es lohnt sich, sie bei der Lektüre der folgenden Zahlen im Hinterkopf zu behalten.

Das Ökosystem, das Empero um diese Philosophie herum aufgebaut hat, ist umfangreicher als das einzelne Modell, das ich heute teste. Es gibt Familien von Destillaten aus Qwen3.8, die in Größen von 2, 4 und 9 Milliarden Parametern zusätzlich zur 35B-Version verfügbar sind, die wir heute verwenden; es gibt die Qwythos-Reihe mit über einer Million Downloads auf Hugging Face; einen Kommandozeilen-Coding-Agenten namens Abacus, der für die Arbeit mit lokalen oder entfernten Endpunkten entwickelt wurde; und interne Forschungswerkzeuge wie rethink zur Generierung von Denkspuren, SFTSuite zu deren Organisation in Curricula und Microverse zur Erkundung neuer architektonischer Konfigurationen vor dem Start eines vollständigen Trainings. Das Bild ist also nicht das eines isolierten Fine-Tuners, sondern einer Wertschöpfungskette, von der Empero behauptet, sie von Anfang bis Ende zu kontrollieren.

Für das Hardware- und Software-Setup dieser Tests — AMD Ryzen 7700 Prozessor, 32 GB DDR5 RAM, AMD Radeon RX 9060 XT Grafikkarte mit 16 GB VRAM, LM Studio Runtime — verweise ich auf die erste Folge der Serie, die weiterhin die methodische Referenz für all jene bleibt, die erst jetzt einsteigen.

Was das neueste Destillat verspricht (und was nicht)

Laut der offiziellen Modellkarte (Model Card) entstand Qwen3.8-35B-A3B-Distill aus der Destillation der Qwen3.8-Frontier-Modelle in die Mixture-of-Experts-Architektur von Qwen3.6-35B-A3B, trainiert auf sorgfältig ausgewählten Spuren der Lehrermodelle, die Chain-of-Thought in Mathematik, Code, allgemeinem Schlussfolgern, Instruction Following und Tool Calling abdecken und vor dem Training nach Qualität gefiltert wurden. Die angegebenen Lehrermodelle sind zwei interne Varianten von Qwen3.8: eine auf 2,4 Billionen Tokens trainierte Version und eine weitere namens Flash Next. Jede Antwort beginnt mit einem Denkblock, der direkt aus den Spuren des Lehrers gelernt und nicht autonom vom Schüler generiert wurde: Das ist der Unterschied, den Empero selbst hervorhebt, zwischen dem Auswendiglernen der Züge eines Meisters und dem eigenen Improvisieren — ähnlich wie die Hauptfigur von Vagabond, dem Manga von Takehiko Inoue, der seinen Stil prägt, indem er von Schule zu Schule zieht, anstatt ihn aus dem Nichts zu erfinden.

Die Zahlen auf den Benchmarks müssen jedoch mit mehr Vorsicht gelesen werden, als die Pressemitteilung nahelegt. Im Vergleich zum Basismodell Qwen3.6-35B-A3B zeigt das Destillat von Empero einen praktisch unveränderten MMLU-Wert (0,838 gegenüber 0,834), eine Differenz, die die technische Dokumentation selbst innerhalb der statistischen Fehlermarge einordnet. Wo die Verbesserung am deutlichsten ist, ist beim ARC-Challenge (Anstieg von 0,548 auf 0,582) und beim ARC-Easy (Anstieg von 0,819 auf 0,830). Es ist ein realer, aber selektiver Gewinn, keine verallgemeinerte Überlegenheit: Die offene Frage ist, ob sich ein auf diese beiden Benchmarks konzentrierter Fortschritt in einen spürbaren Vorteil im täglichen Gebrauch übersetzt oder ob er auf diese spezifische Testreihe beschränkt bleibt. tabella1.jpg

Es sollte auch klargestellt werden, was in diesem Paket keine Erfindung von Empero ist. Die Mixture-of-Experts-Architektur stammt nicht von ihnen; die Destillation aus größeren Modellen ist eine mittlerweile in der gesamten Branche verbreitete Technik; und das GGUF-Format ist ein Standard des lokalen Ökosystems, der bereits von Dutzenden anderer Projekte genutzt wird. Was Empero als eigenständig beansprucht, ist daher keine einzelne Zutat, sondern die direkte Kontrolle über die gesamte Wertschöpfungskette, die sie kombiniert: von der Generierung von Spuren bis hin zu einer Post-Training-Technik namens FTPO, die entwickelt wurde, um unerwünschtes Verhalten wie Wiederholungsschleifen zu korrigieren, ohne ein vollständiges Retraining durchführen zu müssen. Ob dies ausreicht, um das Etikett „besonders“ zu rechtfertigen, bleibt berechtigterweise eine Frage, die jeder Leser für sich selbst beantworten kann.

Das Modell auf dem Prüfstand: Architektur und Gewichte

Die getestete Datei heißt Qwen3.8-35B-A3B-Distill, basiert auf dem Basismodell Qwen3.6-35B-A3B und ist unter der Apache-2.0-Lizenz veröffentlicht. Die Architektur ist hybrid: insgesamt vierzig Schichten, organisiert in zehn Zyklen, die aus drei Gated DeltaNet-Schichten (einer Form linearer Attention) gefolgt von einer vollen Attention-Schicht bestehen, also insgesamt zehn vollen Attention-Schichten von vierzig. Das Routing der Experten umfasst 256 geroutete Experten plus einen geteilten Experten, wobei acht Experten für jedes generierte Token aktiv sind. Es ist dieselbe partielle Orchestrierungslogik, die bereits im Bericht zu Qwen 3.6 beschrieben wurde, aber hier von Empero ausgehend von diesen Gewichten angewendet wird, um ein Off-Policy-SFT auf den Spuren des Lehrers Qwen3.8 durchzuführen — kein Training von Grund auf, sondern ein Modell, das destilliertes Wissen aus den Spuren eines viel größeren Lehrers in sich trägt.

Der Punkt, der wiederholt werden muss, da er leicht missverstanden werden kann, ist, dass sich die rund 3 Milliarden aktiven Parameter pro Token auf die Berechnung beziehen und nicht auf den Speicher. Die gesamte Datei mit ihren insgesamt 35 Milliarden Parametern muss dennoch vollständig in den RAM oder VRAM geladen werden, bevor die Inferenz beginnen kann. Die auf dem GGUF-Repository verfügbaren Quantisierungen reichen von 12,5 GB für IQ2_M bis zu 71 GB für die vollständige BF16-Version. tabella2.jpg

Für diesen Test habe ich die Version Q5KM (25,348 GB auf der Festplatte) gewählt, die laut Datenblatt mit etwa 32 GB VRAM oder 48 GB RAM für einen komfortablen Betrieb verwendet werden kann. Auf meiner Hardware — 16 GB VRAM und 32 GB DDR5 RAM — bedeutet dies notwendigerweise einen Kompromiss zwischen GPU und System, genau die Art von prekärer Balance, die bereits mit Qwen 3.6 erkundet wurde.

Installation und lokaler Betrieb

Die erforderliche Runtime muss auf dem neuesten Stand sein: eine neuere Version von llama.cpp, die die Qwen3.6-Architektur und die Gated DeltaNet MoE-Schichten unterstützt — eine Bedingung, auf die das GGUF-Repository explizit hinweist, da ältere Versionen das Modell einfach nicht laden können. LM Studio, Ollama, Jan und KoboldCpp werden als kompatibel angegeben. Wer noch nichts installiert hat, befolgt das in der ersten Folge der Serie beschriebene Verfahren: Download des Installers von lmstudio.ai, keine manuell zu konfigurierenden Abhängigkeiten und automatische Erkennung der verfügbaren Hardwarebeschleunigung.

Die vom Datenblatt empfohlenen Inferenzparameter sind Temperatur 0,6, Top-P 0,95 und Top-K 20, wobei der Denkblock im Chat-Template integriert ist (und in Endbenutzeranwendungen eventuell ausgeblendet werden kann). In meiner Konfiguration habe ich mit einem Kontext von 80.640 Tokens gearbeitet, weit unter den nativen 262.144, aber ausreichend für die Mehrheit der geplanten Tests, einem GPU-Offload von 22 Schichten von 41, 8 CPU-Threads von 8 verfügbaren, einer Evaluation Batch Size von 2048, einer Physical Batch Size von 512 und maximal 4 parallelen Vorhersagen. Es ist eine Konfiguration, die für eine realistische Nutzung auf Mittel- bis Oberklasse-Hardware ausgelegt ist, nicht um das allerletzte Token pro Sekunde herauszukitzeln.

Zehn Tests, eine Durchschnittsnote

Die Testreihe entspricht der der vorherigen Folgen, ergänzt um zwei Tests, die entwickelt wurden, um den agentischen und konversationellen Teil des Modells unter Druck zu setzen.

Zum Higgs-Mechanismus und dem elektroschwachen Symmetriebruch lieferte das Modell eine Erklärung in vier logischen Abschnitten, mit korrekten Formeln und besonderem Augenmerk darauf, warum das Photon masselos bleibt: Bewertung 5/5, bei 26,13 Tokens pro Sekunde.

Beim Multimodalitätstest — ein Bild schlechter Qualität, das ein Excel-Dashboard zeigt — las das Modell die Struktur und die Werte korrekt ab, erkannte saisonale Muster und den Unterschied zwischen 2017 und 2018 und machte konkrete Empfehlungen zum Rückgang im Monat Juni: Bewertung 5/5, bei 24,4 Tokens pro Sekunde.

Bei der Codegenerierung — ein NP-hartes Problem zur Suche des maximalen Zyklus in einem Graphen — schlug es drei komplementäre Ansätze vor: einen exakten mit Backtracking, einen angenäherten auf einem Spannbaum (Spanning Tree) und eine beschränkte Version als Kompromiss, mit sauberem und kommentiertem Code: Bewertung 5/5, bei 26,64 Tokens pro Sekunde (die höchste Geschwindigkeit aller Tests).

Bei der mehrsprachigen Planung — eine fünftägige Japan-Reise auf Französisch und Italienisch — war das Französisch flüssig, aber es traten zwei logistische Ungenauigkeiten auf (Shinjuku Gyoen mit einem Street-Food-Markt verwechselt, JR East statt JR Central für den Shinkansen): Bewertung 4,5/5, bei 23,38 Tokens pro Sekunde.

Beim langen Kontext — ein 460-seitiges PDF über das Wachstum der Videogenerierung — gab das Modell präzise die Seiten 126 und 127 an und zitierte spezifische Zahlen und die wichtigsten Modelle der Branche gleich beim ersten Versuch: Bewertung 5/5, bei 22,8 Tokens pro Sekunde.

Beim räumlichen Denken — ein Foto eines unordentlichen Zimmers — war die Antwort korrekt, aber oberflächlich, es fehlten Details zu den Farben und die Begründung der Aufräumstrategie war unklar: Bewertung 3,8/5, bei 21,24 Tokens pro Sekunde (der einzige echte Schwachpunkt der Testreihe).

Beim mehrstufigen Agenten — die Planung einer Webanwendung — erstellte es einen vollständigen Technologie-Stack, ein Datenbankschema in Prisma, eine Roadmap in sechs Sprints und einen eigenen Abschnitt zu Risiken und Milderungsmaßnahmen mit einer Wahrscheinlichkeits-Auswirkungs-Tabelle: Bewertung 5/5, bei 23,38 Tokens pro Sekunde.

Bei der langen Konversation über vier Runden behielt es die vollständige Kohärenz über alle vorherigen technischen Entscheidungen bei und schlug eine Architektur mit Socket.IO und Redis sowie eine Skalierungsstrategie für bis zu zehntausend Benutzer vor: Bewertung 5/5, mit einer durchschnittlichen Geschwindigkeit von etwa 22,8 Tokens pro Sekunde.

Beim dreijährigen strategischen Planer erarbeitete es einen Fünf-Semester-Plan mit Zielen, messbaren KPIs und der Zuweisung eines Budgets von zehn Millionen Dollar: Bewertung 5/5, bei 22,71 Tokens pro Sekunde.

Beim abstrakten Datenanalysten — ein Logikproblem mit drei widersprüchlichen Prämissen zur Formalisierung — erkannte es den Widerspruch und begründete die Wahl der zu korrigierenden Prämisse mit drei soliden Argumenten: Bewertung 5/5, bei 23,63 Tokens pro Sekunde. tabella3.jpg

Der Gesamtdurchschnitt liegt bei 4,83 von 5, bei einer durchschnittlichen Geschwindigkeit von etwa 23,7 Tokens pro Sekunde (der höchste bisher in der Serie gemessene Wert). Im Vergleich zu einem dichten Modell derselben Familie (dem Qwen3.8-27B, das bereits in einer vorherigen Folge getestet wurde) ist der Geschwindigkeitsunterschied beeindruckend, etwa vier- bis fünfmal schneller bei gefühlt gleichwertiger Antwortqualität. Das ist genau die Lücke, die MoE-Architekturen auf dem Papier versprechen und die sich hier in der Praxis zu bestätigen scheint. tabella4.jpg

Inwieweit hält das Versprechen in Q5

Um auf die Ausgangsfrage zurückzukommen: Wie viel von den vom Lehrermodell Qwen3.8 übertragenen Fähigkeiten bleibt tatsächlich verfügbar, wenn das Modell auf Q5KM komprimiert und mit 22 Schichten auf der GPU und dem Rest im System-RAM ausgeführt wird? Die zehn Tests legen nahe, dass der Großteil bestehen bleibt, mit einer klaren Ausnahme beim feinen visuell-räumlichen Denken und einem subtileren Riss bei der geografischen Präzision im mehrsprachigen Kontext. Aber um festzustellen, ob dies ausreicht, um das Modell als seinem Basismodell überlegen zu betrachten, mahnen die offiziellen Benchmarks zur Vorsicht: Der Gewinn ist auf ARC konzentriert, nicht verallgemeinert, und der MMLU-Wert bleibt praktisch identisch.

Dann gibt es eine breitere Frage bezüglich des Nutzers. Eine 25-GB-Datei, die 16 GB VRAM benötigt und gleichzeitig einen Großteil des System-RAMs auslastet, liegt in der Reichweite eines ambitionierten Enthusiasten, aber ist es realistisch, sie als Standard für jemanden vorzustellen, der nicht bereits in dedizierte Hardware investiert hat? Und bei der Wahl zwischen einer Cloud-API und einem lokalen Modell wie diesem: Welches Gewicht hat die Tatsache, dass die Daten die Maschine niemals verlassen — ein Argument, das Empero in den Mittelpunkt seines kommerziellen Angebots für europäische Unternehmen stellt? Das sind Fragen, die je nachdem, wer sie stellt, unterschiedliche Antworten erfordern, und das ist vielleicht der interessanteste Punkt des gesamten Empero-Experiments: nicht so sehr zu wissen, ob das Modell gewinnt oder sich seinem Vorgänger geschlagen gibt, sondern ob die gesamte Wertschöpfungskette, die sie verspricht — von der Destillation über das GGUF-Packaging bis hin zu Abacus als Alltags-Tool — es schafft, die lokale Nutzung zu einer praktikablen Wahl zu machen und nicht nur zu einer Übung für Enthusiasten mit einer leistungsstarken Grafikkarte zu Hause.

Technischer Hinweis: Alle Angaben zu Architektur, Quantisierungen und den in diesem Artikel zitierten Benchmarks stammen von den offiziellen Modellkarten auf Hugging Face und der Website von Empero, die im Text verlinkt sind. Die Bewertungen und Generierungsgeschwindigkeiten der zehn Tests sind persönliche Messungen, keine automatisierten Benchmark-Zertifizierungen, und sollten als solche gelesen werden.