Freebuff: Der kostenlose Coding-Agent mit Werbung

In unserem Beitrag zum Vergleich von Open-Source-Coding-Agenten hatten wir unter anderem über OpenCode und Pi Agent berichtet – zwei kostenlose Werkzeuge, die keinen Login verlangen und die Kreditkarte unberührt lassen. Die offen gebliebene Frage betraf die Frontier-Modelle, jene also, deren Bereitstellung wirklich teuer ist. Kann man einen kostenlosen Coding-Agenten ohne strenge Limits anbieten und dabei dieselben Modelle nutzen, die Produkte antreiben, die Hunderte von Euro im Jahr kosten? Freebuff versucht, diese Frage mit Ja zu beantworten – mit einer Wette, die bis vor Kurzem selbst in der Welt der Entwicklerwerkzeuge skurril gewirkt hätte, die bekanntlich allergisch auf jede Form von Werbung reagiert: die Rechnungen mit Textanzeigen zu bezahlen, die zwischen den Zügen des Agenten eingeschoben werden.
Ein anderes Modell
Freebuff ist das Produkt von CodebuffAI, einem Team, das Y Combinator (Batch F24) durchlaufen hat und von James Grugett geleitet wird, dem ehemaligen Gründer von Manifold Markets. Das Projekt gliedert sich in fünf Produkte: Desktop, CLI, Web, Cloud und Chat, die alle auf Codebuff aufbauen, dem quelloffenen Multi-Agenten-Framework (Apache 2.0-Lizenz), von dem Freebuff seine Architektur erbt. Die beiden Slogans, die den Start begleiten, „we make coding 100% free“ und „it's free because it should be“, sind nicht nur Marketing: In den ersten Wochen nach dem Debüt im August 2026 hat das Produkt die Marke von 230.000 Entwicklern überschritten, wie Carbon Ads selbst im Profil berichtet, das seinem ungewöhnlichsten Publisher gewidmet ist.
Der ökonomische Mechanismus ist ebenso einfach wie ungewöhnlich für die Branche. Zwischen den Zügen des Agenten – niemals innerhalb des generierten Codes, niemals als invasives Pop-up – erscheinen Textanzeigen im Stil von Carbon Ads, dem 2010 gegründeten Werbenetzwerk, das auf technisches Publikum spezialisiert ist. Die Werbung ist kontextbezogen und nicht verhaltensbasiert, ganz im Sinne des historischen Modells von Carbon: Wenn Sie ein Backend schreiben, ist es wahrscheinlicher, eine Anzeige für eine Vektordatenbank zu sehen als für ein Marketing-Automatisierungstool, ohne dass dies die Erstellung eines individuellen Entwicklerprofils beinhaltet. Die grundlegende Überlegung, wie sie in den Materialien von CodebuffAI dargestellt wird, lautet, dass die Kosten für Sprachmodelle, die Code schreiben können, sehr viel schneller gesunken sind als der Preis der Werkzeuge, die sie verpacken. Die Abonnements der Konkurrenten bestätigen dies: OpenCode, das kostenlose Modelle anbietet, beginnt beim kostenpflichtigen Tarif bei 120 Dollar pro Jahr, während Cursor, Claude Code und Devin in den Basistarifen alle bei rund 240 Dollar pro Jahr liegen, wobei die Premium-Stufen noch weit darüber hinausgehen. Freebuff kostet null, und für diejenigen, die wirklich keine Werbung sehen wollen, bleibt dennoch ein kostenpflichtiger Ausweg – Codebuff Pro mit Tarifen für 100, 200 oder 500 Dollar pro Monat, die eher für Teams und intensive Nutzung als für den gelegentlichen Entwickler gedacht sind.
Im Inneren von Freebuff
Die Architektur vertraut nicht alles einem einzigen monolithischen Modell an, sondern koordiniert spezialisierte Agenten: einen File Picker Agent, der die Codebasis erkundet, einen Planner Agent, der entscheidet, was in welcher Reihenfolge geändert werden soll, einen Editor Agent, der die Änderungen schreibt, und einen Reviewer Agent, der sie validiert. Es ist dasselbe Schema wie bei Codebuff, das in seinen internen Benchmarks angibt, Claude Code bei über 175 realen Programmieraufgaben auf quelloffenen Repositories mit 61 % zu 53 % zu schlagen. Das sind parteiische Zahlen, das muss ohne Umschweife gesagt werden, die vom selben Team stammen, das das Produkt verkauft, aber sie geben dennoch ein Gefühl dafür, wie zentral der Multi-Agenten-Ansatz im Angebot ist.
Der Modellkatalog umfasst zum Zeitpunkt der Erstellung dieses Artikels GLM 5.3 Flash für tiefes Schlussfolgern, DeepSeek V4 Flash 07/31 für schnelles Schreiben und Tool-Nutzung, GPT-5.6 Luna und MiMo 2.5 mit Bildunterstützung, Solar Pro 4 mit einem Kontextfenster von 524.000 Token (jedoch nur für einen begrenzten Testzeitraum verfügbar) sowie Muse Spark 1.2, das agentische Modell von Meta mit einem Kontextfenster von einer Million Token, das von der gesamten Nutzerbasis geteilt wird und daher in Zeiten hohen Verkehrsaufkommens Wartezeiten unterliegt. Der Zugang folgt zwei parallelen Systemen: dem historischen sitzungsbasierten System – sechs Blöcke von je einer Stunde pro Tag, die durch Empfehlungen und Bounties erweitert werden können – und dem neueren System auf Basis von Freebucks, bei dem jede Stunde ein kleines Budget generiert wird, das im Verhältnis zu den Kosten des gewählten Modells verbraucht wird. GLM 5.3 Flash, DeepSeek V4 Flash, MiMo 2.5 und Solar Pro 4 bleiben für Nutzer mit Vollzugriff unbegrenzt; dieser ist in den USA, Kanada, Großbritannien, der EU und weiteren ausgewählten Ländern garantiert. Andernorts oder hinter einem VPN reduziert sich der Zugang auf eine Untermenge von Modellen.
Im täglichen Einsatz über die CLI, installierbar mit npm install -g freebuff, erinnert die Logik stark an OpenCode und Pi Agent: Man startet den Befehl im Projektordner und beschreibt, was benötigt wird. Eine betriebliche Besonderheit verdient Erwähnung, da sie nicht offensichtlich ist: Die zeitgesteuerte Sitzung beginnt mit ihrer Erstellung, nicht beim Senden des ersten Prompts; sie zu öffnen und inaktiv zu lassen, verbraucht also dennoch Minuten. Nach Ablauf der Zeit wird die Eingabe gesperrt, aber der Agent arbeitet im Hintergrund weiter, bis die laufende Aufgabe abgeschlossen ist. Der Befehl /history ermöglicht es, den bereits aufgebauten Kontext in einer späteren Sitzung wiederzuerlangen, sodass die Vorbereitungsarbeit nicht verloren geht. Alles bleibt in lokalen Dateien, sodass nichts wirklich verloren geht, und das Tool rührt Remote-Repositories nicht an, es sei denn, es wird explizit dazu aufgefordert. Beim Datenschutz erklärt CodebuffAI, dass Daten nur dann zum Trainieren von Modellen verwendet werden, wenn eine Funktion dies explizit anzeigt, dass Prompts und Nachrichten zur Personalisierung von Anzeigen analysiert werden können, dass separat hochgeladene Dateien und verbundene Repositories nicht an Werbekunden weitergegeben werden und dass nur eine begrenzte Anzahl von Partnern Cloud-Repositories oder Code auswerten darf, der Modellen zugeordnet ist, die als für das KI-Training nutzbar gekennzeichnet sind.

GLM 5.3 Flash, der Fall Ox Alpha
Das Modell, das wir für unseren Test ausgewählt haben, ist GLM 5.3 Flash, und seine jüngste Geschichte ist erzählenswert, weil sie etwas darüber aussagt, wie sich Open-Weight-Modelle heute durchsetzen. Am 20. August 2026 erschien ein Modell ohne Namen und ohne angegebenes Unternehmen auf OpenRouter und OpenCode mit einem Kontextfenster von einer Million Token. Innerhalb weniger Tage tauften Entwickler es Ox Alpha und stellten es bei realen Aufgaben auf die Probe – von Pull-Request-Audits bis hin zu Multi-Agenten-Workflows. In drei Tagen verarbeitete es allein auf OpenRouter über 11 Billionen Token – der gewaltigste Start, den die Plattform jemals aufgezeichnet hat – und beendete die 56 Tage währende Herrschaft von DeepSeek an der Spitze der OpenCode-Ranglisten. Am 26. August bestätigte Zhipu AI (das international unter der Marke Z.ai auftritt), dass Ox Alpha in Wirklichkeit GLM 5.3 Flash war, und veröffentlichte gleichzeitig die Gewichte auf Hugging Face unter MIT-Lizenz. Patrick Collison, Mitgründer von Stripe (das genau am Tag zuvor der Übernahme von OpenRouter zugestimmt hatte), kommentierte die Geschehnisse als „sehr beeindruckend“.
Technisch handelt es sich um ein Mixture-of-Experts-Modell mit insgesamt 320 Milliarden Parametern, von denen jedoch nur 18 Milliarden pro Inferenz aktiv sind. Es ist das erste nativ multimodale Modell der GLM-5-Familie, das Text, Bilder, Video und Dateien akzeptieren kann. Die hybride Architektur, die lineare und dünnbesetzte Attention kombiniert, reduziert den Rechenaufwand für die Attention um das etwa Dreifache und den KV-Cache um das mehr als Vierfache im Vergleich zum größeren Bruder GLM-5.3, was es ermöglicht, das Kontextfenster von einer Million Token aufrechtzuerhalten, ohne die Bereitstellungskosten explodieren zu lassen. Das Training erfolgte auf 30 Billionen multimodalen Token. Bei den Benchmarks weist Artificial Analysis GLM 5.3 Flash einen Wert von 57 auf dem Intelligence Index zu, verglichen mit 60 beim größeren Modell GLM-5.3, jedoch zu Kosten pro Aufgabe von etwa 0,09 Dollar gegenüber 0,68 Dollar – rund ein Siebtel. Auf Terminal-Bench 2.1, dem relevantesten Benchmark für einen Coding-Agenten, liegt der Wert bei 84.3, und auf DeepSWE v1.1 erreicht er 63.4. Zhipu erklärte zudem, dass die gesamte Woche des Stealth-Trafiks von Ox Alpha – insgesamt über 62 Billionen Token – auf einem Cluster von rund 100.000 in China produzierten KI-Chips bedient wurde, ohne dass Nvidia-Hardware beteiligt war. Diese Erklärung ließ die Aktien von Zhipu in Hongkong um über 12 % steigen und verringert, sollte sie sich im Produktionsmaßstab bestätigen, einen Teil des Infrastrukturvorteils, den US-Exportkontrollen zu schützen versuchen.
AlboUp, der Praxistest
Um zu verstehen, was das alles in der Praxis bedeutet, haben wir mit Freebuff und GLM 5.3 Flash eine echte Anwendung gebaut: AlboUp – eine Web-App, um das amtliche Mitteilungsblatt (Albo Pretorio) der Gemeinde Verbania einfacher zu lesen als über das behördliche Portal. Es ist das dritte Kapitel einer persönlichen Suite lokaler „*Up“-Apps für meine Region, inspiriert von den früheren Projekten BenzUp und JobUp, geschrieben in reinem HTML, CSS und JavaScript ohne Abhängigkeiten.
Die App zeigt eine sofortige Liste der Dokumente mit Typ, zusammenfassendem Betreff, Nummer, Datum, Anhängen und einer Kennzeichnung für neue Dokumente, mit einer Detailansicht, die zur offiziellen Seite verlinkt. Es gibt drei Bereiche – In Veröffentlichung, Archiv und Eheschließungen – mit Suche im gesamten Archiv, Schnellfiltern nach Dokumententyp, progressivem Laden in 50er-Seiten, hellem und dunklem Design, lokalem Cache und direktem Link zu jedem einzelnen Dokument. Es ist auch eine installierbare PWA mit Manifest, Icon und animiertem Splash-Screen.
Der interessante Teil für alle, die mit diesen Werkzeugen arbeiten, liegt in den technischen Herausforderungen entlang des Weges, weil sie das wahre Niveau des Modells offenbaren. Das Gemeindortal, das auf Liferay mit dem jCityGov-Portlet aufbaut, stellt weder APIs noch CORS-Header bereit; die vom Agenten gefundene Lösung führte daher über den öffentlichen Proxy r.jina.ai mit einem Ausweichmechanismus (Fallback) und einem Reserve-Markdown-Parser für den Fall, dass der Dienst nicht antwortet – Endpunkt für Endpunkt ohne Sitzung oder Cookies überprüft und durch Tests mit realen Daten abgedeckt. Ein weiteres nicht triviales Detail betrifft digital signierte Anhänge im .p7m-Format, die zusammen mit normalen PDFs verarbeitet werden, sowie die Entscheidung, den Veröffentlichungszeitraum des Dokuments als Referenzdatum zu verwenden statt der im Text erscheinenden Daten, die oft irreführend sind. Das Deployment ist statisch, ausgelegt für Netlify, GitHub Pages oder Cloudflare Pages, mit einer Testsuite, die einen Offline-parser.test.js von einem e2e.test.js trennt, der das Online-Verhalten überprüft, wobei der konkreteste Engpass das Rate-Limit von r.jina.ai bleibt, gemildert durch den lokalen Cache.
Zeitmäßig lag der erste im Wesentlichen funktionierende Entwurf nach einer Stunde und zwanzig Minuten vor, gefolgt von etwa einer Stunde, verteilt auf mehrere Sitzungen, um Details nach persönlichen Vorlieben zu verfeinern. Der stärkste Eindruck, hinausgehend über die reine Geschwindigkeit, war der eines Modells, das systematisch Alternativen erkundet, bevor es auswählt, und dann ohne übermäßige Zögerlichkeit ausführt – ein Verhalten, das weniger an einen reaktiven Codegenerator erinnert als an einen Kollegen, der das Problem erst versteht und dann löst, mit der Sparsamkeit an Gesten eines unabhängigen Leveldesigners, der jeden Winkel seiner Karte kennt, noch bevor er sie zeichnet.

Kann Werbung das Coden tragen?
Die Grundwette von Freebuff lautet, dass die Aufmerksamkeit von Entwicklern für die richtigen Werbekunden wertvoll genug ist, um ein kostenloses Produkt langfristig zu finanzieren. Es ist eine These, die auf zwei konkreten Pfeilern ruht: immer fähigere und immer günstiger bereitzustellende Open-Weight-Modelle, wie die Geschichte von GLM 5.3 Flash zeigt, und ein Nischenwerbenetzwerk wie Carbon Ads, das seit Jahren mit dieser Art von Publikum arbeitet, ohne auf Cookies oder Verhaltensprofilierung zurückzugreifen. Im dritten Quartal 2026 sind die drei Kommandozeilen-Agenten mit den meisten Nutzern alle kostenlos – ein Signal dafür, dass sich der Markt unabhängig von einem einzelnen Produkt in diese Richtung bewegt. Das offensichtlichste Risiko ist die Abhängigkeit vom Werbemarkt, der von Region zu Region erheblich schwanken kann, woraus sich genau die zwei Zugangsmodi – voll und begrenzt – ergeben, die Freebuff heute kennzeichnen.
Aus einem anderen Blickwinkel betrachtet, schlägt Freebuff einen dritten Weg gegenüber den zwei bereits bekannten Optionen vor: nicht Self-Hosting, das technische Fähigkeiten und Hardware erfordert, die nicht jedem zur Verfügung stehen, und nicht kostenpflichtiger API-Zugang, der ein eigenes Budget verlangt. Werbung erfordert in diesem Schema weder Infrastruktur noch direkte Ausgaben vom Endnutzer und demokratisiert theoretisch den Zugang zu werkzeuggestützter Entwicklung mit Frontier-Modellen. Für Entwickler bedeutet dies eine echte kostenlose Option im Austausch für einen expliziten Kompromiss bei Werbung und Datennutzung zur Anzeigenpersonalisierung – ein Kompromiss, den jeder je nach dem Wert, den er seiner Aufmerksamkeit beim Schreiben von Code beimisst, unterschiedlich bewerten kann. Für Branchenbeobachter ist es eine Fallstudie darüber, wie Werbung Werkzeuge finanzieren kann, die für ein technisches Publikum bestimmt sind, das historisch gesehen am allergischsten auf jede Form von Werbung reagiert.
Fazit
Unsere Erfahrung mit AlboUp zeigt, dass das Experiment zumindest in seiner Anfangsphase funktioniert: ein kostenloses Frontier-Modell, das genutzt wurde, um in insgesamt zwei Stunden eine echte Anwendung zu bauen. GLM 5.3 Flash erweist sich als fähiges Modell zu nahezu vernachlässigbaren Bereitstellungskosten, und die Kombination mit der Infrastruktur von Freebuff macht all dies ohne Kreditkarte zugänglich. Es bleiben jedoch mehr offene Fragen als Gewissheiten. Wie nachhaltig ist ein Modell auf Dauer, das die Qualität des kostenlosen Produkts an den Werbeinvestitionszyklus im Tech-Sektor bindet, der historisch volatil ist? Was passiert, wenn die Inferenzkosten von Frontier-Modellen aufhören, im aktuellen Tempo zu sinken, oder wenn der Wettbewerb zwischen Nischenwerbenetzwerken enger wird? Und vor allem: Wird der begrenzte Zugangsmodus für ganze geografische Regionen ein vorübergehender Kompromiss bleiben oder zu einer strukturellen Bruchlinie zwischen denjenigen werden, die vollen Zugang zu unterstützten Entwicklungswerkzeugen haben, und denjenigen, die ihn nicht haben? Das sind keine rhetorischen Fragen, und die Antwort wird sich erst zeigen, wenn man beobachtet, was in den kommenden Quartalen mit Freebuff – und jenen, die versuchen werden, es nachzuahmen – geschieht.