Qwen 3.8 Start: Claude Opus 5 Niveau für 6 Dollar
Alibaba hat mit Qwen3.8-Max ein neues KI-Modell mit 2,4 Billionen Parametern veröffentlicht. Das System kann komplexe Softwareprojekte und reale Arbeitsabläufe über mehrere Wochen hinweg völlig autonom steuern. In unabhängigen Benchmarks erreicht es das Niveau von Spitzenmodellen wie Claude Opus, ist dabei aber deutlich günstiger.
Die Modellgewichte werden in Kürze als Open Source für die Allgemeinheit bereitgestellt. Qwen Blog - Qwen3.8-Max: A New Bar for Coding and Cowork QwenCloud - Qwen3.8-Max Overview Das neue KI-Modell Qwen3.8-Max arbeitet nicht mehr nur auf Zuruf, sondern bearbeitet über Wochen hinweg komplette Softwareprojekte. Mit 2,4 Billionen Parametern erreicht es ein Leistungsniveau, das sich in unabhängigen Rankings direkt mit der Branchenspitze misst.
Unabhängige Ergebnisse der Spitzenklasse Ein Blick auf die aktuellen Daten der unabhängigen Plattform ArenaAI zeigt ein sehr erfreuliches Bild. Im Bereich der Text-basierten Aufgaben belegt Qwen3.8-Max den fünften Platz und positioniert sich damit nur knapp hinter Modellen wie Claude Fable 5. + Quelle: Arena.ai Im spezialisierten Code-Arena-Ranking für die Webentwicklung klettert das Modell auf den vierten Rang. Hier agiert es auf einem Niveau mit Claude Opus 5 high und Kimi k3. + Quelle: Arena.ai Ein wichtiger Faktor für den produktiven Einsatz ist die Preisstruktur.
Mit zwei US-Dollar für eine Million Eingabetoken und sechs US-Dollar für Ausgabetoken ruft der Anbieter Preise auf, die weit unter denen der direkten Konkurrenz liegen. Anzeige Durchgehend gute Ergebnisse Bei Humanity’s Last Exam, einem aktuellen Test für extrem schwieriges Expertenwissen über viele Fachgebiete hinweg, erzielt Qwen 3.8 Max 43,6 Punkte. Dieser Wert gilt als guter Indikator, um Frontier-Modelle bei komplexen Wissensproblemen voneinander abzugrenzen.
Für professionelle Workflows und die Automatisierung strukturierter Texte ist die exakte Einhaltung von Anweisungen und Ausgabevorgaben entscheidend. Diese Fähigkeit prüft der IFBench, in dem das Modell starke 82,8 Punkte erreicht. + Quelle: Alibaba Geht es darum, über mehrere Schritte hinweg eine Konsole zu bedienen und Entwicklungsaufgaben eigenständig zu lösen, bewertet das der Terminal-Bench 2.1. In dieser Disziplin setzt sich Qwen3.8-Max mit 86,6 Punkten an die Spitze. + Quelle: Alibaba 16 Tage ununterbrochene Programmierarbeit Die Basis für diese Ergebnisse bildet eine Architektur mit 2,4 Billionen Parametern, von denen 95 Milliarden aktiv arbeiten.
Durch diese Skalierung kann das Modell Agenten steuern, die über lange Zeiträume hinweg ohne menschliche Eingriffe operieren. In einem Testdurchlauf programmierte Qwen3.8-Max das Projekt »oh-my-cli« komplett von Grund auf. Es sammelte echtes Nutzer-Feedback, wandelte die Anforderungen in Tickets um und arbeitete sie nacheinander ab.
Nach 16 Tagen autonomer Laufzeit standen 265 Commits, 127 Pull Requests und 151 gelöste Tickets in der Projekthistorie. Twitter Beitrag - Cookies links unten aktivieren. 16 days autonomous coding pic.twitter.com/OX0RN7itxP — Qwen (@Alibaba_Qwen) August 3, 2026 Komplexe Arbeitsabläufe in der Praxis Qwen3.8-Max ist nicht auf das reine Schreiben von Code beschränkt, sondern zielt auf reale Arbeitsabläufe ab.
Im CoWorkBench erreicht es 74,8 Punkte und schneidet damit besser ab als GPT-5.6 Sol. + Quelle: Alibaba So berechnete das Modell aus einfachen Bauplänen das seismische Strukturmodell eines 30-stöckigen Büroturms direkt im Browser. Im regulären Arbeitsalltag erfordert eine solche Aufgabe oft eine Arbeitswoche in spezialisierter Software. Für das Design einer Finanz-App erstellte Qwen3.8-Max auf Anhieb einen interaktiven, funktionsfähigen Prototyp mit acht zusammenhängenden Bildschirmen.
Auch beim Hardware-Design plant das Modell über lange Zeiträume voraus. Qwen3.8-Max optimierte einen kryptografischen Hardware-Beschleuniger völlig autonom. Innerhalb von 500 Interaktionsrunden überarbeitete es den Algorithmus so weitreichend, dass die Anzahl der benötigten Logikgatter von anfangs 8.298 auf schlanke 678 sank.
Twitter Beitrag - Cookies links unten aktivieren. Cowork: Any role, build beyond pic.twitter.com/Hggkj3DFSs — Qwen (@Alibaba_Qwen) August 3, 2026 Visuelles Verständnis für Desktop-Aufgaben Die multimodalen Fähigkeiten untermauert Qwen3.8-Max mit 82,3 Punkten im MMMU-Pro-Benchmark, der das visuelle Denkvermögen prüft. + Quelle: Alibaba Dieses visuelle Verständnis setzt das Modell aktiv für die Bedienung von grafischen Desktop-Oberflächen ein. Beim OSWorld-Verified-Benchmark müssen KI-Agenten komplexe Desktop-Aufgaben in einer kontrollierten Umgebung abschließen.
Qwen3.8-Max sichert sich in diesem Test mit 86,1 Punkten den Spitzenplatz, knapp vor Modellen wie GPT-5.6 Sol und Claude Opus 5. Qwen3.8-Max ist über die eigene Plattform und QwenCloud nutzbar. Die offengelegten Modellgewichte werden in der kommenden Woche bereitgestellt.
Anzeige