Die Beobachtung

In der Programmvorschau des Veranstalters fand ich ein einziges Panel zu offenen Modellen. Es fragte, wie KI offen und wettbewerbsfähig bleibt, also nach Zugang und Marktmacht. Die Frage, wie man Modelle beaufsichtigt, die nach der Veröffentlichung niemand mehr kontrolliert, stand nicht im Programm, und ich hörte sie an beiden Tagen auf keiner Bühne. Ich habe nicht jede Sitzung besucht; die Aussage gilt für die Vorschau und für das, was ich gesehen habe.

Lägen offene Modelle weit zurück, wäre das eine Randnotiz. Sie liegen aber nur Monate zurück, und wer eine aktuelle Grafikkarte besitzt, kann das inzwischen nachprüfen.

Wie groß der Abstand noch ist

MessungStandAbstand zur Spitze
Epoch AI, Fähigkeitsindex über viele Benchmarks29. Mai 2026im Mittel vier Monate seit Januar 2026
UK AI Security Institute, Cyber-Aufgaben17. Juli 2026vier bis sieben Monate, 2025 noch sechs bis zehn

Die beiden Zahlen messen Verschiedenes und decken sich nicht. Epoch schreibt selbst, dass die Schätzung den Abstand eher unterschätzt, weil offene Modelle auf nicht öffentlichen Benchmarks schlechter abschneiden. Die Größenordnung hält trotzdem: Was heute nur hinter der Schnittstelle eines großen Anbieters läuft, liegt in einem halben Jahr als Datei vor. Das britische Institut maß an Fähigkeiten, die in der Sicherheitsdebatte als heikel gelten, und dort schrumpfte der Abstand binnen eines Jahres.

Was auf einer einzelnen Grafikkarte läuft

Im August 2026 veröffentlichte Alibaba die Gewichte von Qwen3.8-27B unter Apache-2.0-Lizenz, mit knapp 28 Milliarden Parametern und einem Kontextfenster von 262.144 Token. Artificial Analysis gab dem Modell Mitte August 52 Punkte im Intelligence Index. GPT-5.6 Luna erhielt in der höchsten Einstellung denselben Wert, und GLM-5.2 und DeepSeek V4 Pro lagen einen Punkt darüber, obwohl sie mit 753 Milliarden und 1,7 Billionen Parametern um ein Vielfaches schwerer sind. Der Index wurde seither umgestellt, sodass sich die absoluten Werte nicht mit heutigen vergleichen lassen; die Einordnung neben einem aktuellen geschlossenen Modell bleibt.

Das Modell läuft auf einer RTX 5090 mit 32 GB Grafikspeicher, einer Karte aus dem Einzelhandel. In der vierbittigen NVFP4-Fassung belegt es geladen rund 22 GiB, und der Rest reicht für ein Kontextfenster von 130.000 Token. Mit spekulativem Dekodieren schreibt es 84 bis 115 Token pro Sekunde.

GrößeWert auf einer RTX 5090
ModellQwen3.8-27B, NVFP4, unter vLLM
Geladenes Modell im Grafikspeicherrund 22 GiB, Karte mit 32 GB
Kontextfenster im Betrieb130.000 Token
Erzeugen, eine Anfrage84 bis 115 Token pro Sekunde
Erzeugen ohne spekulatives Dekodieren23,7 Token pro Sekunde

Das Modell wird auch genutzt. Hugging Face zählt für Qwen3.8-27B knapp sieben Millionen Downloads in den letzten 30 Tagen und gut 14 Millionen seit der Veröffentlichung Anfang August. Ein Download ist kein Nutzer, denn auch automatische Abrufe zählen mit. Die Größenordnung zeigt trotzdem, dass das Modell auf vielen Rechnern liegt, von denen keiner bei einer Aufsichtsbehörde gemeldet ist.

Auf einer solchen Karte trieb das Modell unseren Coding-Agenten an, der eine Stunde lang an seinem eigenen Quelltext arbeitete. In 16 Durchgängen lieferte er 13 Änderungen, die ihre Tests bestanden, änderte zweimal nichts, und eine Änderung wiesen die Tests zurück. Keine Anfrage verließ dabei das eigene Netz.

Alibaba teilte am 22. September auf seiner Hausmesse mit, dass Qwen 4 im Training ist. Ein Erscheinungsdatum gibt es nicht, und das Unternehmen hat nicht zugesagt, dass die nächste Generation wieder ein offenes Modell dieser Größe mitbringt. Für Qwen 4.5 und Qwen 5 nennt es fünf bis zehn Billionen Parameter als Ziel. Wer die Entwicklung der letzten beiden Jahre fortschreibt, muss damit rechnen, dass die nächste Generation auf derselben Grafikkarte einen weiteren Teil dessen leistet, was heute den Spitzenmodellen vorbehalten ist.

Warum die Regeln nicht greifen

Der europäische AI Act knüpft seine Pflichten für Modelle an den Anbieter. Für offene Modelle macht er eine Ausnahme: Wer Gewichte, Architektur und Nutzungsinformationen unter einer freien Lizenz veröffentlicht, muss weder die technische Dokumentation für Behörden führen noch nachgelagerte Anbieter informieren noch einen Vertreter in der EU benennen. Ein Anbieter aus Hangzhou, der ein Modell wie Qwen3.8-27B unter freier Lizenz veröffentlicht, muss in der EU also keinen Bevollmächtigten benennen, an den sich eine Behörde wenden könnte. Die Ausnahme endet bei Modellen mit systemischem Risiko, die das Gesetz ab einem Trainingsaufwand von 1025 Rechenoperationen vermutet. Urheberrechtsstrategie und Zusammenfassung der Trainingsdaten bleiben in jedem Fall Pflicht.

Die Ausnahme ist für sich genommen vernünftig, und die Lücke entsteht einen Schritt später. Ein offenes Modell lässt sich nach der Veröffentlichung nicht zurückrufen, und seine eingebauten Schutzmechanismen überstehen nach Stephen Casper (FAR.AI, November 2025) wenige Dutzend, bestenfalls ein paar hundert Schritte gezielten Nachtrainierens. Wer ein Modell so verändert, wird nach den Leitlinien der Kommission erst dann selbst zum Anbieter, wenn er mehr als ein Drittel des ursprünglichen Trainingsaufwands einsetzt. Schutzmechanismen zu entfernen kostet einen winzigen Bruchteil davon. Der ursprüngliche Anbieter hat seine Pflichten erfüllt, der Bearbeiter hat keine, und das Ergebnis läuft auf einer Grafikkarte, die keine Behörde kennt.

Kalifornien regelt es ähnlich. Das Gesetz für Frontier-Modelle, SB 53, erfasst Entwickler erst ab einem Trainingsaufwand von 1026 Rechenoperationen und knüpft die strengeren Pflichten an mehr als 500 Millionen Dollar Jahresumsatz. Auch dort richtet sich die Aufsicht nach der Größe des Unternehmens, das trainiert, und nicht nach dem, was mit den Gewichten nach der Veröffentlichung geschieht.

Die Aufsicht erreicht also die Modelle, die hinter einer Schnittstelle bleiben, und hat für frei verfügbare Gewichte keinen Adressaten. Solange diese Jahre zurücklagen, ließ sich das hinnehmen. Bei vier bis sieben Monaten verschiebt die Regulierung der großen Anbieter ein Risiko nur um diese Frist.

Kein Plädoyer für ein Verbot

Wir arbeiten selbst mit offenen Modellen. Unser Coding-Agent läuft auch auf Qwen3.8, TippelPi beantwortet Fragen zu Firmendokumenten mit einem kleineren Qwen-Modell auf einem Raspberry Pi, und unsere Prüfschicht für Sentinel-Regeln läuft auf Wunsch vollständig gegen ein lokal betriebenes Modell. Vielen Unternehmen bleibt nur dieser Weg, um Daten im eigenen Netz zu halten. Offene Modelle streuen außerdem Fähigkeiten, die sonst bei wenigen Firmen lägen, und ermöglichen Sicherheitsforschung, die sonst an einer Schnittstelle endet.

Deshalb stört mich das Schweigen. Wer offene Modelle für wertvoll hält, sollte am lautesten fragen, wie man mit ihren Risiken umgeht, bevor andere das mit gröberen Mitteln tun.

Vier Fragen, die auf eine Bühne gehören

  • Woran knüpfen Pflichten an? An die Form der Verbreitung oder an die gemessene Fähigkeit eines Modells, unabhängig davon, ob es offen oder geschlossen ist?
  • Wer verantwortet abgeleitete Modelle? Eine Schwelle, die an Rechenaufwand hängt, erfasst das billige Entfernen von Schutzmechanismen nicht.
  • Wer prüft ein Modell, für das kein Anbieter einsteht? Unabhängige Messungen wie die des britischen Instituts sind bisher die Ausnahme.
  • Was folgt für den Betreiber? Wenn der Anbieter als Adressat ausfällt, wandert die Verantwortung zu dem, der das Modell einsetzt.

Was das für Unternehmen heißt

Die letzte Frage lässt sich schon heute beantworten. Wer ein offenes Modell betreibt, kann sich auf keine Sicherheitszusage eines Anbieters stützen. Er braucht sie nicht, wenn das System um das Modell die Sicherheit trägt: mit einer eigenen Auswertung auf den eigenen Aufgaben vor dem Einsatz, Rechten und Schranken außerhalb des Modells, einem Protokoll jedes Laufs und einer Prüfung, die entscheidet, ob ein Ergebnis gilt. Ein geschlossenes Modell verlangt dieselbe Arbeit; beim offenen erweckt nur kein Anbieter den Anschein, sie zu übernehmen. Wie nötig sie ist, zeigte uns Qwen3.8-27B. Das Modell schrieb eine Erkennungsregel für Microsoft Sentinel, die Microsofts Parser, die Spaltenprüfung und alle Hausregeln bestand und trotzdem nie einen Vorfall gemeldet hätte, weil sie mit Ticks rechnete, als wären es Sekunden. Eine deterministische Prüfung fand den Fehler, kein zweites Modell. Die Seite zur Prüfschicht beschreibt den Fall, und unser Artikel über den sicheren Betrieb von Coding-Agenten beschreibt die Rechteschicht eines Agenten.

Grenzen dieses Textes

Die Abstandsmessungen unterscheiden sich je nach Aufgabe und Methode, und keine deckt alle Fähigkeiten ab. Unsere eigenen Zahlen stammen von einem Rechner, einem Modell und einer Aufgabe; sie zeigen, was möglich ist, und sind kein Vergleichstest. Der Ausblick auf die nächste Modellgeneration ist eine Fortschreibung, keine Ankündigung eines Herstellers. Die Darstellung des AI Act folgt den veröffentlichten Leitlinien der Kommission und ersetzt keine Rechtsberatung. Ich weiß nicht, was auf Bühnen gesagt wurde, die ich nicht besucht habe.

Quellen

  • Epoch AI, „Open models lag state-of-the-art closed models by 4 months“ (29. Mai 2026), epoch.ai
  • UK AI Security Institute, „How far behind the frontier are leading open weight models on cyber?“, 17. Juli 2026, aisi.gov.uk
  • Qwen3.8-27B, Modellkarte und Downloadzahlen (abgerufen am 10. Oktober 2026), huggingface.co
  • Simon Willison, „Qwen 3.8 27B scores 52 on the Artificial Analysis Intelligence Index“, 17. August 2026, simonwillison.net
  • Reuters-Bericht zur Apsara Conference vom 22. September 2026 (Qwen 4 im Training), khaleejtimes.com
  • Future of Privacy Forum, „California’s SB 53: The First Frontier AI Law, Explained“, fpf.org
  • Europäische Kommission, Fragen und Antworten zu den Leitlinien für Anbieter von KI-Modellen mit allgemeinem Verwendungszweck, digital-strategy.ec.europa.eu
  • Stephen Casper, Vortrag „Powerful Open-Weight AI Models“, FAR.AI, 30. November 2025, far.ai
  • World Summit AI 2026, Programmvorschau vom 2. Juli 2026, worldsummit.ai