← Lab Lab · 01

Ein Agent, der Code liest, ändert und ausführt

Ein Agent mit Shell-Zugriff braucht Schutz, der nicht vom Modell abhängt. Bei diesem stehen Rechte, Sandbox und Rückgängig als Code zwischen Modell und Betriebssystem.

Der Agent arbeitet in einer Schleife aus Lesen, Bearbeiten und Ausführen. Jeden Schritt begrenzen drei Mechanismen: eine Rechte-Engine, die in fester Reihenfolge verbietet, nachfragt oder erlaubt, eine Sandbox für jeden Shell-Befehl und ein Schnappschuss vor jeder Änderung.

Er läuft über Cloud-Modelle ebenso wie über ein offenes Modell auf dem eigenen GPU-Server. Im lokalen Betrieb geht keine Anfrage an einen Modellanbieter, sodass er auch an hochsensiblem Quelltext und vertraulichen Daten arbeiten kann. In einem einstündigen Lauf am eigenen Quelltext gingen alle Anfragen an die eigene Grafikkarte, und das Kostenjournal wies null aus. Der Lauf im Einzelnen →

  • Im Einsatzintern, unter anderem beim Bau von TippelPi
  • Tests2.839 bestanden, 22 übersprungen
  • Laufzeit der Suite3 min 32 s, ohne Modellaufruf
  • SandboxSeatbelt · bubblewrap · Docker
  • Lokaler BetriebQwen3.8-27B · vLLM · eine RTX 5090
  • Stand9. Oktober 2026
Grenzen

Die Suite läuft ohne Modellaufruf. Sie prüft den Code zwischen Modell und Betriebssystem, also Rechte, Sandbox und Rückgängig, und sagt nichts über die Qualität einzelner Modellantworten. Die Sandbox-Backends bubblewrap (Linux) und Docker sind noch nicht im Dauerbetrieb erprobt, und ein Tracing über verschachtelte Agentenläufe fehlt.

In Kundenprojekten: Agentische Systeme →

tippel_codepytest
$ python -m pytest -q
2839 passed, 22 skipped, 1 warning in 211.62s (0:03:31)

Aus leerem Projekt: ein CSV-Explorer

Ein Auftrag, kein Vorgabecode. Der Agent baut ein Werkzeug, das vollständig im Browser läuft: Datei ablegen, Tabelle sortieren und filtern, jede Spalte mit Kennzahlen und Diagramm, Export. Zerlegung und Statistik liegen in getesteten Modulen. Am Ende führt die Aufnahme durch das Werkzeug: sortieren, zwei Filter stapeln, die gefilterten Zeilen exportieren, eine eigene Datei laden. Jeder Schritt ist ein echter Klick und wird beim Filmen geprüft. Der erste Durchgang fand so einen Fehler, den die Tests übersehen hatten: Das Filterfeld verlor nach einem Zeichen den Fokus. Der Agent hat ihn in einer zweiten Sitzung behoben und einen Test dafür ergänzt.

Echte Sitzung, Zwischenschritte geschnitten · danach geführter Durchgang durch das fertige Werkzeug · 36 Tests bestanden

Nichts ist gestellt: Der Agent hat die Arbeit ausgeführt, und die Terminalszene zeigt die echte Ausgabe der Befehle im Repository. Das Terminalfenster selbst ist für die Aufnahme gezeichnet.