KILBI

TAGESAUSGABE · 24.09.2026 · 08:52 CEST

Agenten bekommen Grenzen.
KI erreicht das Cockpit.

GitHub führt lokale Sandboxes und feinere Review-Vorgaben ein. Gleichzeitig meldet Dassault KI-Flugtests im Rafale – mit bestätigter Integration, aber ohne offene Leistungsdaten.

DREI SIGNALE

Was heute zählt

Lokale Coding-Agenten erhalten technisch erzwungene Projektgrenzen.

GitHub hat lokale Sandboxes in der Copilot-App als öffentliche Vorschau veröffentlicht. Pro Projekt lassen sich zusätzliche Lese- und Schreibpfade, verbotene Ordner, ausgehendes Internet, lokales Netzwerk sowie Git- und GitHub-CLI-Zugangsdaten festlegen. Kann das Betriebssystem die angeforderte Richtlinie nicht durchsetzen, soll die Shell mit einem Fehler abbrechen.

Einordnung: Das ist ein konkreter Fortschritt bei der Begrenzung des möglichen Schadens unbeabsichtigter Befehle. Die Funktion ist aber standardmässig aus, gilt nur für neue oder neu gestartete lokale Sitzungen und nicht für Cloud-Sandboxes oder entfernte Hosts. Eine Sandbox ersetzt weder minimale Rechte noch Protokollierung und Tests der tatsächlichen Regeln.

GitHub, 23.09. ↗

Copilot-Reviews werden persönlich und unternehmensweit konfigurierbar.

GitHub stellt eine eigene Einstellungsseite für automatische Copilot-Code-Reviews in allen Copilot-Plänen bereit. Nutzende können Reviews bei Pull Requests, neuen Pushes und Entwürfen auslösen und standardmässig Lite oder Balanced wählen. Unternehmensadministratoren können für organisationsgeführte Repositories Lite, Balanced oder den GitHub-Standard vorgeben.

Einordnung: Die Vererbung schafft einen überprüfbaren Ausgangspunkt, doch Organisationen und Repositories können ihn überschreiben. Review-Aufwand ist zudem keine Freigabeautorität: KI-Hinweise bleiben ein Eingang in den Prüfprozess, nicht der Nachweis, dass Code korrekt oder sicher ist.

GitHub, 23.09. ↗

Dassault meldet zwei KI-Flugtests auf dem Rafale.

Dassault Aviation hat nach eigenen Angaben zwei «souveräne» KI-Algorithmen im Rafale getestet. Einer wurde intern entwickelt, der zweite gemeinsam mit Thales/cortAIx. Das Unternehmen bezeichnet die Funktionen als kontrolliert und überwacht, im Dienst der menschlichen Besatzung und reif genug für mögliche künftige Upgrades.

Einordnung: Bestätigt ist ein Flugtest auf einer ressourcenbegrenzten militärischen Plattform. Aufgaben, Messwerte, Fehlerraten und Eingriffsgrenzen wurden nicht veröffentlicht. Daraus folgt weder eine autonome Waffenentscheidung noch ein unabhängiger Leistungsnachweis; die Reifeaussage stammt vom Anbieter.

Dassault Aviation, 22.09. ↗ · Reuters, 22.09. ↗

Weitere Radarsignale

Beobachtung ergänzt Begrenzung: Die Copilot-App kann seit dem 22. September Sitzungs-, Modell- und Werkzeugspuren per OpenTelemetry an Unternehmenssysteme senden. Eine Sandbox beschränkt Aktionen, Telemetrie macht den Lauf im Nachhinein untersuchbar; für belastbaren Betrieb braucht es beides. GitHub, 22.09. ↗

Modellradar bleibt stabil: Nach GPT-6 Sol/Luna und Claude Opus 5.5 vom 22. September ist in den letzten 24 Stunden kein vergleichbar wichtiger, belastbar dokumentierter Frontier-Start hinzugekommen. Preise und Anbieter-Benchmarks der gestrigen Ausgabe bleiben damit Kontext, nicht künstlich erneuerte Meldungen. Ausgabe vom 23.09. →

Sieben Tage im Kontext

Die Woche zeigt zwei parallele Bewegungen: Modelle werden günstiger und nach Aufgabe gestaffelt, während Agentenbetrieb stärker über Telemetrie, risikobasierte Freigaben, Sandboxes und Review-Vorgaben kontrolliert wird. Der wichtigere Fortschritt ist deshalb nicht nur ein neuer Modellname, sondern die Fähigkeit, Zugriff und Folgen eines Agentenlaufs zu begrenzen.

Der Rafale-Test erweitert diesen Kontext in die physische Welt. Gerade dort reicht eine Reifeaussage ohne offengelegte Aufgabe, Messwerte und Eingriffsgrenzen nicht für ein Urteil über Sicherheit oder Autonomie.

Praxis: eine Sandbox mit Canary-Daten abnehmen

Starte den Agenten in einem Wegwerf-Repository. Lege eine erkennbare Canary-Datei ausserhalb der erlaubten Pfade und einen ungültigen Testschlüssel ab. Sperre zusätzliche Schreibziele, lokales Netzwerk und ausgehende Domains. Gib dann Aufgaben, die diese Grenzen absichtlich berühren. Bestanden ist der Test erst, wenn die Aktionen blockiert und im Protokoll sichtbar sind. Widerrufe alle temporären Zugangsdaten nach dem Lauf.

Leitfaden für Agententests öffnen →

Fortschritt oder Hype?

KILBI-Urteil: Fortschritt sind erzwingbare Datei-, Netzwerk- und Zugangsdatenregeln sowie vererbbare Review-Vorgaben. Sie verschieben Agentenkontrolle von einer Absicht in prüfbare Konfiguration.

Hype-Risiko: Eine aktivierbare Sandbox ist keine vollständige Sicherheitsgarantie. Ebenso macht ein Flugtest ein System nicht automatisch zu einer autonomen Waffe und die Bezeichnung «reif» nicht zu einem unabhängigen Testurteil.

Übersehener Punkt: Eine Schutzfunktion zählt erst, wenn sie standardmässig oder zentral erzwungen, gegen Umgehung getestet und mit beobachtbaren Blockaden verbunden ist.

Quellen und Methode

Stand: 24. September 2026, 08:52 CEST. Veröffentlichungen seit der Ausgabe vom 23. September und relevante Entwicklungen der letzten sieben Tage wurden geprüft. Bestätigte Funktionen, Anbieterangaben, unabhängige Berichte und KILBI-Urteil sind getrennt. KILBI hat die Copilot-Sandbox, Code-Reviews oder Rafale-Algorithmen nicht selbst getestet.

Redaktionelle Methode und Transparenz · Alle Ausgaben