KILBI

TAGESAUSGABE · 27.09.2026 · 08:42 CEST

Weniger Schlagzeilen.
Mehr Belege.

In den vergangenen 24 Stunden ist kein vergleichbar wichtiger bestätigter Modell- oder Produktstart hinzugekommen. Die Sonntagsbilanz verdichtet deshalb die stärksten Prüfsteine der Woche: Resultat, Grenze und widerrufbarer Speicher.

DREI WOCHENSIGNALE

Was heute zählt

Prüfbare Resultate schlagen den Demo-Effekt.

Anthropic berichtet, Claude habe die Sechsteilchen-Amplitude in planarer N=4-Super-Yang-Mills-Theorie mit zwei bekannten Rechenwegen bestimmt. Der Physiker Lance Dixon von SLAC und Stanford prüfte das Resultat; ein vollständiger Rechenweg und ein paralleles, teilweise KI-gestütztes Ergebnis sind öffentlich. Anthropic beziffert die Kosten eines Wegs für Endnutzende auf etwa 1'000 bis 2'000 US-Dollar.

Einordnung: Resultat, Methode, Kosten und fachliche Prüfung machen die Arbeit nachvollziehbarer als eine blosse Anbieter-Demo. Das System nutzte jedoch bekannte Methoden in einem unrealistischen Toy-Modell. Die Leistung ist weder eine neue Theorie noch ein Nachweis allgemeiner Forschungsautonomie; die finanziellen Beziehungen rund um Gastautor und Prüfer sind ausgewiesen.

Anthropic Science, 25.09. ↗ · Vollständiges Resultat ↗

Agentengrenzen werden als Produktfunktion sichtbar.

Die lokale Sandbox der GitHub-Copilot-App kann Schreibzugriff auf ein Arbeitsverzeichnis begrenzen, Netzwerkziele kontrollieren und Zugangsdaten aus der Agentenumgebung fernhalten. Die Public Preview ist standardmässig deaktiviert und muss bewusst eingeschaltet werden.

Einordnung: Eine technisch erzwungene Grenze ist stärker als eine Anweisung im Prompt. GitHub nennt in der Ankündigung jedoch keine unabhängigen Ausbruchtests oder Wirksamkeitsraten. «Sandbox vorhanden» und «Isolation nachgewiesen» bleiben zwei verschiedene Aussagen.

GitHub, 23.09. ↗

Agentenspeicher wird zur Sicherheits- und Governance-Frage.

GitHubs Agentic Autofix kann bestehende Copilot-Erinnerungen als Kontext für Sicherheitsfixes lesen und neue Fixmuster für weitere Warnungen speichern. Andere Copilot-Funktionen können dasselbe Repository-Wissen verwenden.

Einordnung: Wiederverwendbares Wissen kann Reparaturen beschleunigen, aber auch fehlerhafte oder veraltete Annahmen vervielfachen. Weil beide Funktionen Public Preview sind und GitHub keine unabhängigen Erfolgsraten nennt, gehören Herkunft, Geltungsbereich, Version, Ablaufzeit und Löschweg in die Abnahme.

GitHub, 25.09. ↗

Weitere Radarsignale

Review wird messbarer: GitHub zerlegt menschliche Review-Zeit neu in Warten bis zum ersten Review, aktive Review-Phase und Warten bis zum Merge. Median und 90. Perzentil helfen bei der Prozessdiagnose; Bot-, Copilot- und Selbstreviews zählen nicht als Review. GitHub ↗

Kein künstlicher Modellalarm: Die geprüften Anbieter-, Projekt- und Nachrichtenquellen liefern für die vergangenen 24 Stunden keinen neuen Frontier-Modellstart oder vergleichbar folgenreichen Produktrelease. GPT-6 Sol/Luna und Claude Opus 5.5 bleiben der Modellkontext der Woche.

Sieben Tage im Kontext

Die Woche begann mit Modellpreisen und endete bei überprüfbarer Arbeit. Neue Sandboxes, Richtlinienvalidatoren und Prozessmetriken verlagern die Aufmerksamkeit von der blossen Fähigkeit zur Betriebsführung: Was darf ein Agent lesen, wohin darf er schreiben, welche Verbindung darf er öffnen und wie wird gespeichertes Wissen wieder entfernt?

Die Forschung setzt denselben Massstab. Ein schwer klingendes Ergebnis gewinnt erst durch offengelegte Methode, Kosten, Gegenrechnung und fachliche Prüfung an Gewicht. Dieses Muster ist weniger spektakulär als Autonomie-Rhetorik, aber nützlicher für reale Entscheidungen.

Praxis: Autonomie in drei Belegen abnehmen

Verlange für jeden Agenten erstens einen prüfbaren Output mit Quellen oder Tests, zweitens eine technisch erzwungene Grenze für Dateien, Netzwerk und Zugangsdaten, drittens einen widerrufbaren Speicher mit Herkunft, Version, Ablaufzeit und Löschweg. Fehlt einer dieser Belege, behandle das System als beaufsichtigtes Werkzeug – unabhängig davon, wie autonom die Demo wirkt.

Leitfaden für Agententests öffnen →

Fortschritt oder Hype?

KILBI-Urteil: Die Woche zeigt Fortschritt dort, wo Resultate nachvollziehbar, Grenzen technisch durchgesetzt und Agentenerinnerungen als kontrollierbare Daten behandelt werden.

Hype-Risiko: Eine komplexe Rechnung ist keine allgemeine Forschungsautonomie; eine optionale Sandbox ist kein unabhängiger Isolationsnachweis; gespeicherte Fixmuster sind nicht automatisch richtig oder aktuell.

Übersehener Punkt: Autonomie ist kein einzelner Produktstatus. Sie besteht aus überprüfbarer Leistung, begrenzter Handlungsmacht und widerrufbarem Kontext – und kann in jeder Dimension unterschiedlich weit reichen.

Quellen und Methode

Stand: 27. September 2026, 08:42 CEST. Veröffentlichungen seit der Ausgabe vom 26. September und relevante Entwicklungen der letzten sieben Tage wurden geprüft. Für die vergangenen 24 Stunden wurde kein gleichwertiges neues Schwergewicht gefunden; deshalb ist diese Ausgabe als Sonntagsbilanz gekennzeichnet. Bestätigte Funktionen, Anbieterangaben und KILBI-Urteil sind getrennt. KILBI hat Claude Science, die Copilot-Sandbox oder Copilot Memory nicht selbst getestet.

Redaktionelle Methode und Transparenz · Alle Ausgaben