KILBI

TAGESAUSGABE · 26.09.2026 · 08:49 CEST

KI rechnet weiter.
Kontrolle muss mitlernen.

Claude vollendet eine unabhängig geprüfte Neun-Schleifen-Rechnung mit bekannten Methoden. GitHub lässt Security-Autofix aus Repository-Mustern lernen und macht menschliche Review-Zeiten genauer messbar.

DREI SIGNALE

Was heute zählt

Claude führt eine Neun-Schleifen-Rechnung in einem Physik-Toy-Modell aus.

Anthropic berichtet, Claude habe die Sechsteilchen-Amplitude in planarer N=4-Super-Yang-Mills-Theorie mit zwei bekannten Rechenwegen bestimmt. Der Physiker Lance Dixon von SLAC und Stanford prüfte das Resultat; zusätzlich liegt ein paralleles, teilweise KI-gestütztes Ergebnis einer Gruppe der Chinesischen Akademie der Wissenschaften vor. Anthropic beziffert die Kosten eines Rechenwegs für Endnutzende auf etwa 1'000 bis 2'000 US-Dollar; rund 100 Dollar entfielen auf 96 CPUs während einer Woche.

Einordnung: Das ist ein überprüfbarer Fortschritt bei lang laufender wissenschaftlicher Rechenarbeit. Es ist aber weder eine neue physikalische Theorie noch ein Beleg allgemeiner Forschungsautonomie: Das System nutzte bekannte Methoden in einem unrealistischen Toy-Modell, und Menschen hatten einen grossen Teil des Resultats parallel erreicht. Der Gastautor wurde von Anthropic bezahlt; Dixon erhielt Claude-Guthaben, seine fachliche Validierung wird transparent ausgewiesen.

Anthropic Science, 25.09. ↗ · Vollständiges Resultat ↗

Agentic Autofix übernimmt Sicherheitsmuster in Copilot Memory.

Für Kunden mit aktivierter Copilot Memory prüft GitHubs Agentic Autofix bestehende Erinnerungen als Kontext für Sicherheitswarnungen. Nach einem erzeugten Fix speichert es das Muster erneut, damit weitere Warnungen und andere Copilot-Funktionen wie Code Review oder Cloud Agent davon profitieren können.

Einordnung: Repository-spezifisches Wissen kann wiederkehrende Reparaturen beschleunigen. Zugleich wird ein fehlerhaftes, veraltetes oder zu breit formuliertes Muster wiederverwendbar. Beide Funktionen sind Public Preview; GitHub veröffentlicht in der Meldung keine unabhängigen Erfolgsraten. Speicherherkunft, Gültigkeitsdauer, Sichtbarkeit und Löschweg gehören deshalb zur Sicherheitskontrolle.

GitHub, 25.09. ↗

Copilot-Metriken zerlegen menschliche Review-Zeit in drei Phasen.

GitHubs Repository-Berichte liefern neu Median und 90. Perzentil für die Zeit von «bereit zur Prüfung» bis zum ersten Review, vom ersten bis zum letzten Review und vom letzten Review bis zum Merge. Die Daten stehen in Enterprise- und Organisationsberichten bereit und werden erst ab dem Release aufgebaut.

Einordnung: Die Aufteilung kann zeigen, ob Arbeit vor, während oder nach der Prüfung wartet. Sie misst derzeit aber nur Pull Requests, die eine Person eröffnet und mindestens eine andere Person geprüft hat; Bot-, Copilot- und Selbstreviews zählen nicht als Review. Damit ist die Kennzahl eine Prozessdiagnose, kein Produktivitätsbeweis für Copilot.

GitHub, 25.09. ↗

Weitere Radarsignale

Richtlinien werden prüfbarer: GitHub validiert verwaltete Copilot-Einstellungen neu auf fehlerhaftes JSON, nicht unterstützte Konfigurationen und ungültige Team-Zuordnungen. Betroffene Datei und JSON-Pfad werden ausgewiesen. Das reduziert stille Fehlkonfiguration, belegt aber nicht, dass die fachlich gewählte Richtlinie richtig ist. GitHub ↗

Konversation wird Arbeitskontext: Copilot in Slack und Teams kann mehr Anhänge und Verlauf verwenden, sucht vor der Issue-Erstellung nach ähnlichen Issues und verlinkt zur Ursprungskonversation zurück. Die Public Preview gilt für Business und Enterprise; einzelne Funktionen rollen schrittweise aus. GitHub ↗

Kein künstlicher Modellalarm: In den geprüften Veröffentlichungen der vergangenen 24 Stunden ist kein vergleichbar wichtiger neuer Frontier-Modellstart hinzugekommen. GPT-6 Sol/Luna und Claude Opus 5.5 bleiben der Modellkontext der Woche.

Sieben Tage im Kontext

Die Woche begann mit Modellpreisen und endete bei überprüfbarer Arbeit: Sandboxes begrenzen Agenten, Telemetrie macht Abläufe sichtbar, Richtlinienvalidatoren finden Konfigurationsfehler, und feinere Review-Metriken zeigen Prozesswartezeiten.

Die Neun-Schleifen-Rechnung hebt die inhaltliche Messlatte: Entscheidend ist nicht, wie lange ein Agent lief, sondern ob Ergebnis, Rechenweg, Kosten und unabhängige Prüfung offengelegt sind. Genau dieselbe Disziplin braucht persistent gespeichertes Agentenwissen.

Praxis: Agentenspeicher wie Code behandeln

Inventarisiere jede gespeicherte Erinnerung mit Quelle, Geltungsbereich, Erstellzeit und verantwortlicher Person. Verlange eine Ablaufzeit, einen Löschweg und einen Link zum ursprünglichen Alert oder Review. Prüfe wiederverwendete Fixmuster in einem Wegwerf-Branch, vergleiche sie mit der aktuellen Richtlinie und protokolliere Annahme, Ablehnung sowie Rollback. Miss anschliessend nicht nur Merge-Zeit, sondern auch Korrekturen, wieder geöffnete Findings und übernommene Altfehler.

Leitfaden für Agententests öffnen →

Fortschritt oder Hype?

KILBI-Urteil: Die Physikrechnung ist belastbarer Fortschritt, weil ein konkretes Resultat, zwei Rechenwege, Kosten und fachliche Prüfung benannt sind. Persistent nutzbare Fixmuster und feinere Prozessmetriken können diesen Fortschritt in den Betrieb übersetzen.

Hype-Risiko: Eine schwer wirkende Rechnung ist nicht automatisch eine neue wissenschaftliche Idee; gespeicherte Fixmuster sind nicht automatisch korrekt; kürzere Review-Zeiten sind nicht automatisch bessere Software.

Übersehener Punkt: Lernende Agentensysteme brauchen nicht nur Speicher, sondern Herkunft und Vergessen. Ohne Version, Ablaufzeit und Widerruf wird Erfahrung schnell zu unsichtbarer technischer Schuld.

Quellen und Methode

Stand: 26. September 2026, 08:49 CEST. Veröffentlichungen seit der Ausgabe vom 25. September und relevante Entwicklungen der letzten sieben Tage wurden geprüft. Bestätigte Funktionen, Anbieterangaben und KILBI-Urteil sind getrennt. KILBI hat Claude Science, Copilot Memory oder die neuen Metriken nicht selbst getestet.

Redaktionelle Methode und Transparenz · Alle Ausgaben