KILBI

TAGESAUSGABE · 23.09.2026 · 08:03 CEST

Modelle werden billiger.
Agenten werden prüfbarer.

OpenAI staffelt GPT-6 nach Aufgabe und Preis, Anthropic erneuert seine stärkste Modellklasse, und Banken verlangen klarere Grenzen für einkaufende Agenten.

DREI SIGNALE

Was heute zählt

GPT-6 Sol und Luna teilen komplexe und hochvolumige Arbeit.

OpenAI führt mit GPT-6 Sol ein Modell für komplexe Coding- und Agentenabläufe und mit GPT-6 Luna eine günstigere Klasse für fokussierte Aufgaben ein. Beide API-Modelle unterstützen bis zu 1.05 Millionen Kontexttokens und 128'000 Ausgabetokens. Sol kostet 2 US-Dollar pro Million Eingabetokens und 10 Dollar pro Million Ausgabetokens; Luna 0.10 beziehungsweise 0.50 Dollar.

Einordnung: Der Listenpreis ist nicht der Gesamtpreis einer Aufgabe. Ab mehr als 272'000 Eingabetokens verdoppelt sich der Eingabepreis; die Ausgabe kostet das 1.5-Fache. Regionale Verarbeitung verteuert sich um zehn Prozent, EU-Datenresidenz ist laut Dokumentation nur im Standardmodus verfügbar. Der praktische Fortschritt ist die breitere Kostenstaffelung, nicht allein das Kontextfenster.

OpenAI: GPT-6 Sol ↗ · OpenAI: GPT-6 Luna ↗ · GitHub-Verfügbarkeit ↗

Claude Opus 5.5 setzt auf Effizienz statt nur auf einen neuen Bestwert.

Anthropic hat Claude Opus 5.5 für Claude, seine API und Amazon Bedrock, Google Cloud Vertex AI sowie Microsoft Foundry veröffentlicht. Der API-Preis beträgt 4 Dollar pro Million Eingabetokens und 20 Dollar pro Million Ausgabetokens; schnelles Serving kostet 8 beziehungsweise 40 Dollar.

Einordnung: Anthropic meldet rund 40 Prozent geringere typische Arbeitskosten als bei Opus 5 und mehr als 30 Prozent höhere Ausgabegeschwindigkeit. Das sind Anbieterangaben. Externe Fachleute testeten das Modell vorab auf Risiken, doch die veröffentlichten Leistungs- und Kostenvergleiche sind kein unabhängiger Marktbenchmark. Anthropic weist selbst darauf hin, dass Benchmarkabstände unzuverlässiger werden.

Anthropic, 22.09. ↗ · Reuters, 22.09. ↗

Banken sehen Schutzlücken beim Einkauf durch KI-Agenten.

Banken aus mehreren Ländern warnen, dass autonome Shopping-Agenten bestehende Regeln zu Zahlung, Datenschutz, Betrug und Entschädigung überholen könnten. Genannt werden unsichere Zahlungswege, die Weitergabe sensibler Finanzdaten, manipulative Empfehlungen und unklare Haftung bei Fehlkäufen.

Einordnung: Die Banken fordern Offenlegung von KI-Beteiligung, Schutzmechanismen und Wahlfreiheit. Das ist eine koordinierte Branchenposition, keine beschlossene Regulierung und kein Beleg, dass jeder Agentenkauf unsicher ist. Entscheidend sind konkrete Freigabeschwellen, Datenempfänger und erreichbare Rechtsmittel.

Reuters, 22.09. ↗

Weitere Radarsignale

Telemetrie für Coding-Agenten: Die GitHub-Copilot-App kann Sitzungs-, Modell- und Werkzeugspuren per OpenTelemetry an Unternehmenssysteme senden. Damit werden Laufwege zentral untersuchbar; Unternehmen müssen trotzdem festlegen, welche Inhalte erfasst werden und wer sie sehen darf. GitHub, 22.09. ↗

Abgestufte Tool-Freigaben: Copilot für JetBrains kann risikoarme Tool-Aufrufe automatisch freigeben, bei höherem Risiko nachfragen und MCP-Einstellungen pro Werkzeug speichern. Diese Produktkontrolle reduziert Dialoglast, ersetzt aber keine organisationsweite Positivliste. GitHub, 22.09. ↗

Sieben Tage im Kontext

Die Woche verschiebt den Wettbewerb von maximaler Modellleistung zu abgestuften Kosten, Durchsatz und kontrollierbarem Betrieb. OpenAI und Anthropic positionieren neue Modelle ausdrücklich über Effizienz; gleichzeitig werden Agentenläufe durch Telemetrie und risikobasierte Freigaben besser beobachtbar.

Die Schutzlücken bleiben jedoch an den Übergängen: lange Kontexte verteuern sich, Datenresidenz hängt vom Betriebsmodus ab, Tool-Aufrufe brauchen Berechtigungen und Zahlungen einen sichtbaren Bestätigungspunkt. Diese Details entscheiden über Nutzwert und Risiko stärker als eine einzelne Benchmarkzahl.

Praxis: eine Transaktionsgrenze für Einkaufsagenten

Zeige unmittelbar vor der Zahlung Händler, Artikel, Gesamtpreis, Zahlungsmittel und alle Datenempfänger. Verlange bei neuen Händlern, geänderten Lieferadressen oder oberhalb eines Grenzwerts eine ausdrückliche Bestätigung. Speichere eine unveränderliche Quittung mit Agentenvorschlag und menschlicher Freigabe. Widerruf, Löschung und Rückbuchung müssen ausserhalb des Agenten erreichbar bleiben.

Leitfaden für Agententests öffnen →

Fortschritt oder Hype?

KILBI-Urteil: Fortschritt sind die klarere Preisstaffelung, günstigere Frontier-Nutzung und bessere Instrumentierung von Agentenläufen. Sie machen Beschaffung und Betrieb konkreter messbar.

Hype-Risiko: Anbieter-Benchmarks sind keine neutrale Siegerliste. Niedrige Tokenpreise garantieren keine niedrigen Aufgabenkosten, und eine Bankenwarnung ist weder ein Verbot noch ein Beleg für systematischen Schaden.

Übersehener Punkt: Bei Agenten ist die letzte Freigabe vor einer irreversiblen Handlung oft wichtiger als die Modellwahl. Beobachtbarkeit hilft erst, wenn ein externer Akteur den Lauf begrenzen oder stoppen kann.

Quellen und Methode

Stand: 23. September 2026, 08:03 CEST. Veröffentlichungen seit der Ausgabe vom 22. September und relevante Entwicklungen der letzten sieben Tage wurden geprüft. Preise, Verfügbarkeit, Anbieterbehauptungen, Branchenpositionen und KILBI-Urteil sind getrennt. KILBI hat die Modelle oder Shopping-Agenten nicht selbst getestet.

Redaktionelle Methode und Transparenz · Alle Ausgaben