---
title: "Agenten skalieren, Siri wird kontextfähig… | Sicher KI"
description: "Microsoft formuliert rote Linien, Apple erneuert Siri und neue Tests zeigen Grenzen von Coding-Agenten und KI-Benchmarks."
canonical: "https://sicher-ki.de/ki-briefing/ausgabe/2026-09-15"
last-updated: "2026-09-15T17:19:10.814Z"
---

15\. September 2026, 06:00 2 Min. Lesezeit

# Agenten skalieren, Siri wird kontextfähig, Benchmarks wackeln

KI-AgentenCybersecurity

Guten Morgen!

Im heutigen Briefing geht es um Agenten, mobile Assistenten, Sicherheitsregeln und belastbarere KI-Evaluationen.

## Microsoft setzt seinen KI-Modellen feste Grenzen

**Microsoft hat einen Verhaltenskodex veröffentlicht, der seinen KI-Modellen Cyberangriffe, Unterstützung bei Kernwaffen und die Produktion von Deepfakes untersagt.** Die Regeln sollen Nutzeranweisungen überstimmen und verhindern, dass Modelle [menschliche Aufsicht](https://sicher-ki.de/glossar#human-oversight "Human Oversight") durch Täuschung, Selbstverstärkung oder Absprachen umgehen. CEO Satya Nadella begrüßte zudem in KI-Labore eingebettete Evaluatoren. [\[1\]](https://sicher-ki.de/ki-briefing/ausgabe/2026-09-15#source-7194a1ea-e0a9-40ad-80e4-1d30da9d8d8c)

## Siri verarbeitet Bildschirm-, Datei- und Kamerakontext

**Mit iOS 27 liefert Apple die lange verzögerte, auf Googles Gemini-Modellen basierende neue Siri-Version aus.** Ein Praxistest beschreibt mehrstufige Aufgaben sowie Abfragen zu Dateien, Nachrichten, Bildschirminhalten und Kamerabildern. Fehler gab es bei der Auswahl von Notizen; die Übergabe an aktualisierte Drittanbieter-Apps bleibt abzuwarten. [\[2\]](https://sicher-ki.de/ki-briefing/ausgabe/2026-09-15#source-5724a013-c3a5-4cbb-bef4-124e844361c8)

## Cursor lässt Tausende Coding-Agenten parallel arbeiten

**Cursor Projects soll langfristige Softwarevorhaben koordinieren, Kontext über Monate bewahren und Aufgaben an Tausende Agenten verteilen.** Wiederkehrende Arbeiten könne das System ohne erneuten [Prompt](https://sicher-ki.de/glossar#prompt "Prompt") ausführen. Laut [Anbieter](https://sicher-ki.de/glossar#provider "Provider") führten neue Nutzer bei Cursor damit 30 Prozent mehr Pull Requests zusammen; Angaben zur Vergleichsgruppe und unabhängige Ergebnisse fehlen. [\[3\]](https://sicher-ki.de/ki-briefing/ausgabe/2026-09-15#source-25295e4b-8a22-47bd-8f5c-20905a1f721e)

## Superhuman übernimmt Meeting-Assistent Fathom

**Superhuman kauft Fathom, um Besprechungsinhalte als Ausgangspunkt für proaktive KI-Arbeit in seine Produktivitätssuite einzubinden.** Fathom zählt nach eigenen Angaben mehr als 400.000 monatlich aktive Nutzer; über eine Million Menschen hätten bislang Meetings aufgezeichnet. Superhuman plant daraus abgeleitete E-Mails, Datenbankeinträge, Folgetermine und Aufgaben für KI-Agenten. [\[4\]](https://sicher-ki.de/ki-briefing/ausgabe/2026-09-15#source-78b25656-8564-4f38-84f8-823b54e26937)

## Googles ToolGrad dreht Tool-Calling um, mit besseren Erfolgen

**Google Research erstellt mit ToolGrad zunächst eine verifizierte Tool-Calling-Kette und formuliert anschließend die dazu passende Nutzeranfrage.** Das Verfahren erreichte laut Forschungszusammenfassung bei 16.000 realen APIs eine Erfolgsquote von 99,8 Prozent. Ein Gemma-3-Modell mit zwölf Milliarden Parametern erreichte nach dem [Training](https://sicher-ki.de/glossar#training "Training") mit 500 Beispielen bei unbekannten APIs das Niveau von Gemini 2.5 Pro. [\[3\]](https://sicher-ki.de/ki-briefing/ausgabe/2026-09-15#source-25295e4b-8a22-47bd-8f5c-20905a1f721e)

## Enterprise-Code bleibt für Agenten schwierig

**Der neue Real-SWE-[Benchmark](https://sicher-ki.de/glossar#benchmark "Benchmark") testet Coding-Agenten an privaten Unternehmens-Codebasen; die höchste Lösungsquote liegt bei 38,8 Prozent.** Die Aufgaben umfassen proprietäre Systeme und unternehmensspezifische Programmierkonventionen. Damit prüft der Benchmark Bedingungen, die öffentliche Code-Repositories nur begrenzt abbilden. [\[3\]](https://sicher-ki.de/ki-briefing/ausgabe/2026-09-15#source-25295e4b-8a22-47bd-8f5c-20905a1f721e)

## Fehlerhafte Tests verzerren Physik-Benchmarks

**Fachleute führen viele vermeintliche Modellfehler in sechs verbreiteten Physik-Benchmarks auf falsche Lösungsschlüssel, unklare Fragen und fehlerhafte Bewertungssysteme zurück.** Nach der Bereinigung liegen führende Modelle laut Zusammenfassung nahe an der Sättigung. Künftige Vergleiche benötigen demnach schwierigere, von Fachleuten erstellte Prüfungen. [\[3\]](https://sicher-ki.de/ki-briefing/ausgabe/2026-09-15#source-25295e4b-8a22-47bd-8f5c-20905a1f721e)

## Recursive will KI-Forschung automatisieren

**Recursive entwickelt Systeme, die den Prozess der KI-Forschung verbessern und Optimierungsaufgaben automatisieren sollen.** Gründer Richard Socher sagt, ein frühes System habe Menschen und deren Agenten binnen zwei Tagen übertroffen und [GPU](https://sicher-ki.de/glossar#gpu "GPU")-Kernel ohne spezialisiertes CUDA-Team optimiert; unabhängige Belege nennt die Quelle nicht. Als Risiken diskutiert er [Reward Hacking](https://sicher-ki.de/glossar#reward-hacking "Reward Hacking") und fehlerhafte Evaluationen. [\[5\]](https://sicher-ki.de/ki-briefing/ausgabe/2026-09-15#source-c6e82a60-3c1b-455f-8006-ffc4ad11b2a1)

|                                                                                                                                                                                      |                                                                                                                                                                                                                                                                                                            |
| ------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------ | ---------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------- |
| Constantin Luckenbach&#xA;LinkedIn&#xA;constantin\@sicher-ki.de&#xA;+49 160 94620957&#xA;&#xA;&#x9;&#xA;&#xA;Philipp Parzer&#xA;LinkedIn&#xA;phil\@sicher-ki.de&#xA;+43 660 543 9322 | ## Zeit für individuelle Insights?Wir sind KI-Experten und haben in und mit mehreren KI-Startups gearbeitet. Für etablierte Unternehmen jeder Größe haben wir KI in bestehende Abläufe integriert. Wir bringen zehn Jahre Erfahrung als Softwareentwickler und Business-Owner mit.Erstgespräch vereinbaren |

## Quellen

1. [Microsoft's new AI 'code of conduct' tells models not to hack systems or trick humans | TechCrunch](https://techcrunch.com/2026/09/14/microsofts-new-ai-code-of-conduct-tells-models-not-to-hack-systems-or-trick-humans/)
2. [With iOS 27, I'm actually using Siri again | TechCrunch](https://techcrunch.com/2026/09/14/with-ios-27-im-actually-using-siri-again/)
3. [Amodei slows frontier 🛑, ARC-AGI-4 🧠, Cursor Projects 👨‍💻](https://tldr.tech/ai/2026-09-14)
4. [Superhuman acquires YC-backed notetaker Fathom as productivity platforms push for agentic work | TechCrunch](https://techcrunch.com/2026/09/14/superhuman-acquires-yc-backed-notetaker-fathom-as-productivity-platforms-push-for-agentic-work/)
5. [Humanity’s Last Invention — Richard Socher of Recursive](https://www.latent.space/p/recursive)

## Jeden Morgen um 6 Uhr, direkt in Ihr Postfach

Keine Werbung, kein Spam, geprüfte Quellen, unter 5 min Lesezeit pro Tag

## Weitere KI-Briefings

[16. September 2026 3 Min. Lesezeit](https://sicher-ki.de/ki-briefing/ausgabe/2026-09-16)

### [Voice-Agenten, verlässlichere Workflows und neue Prüfstandards](https://sicher-ki.de/ki-briefing/ausgabe/2026-09-16)

[Google aktualisiert Gemini Live, Tests von Agenten zeigen Schwächen und KI-Anbieter arbeiten an gemeinsamen Sicherheitsstandards.](https://sicher-ki.de/ki-briefing/ausgabe/2026-09-16)

[KI-Agenten Open-Weight-Modelle Compliance Cybersecurity Lokale KI](https://sicher-ki.de/ki-briefing/ausgabe/2026-09-16)

[Briefing lesen](https://sicher-ki.de/ki-briefing/ausgabe/2026-09-16)

[14. September 2026 2 Min. Lesezeit](https://sicher-ki.de/ki-briefing/ausgabe/2026-09-14)

### [US-KI-Regulierung, Arbeitsmarkt und automatisierte Chip-Lieferketten](https://sicher-ki.de/ki-briefing/ausgabe/2026-09-14)

[das KI Tempolimit im Kreuzfeuer, erwartete Umbrüche in der Arbeitsweilt und Nvidias KI-gestützte Lieferkettenplanung](https://sicher-ki.de/ki-briefing/ausgabe/2026-09-14)

[KI-Agenten Compliance Open-Weight-Modelle](https://sicher-ki.de/ki-briefing/ausgabe/2026-09-14)

[Briefing lesen](https://sicher-ki.de/ki-briefing/ausgabe/2026-09-14)

[26. September 2026 2 Min. Lesezeit](https://sicher-ki.de/ki-briefing/ausgabe/2026-09-26)

### [Opus 5.5 an der Spitze, Runway zeigt Echtzeit-World-Model,](https://sicher-ki.de/ki-briefing/ausgabe/2026-09-26)

[Anthropic überzeugt mit Opus 5.5, Runway stellt neue interaktive KI-Welt vor, Oracle bereitet sich auf Stargate vor](https://sicher-ki.de/ki-briefing/ausgabe/2026-09-26)

[Performance World Models Cybersecurity KI-Agenten Investment](https://sicher-ki.de/ki-briefing/ausgabe/2026-09-26)

[Briefing lesen](https://sicher-ki.de/ki-briefing/ausgabe/2026-09-26)

[Mehr lesen](https://sicher-ki.de/ki-briefing)
