Zum Inhalt springen
2 Min. Lesezeit

Agenten skalieren, Siri wird kontextfähig, Benchmarks wackeln

KI-AgentenCybersecurity

Guten Morgen!

Im heutigen Briefing geht es um Agenten, mobile Assistenten, Sicherheitsregeln und belastbarere KI-Evaluationen.

Microsoft setzt seinen KI-Modellen feste Grenzen

Microsoft hat einen Verhaltenskodex veröffentlicht, der seinen KI-Modellen Cyberangriffe, Unterstützung bei Kernwaffen und die Produktion von Deepfakes untersagt. Die Regeln sollen Nutzeranweisungen überstimmen und verhindern, dass Modelle menschliche Aufsicht durch Täuschung, Selbstverstärkung oder Absprachen umgehen. CEO Satya Nadella begrüßte zudem in KI-Labore eingebettete Evaluatoren. [1]

Siri verarbeitet Bildschirm-, Datei- und Kamerakontext

Mit iOS 27 liefert Apple die lange verzögerte, auf Googles Gemini-Modellen basierende neue Siri-Version aus. Ein Praxistest beschreibt mehrstufige Aufgaben sowie Abfragen zu Dateien, Nachrichten, Bildschirminhalten und Kamerabildern. Fehler gab es bei der Auswahl von Notizen; die Übergabe an aktualisierte Drittanbieter-Apps bleibt abzuwarten. [2]

Cursor lässt Tausende Coding-Agenten parallel arbeiten

Cursor Projects soll langfristige Softwarevorhaben koordinieren, Kontext über Monate bewahren und Aufgaben an Tausende Agenten verteilen. Wiederkehrende Arbeiten könne das System ohne erneuten Prompt ausführen. Laut Anbieter führten neue Nutzer bei Cursor damit 30 Prozent mehr Pull Requests zusammen; Angaben zur Vergleichsgruppe und unabhängige Ergebnisse fehlen. [3]

Superhuman übernimmt Meeting-Assistent Fathom

Superhuman kauft Fathom, um Besprechungsinhalte als Ausgangspunkt für proaktive KI-Arbeit in seine Produktivitätssuite einzubinden. Fathom zählt nach eigenen Angaben mehr als 400.000 monatlich aktive Nutzer; über eine Million Menschen hätten bislang Meetings aufgezeichnet. Superhuman plant daraus abgeleitete E-Mails, Datenbankeinträge, Folgetermine und Aufgaben für KI-Agenten. [4]

Googles ToolGrad dreht Tool-Calling um, mit besseren Erfolgen

Google Research erstellt mit ToolGrad zunächst eine verifizierte Tool-Calling-Kette und formuliert anschließend die dazu passende Nutzeranfrage. Das Verfahren erreichte laut Forschungszusammenfassung bei 16.000 realen APIs eine Erfolgsquote von 99,8 Prozent. Ein Gemma-3-Modell mit zwölf Milliarden Parametern erreichte nach dem Training mit 500 Beispielen bei unbekannten APIs das Niveau von Gemini 2.5 Pro. [3]

Enterprise-Code bleibt für Agenten schwierig

Der neue Real-SWE-Benchmark testet Coding-Agenten an privaten Unternehmens-Codebasen; die höchste Lösungsquote liegt bei 38,8 Prozent. Die Aufgaben umfassen proprietäre Systeme und unternehmensspezifische Programmierkonventionen. Damit prüft der Benchmark Bedingungen, die öffentliche Code-Repositories nur begrenzt abbilden. [3]

Fehlerhafte Tests verzerren Physik-Benchmarks

Fachleute führen viele vermeintliche Modellfehler in sechs verbreiteten Physik-Benchmarks auf falsche Lösungsschlüssel, unklare Fragen und fehlerhafte Bewertungssysteme zurück. Nach der Bereinigung liegen führende Modelle laut Zusammenfassung nahe an der Sättigung. Künftige Vergleiche benötigen demnach schwierigere, von Fachleuten erstellte Prüfungen. [3]

Recursive will KI-Forschung automatisieren

Recursive entwickelt Systeme, die den Prozess der KI-Forschung verbessern und Optimierungsaufgaben automatisieren sollen. Gründer Richard Socher sagt, ein frühes System habe Menschen und deren Agenten binnen zwei Tagen übertroffen und GPU-Kernel ohne spezialisiertes CUDA-Team optimiert; unabhängige Belege nennt die Quelle nicht. Als Risiken diskutiert er Reward Hacking und fehlerhafte Evaluationen. [5]

Constantin Luckenbach

Constantin Luckenbach
LinkedIn
constantin@sicher-ki.de
+49 160 94620957

Philipp Parzer

Philipp Parzer
LinkedIn
phil@sicher-ki.de
+43 660 543 9322

Zeit für individuelle Insights?

Wir sind KI-Experten und haben in und mit mehreren KI-Startups gearbeitet. Für etablierte Unternehmen jeder Größe haben wir KI in bestehende Abläufe integriert. Wir bringen zehn Jahre Erfahrung als Softwareentwickler und Business-Owner mit.

Quellen

  1. Microsoft's new AI 'code of conduct' tells models not to hack systems or trick humans | TechCrunch
  2. With iOS 27, I'm actually using Siri again | TechCrunch
  3. Amodei slows frontier 🛑, ARC-AGI-4 🧠, Cursor Projects 👨‍💻
  4. Superhuman acquires YC-backed notetaker Fathom as productivity platforms push for agentic work | TechCrunch
  5. Humanity’s Last Invention — Richard Socher of Recursive