Zum Inhalt springen
4 Min. Lesezeit

Neue Modelle von Anthropic, OpenAI und Xiaomi, Decision Models und autonome KI im All

Open-Weight-ModellePerformanceResearchLokale KIInvestmentKI-Agenten

Guten Morgen!

Heute geht es um neue Modelle, offene Trainingswerkzeuge, Decision Models, autonome Systeme, Forschungsinfrastruktur und App-Wachstum.

Anthropic veröffentlicht Opus 5.5 zu niedrigeren Preisen

Anthropic hat Opus 5.5 veröffentlicht und senkt den Preis pro Million Output-Tokens gegenüber dem Vorgänger um 20%. Nach eigenen Angaben steigen die Leistung bei Coding und Wissensarbeit sowie die Geschwindigkeit, während der Bedarf an Rechnenleistung deutlich sinkt.

Für Biologie und Cybersecurity gelten dieselben Schutzmaßnahmen wie bei Fable, darunter Einschränkungen bei Hack-Versuchen und biologischen Waffen. Sonnet 5.5 und Haiku 5.5 sollen laut Anthropic in den kommenden Wochen folgen.

Anthropic gibt an, Opus 5.5 koste im Einsatz 40 Prozent weniger als Opus 5 und erreiche bei den meisten Aufgaben das Niveau von Fable 5.1. [1][11]

Xiaomi Modell MiMo-V2.6 erscheint und Trainings-Werkzeuge werden veröffentlicht

Xiaomi veröffentlicht MiMo-V2.6 Pro und Flash als omnimodale Open-Weight-Modelle samt Technical Report, RL-Umgebungen und Trainingscode. MiMo-V2.6 Pro hat laut Artificial Analysis 1,02 Billionen Parameter, davon 42 Milliarden aktive, und führt dessen Intelligence Index für Open-Source Modelle an.

Ein in der Quelle zitierter Bericht beziffert den abschließenden RL-Lauf auf 130 Stunden und 2,6 Millionen Dollar. Der vollständige Datensatz mit mehr als 7.000 Aufgaben ist noch nicht verfügbar. [2] [3]

Jev liefert Wahrscheinlichkeiten statt Text

TypeSafe AI positioniert Jev als Decision Model, das aus Text Ja-Nein-Wahrscheinlichkeiten, Auswahlentscheidungen oder Scores erzeugt. Der Dienst kostet 0,042 Dollar pro Million Input-Tokens. Output ist sogar gänzlich gebührenfrei. Das Modell kann mehrere Fragen zu einem Dokument parallel auswerten.

Geeignete Aufgaben sind Arbeitsverteilung, Priorisierung, Spam-Erkennung und Bewertung. Der technische Bericht nennt Zahlen, Datumsangaben und böswillige Inhalte als Schwächen; da Jev keine Begründungen liefert, gewinnen Bias-Tests und eigene Evals zusätzlich an Bedeutung. [4] [5] [6]

AstroForge testet autonome KI-Steuerung im All

AstroForge plant für 2027 eine Mission, bei der sein selbst entwickeltes Transformer-System "Solo" ein Raumfahrzeug autonom steuern soll. Ihr Ansatz kombiniert klassische Regelung, spezialisierte Subsystemmodelle und eine übergeordnete Intelligenzschicht, die mit Daten von rund 2.500 Sensoren trainiert wurde.

Zuvor soll Solo auf DeepSpace-2 testweise nebenbei mitlaufen, ohne die Kontrolle zu übernehmen. Das Vorhaben folgt auf zwei Prototypen mit Anomalien, die den Großteil ihrer Missionsziele verfehlten. [7]

OpenAI schafft Beirat für mathematische KI-Ergebnisse

OpenAI richtet am Institute for Advanced Study einen als unabhängig bezeichneten Beirat ein, der mathematische KI-Ergebnisse bewerten und ihre Veröffentlichung koordinieren soll. Anlass sind ein mögliche Lösung des Navier-Stokes-Problems und OpenAIs unbestätigte Angabe, ihr internes Modell habe mehr als 100 weitere offene Probleme gelöst.

Der neunköpfige Beirat kann öffentlich Stellung nehmen und seine Mitgliedschaft selbst bestimmen, besitzt aber keine Entscheidungsgewalt. [8]

Meta's Muse übertrifft ChatGPTs frühen Mobilstart

Metas KI-App Muse erreichte laut Apptopia in ihren ersten zwölf Tagen 1,8 Millionen iOS-Downloads in den USA und Kanada. Bei ChatGPTs damaligem Start waren es "nur" 1,3 Millionen. Auch die geschätzte tägliche iOS-Nutzung lag mit 359.000 über ChatGPTs damaligem Niveau.

Die Werte sind Schätzungen eines externen Marktforschers und keine internen Meta-Daten. Mehr als 95 Prozent der Muse-Nutzer verwenden demnach auch Facebook, was die starke Überschneidung mit Metas bestehender Nutzerbasis zeigt. [9]

OrcaRouter sieht Daten als Engpass für Decision Models

OrcaRouter leitet aus internen Tests mit Jev ab, dass KI bei Aufgaben mit einer begrenzten Zahl möglicher Antworten besser funktionieren kann, wenn sie verschiedene Optionen gezielt durchsucht, statt eine Antwort frei Wort für Wort zu erzeugen.

Die Jev-Tests deuten außerdem darauf hin, dass vor allem die Datenmenge entscheidend sein könnte: Mit rund 123.000 Trainingsbeispielen schnitt dasselbe Modell bei neuen, unbekannten Fällen deutlich besser ab als mit nur 1.200 Beispielen.

OrcaRouters Schlussfolgerung: Bei solchen sogenannten Decision Models könnte künftig weniger die Modellgröße als vielmehr die Menge und Qualität der Trainingsdaten der entscheidende Engpass sein.

Die Ergebnisse stammen von OrcaRouter selbst und wurden bislang nicht unabhängig überprüft. [10]

OpenAI ergänzt GPT-6 um Sol und Luna

OpenAI stellt GPT-6 Sol und Luna als schnellere und günstigere Ableger von GPT-6 vor. Effizienteres Caching und Inference sollen laut Anbieter die Kosten senken; die API-Preise liegen 50 Prozent unter den zeitlich begrenzten Einführungspreisen von GPT-5.6. [12]

Constantin Luckenbach

Constantin Luckenbach
LinkedIn
constantin@sicher-ki.de
+49 160 94620957

Philipp Parzer

Philipp Parzer
LinkedIn
phil@sicher-ki.de
+43 660 543 9322

Zeit für individuelle Insights?

Wir sind KI-Experten und haben in und mit mehreren KI-Startups gearbeitet. Für etablierte Unternehmen jeder Größe haben wir KI in bestehende Abläufe integriert. Wir bringen zehn Jahre Erfahrung als Softwareentwickler und Business-Owner mit.

Quellen

  1. Anthropic releases Opus 5.5 with lower prices and Fable-level performance | TechCrunch
  2. [AINews] Xiaomi MiMo-V2.6-Pro 1T-A42B: the new top Open Weights model, trained for $3M
  3. Opus 5.5 imminent ⏳, Grok 4.7 🚀, MiMo v2.6 🤖
  4. Jev introduces a new shape of LLM - System One, aka Decision Models
  5. Jev: System One models for Prod, not God — with Diogo Almeida, CEO, TypeSafe AI
  6. llm-typesafe 0.1a0
  7. AstroForge is putting AI in command of its next spacecraft | TechCrunch
  8. OpenAI forms math advisory group as its AI resolves more than 100 open problems | TechCrunch
  9. Meta's Muse is outpacing ChatGPT’s early mobile launch | TechCrunch
  10. OrcaRouter 🐳 (@OrcaRouter) on X
  11. Claude (@claudeai) on X
  12. OpenAI (@OpenAI) on X