Sol treibt Umsatz, Mythos 5 scannt, Preise steigen, Agenten replizieren Forschung
Frontier-Modelle gehen in den Betrieb, Hardware verteuert sich, und Agenten rücken näher an echte Arbeit.
Die wichtigsten Meldungen
OpenAI meldet seit dem Start von GPT-5.6 Sol Anfang Juli einen deutlichen Umsatzanstieg. Die Angabe stammt von OpenAI und kam vor drei Tagen. Wenn du Integrationen planst, teste Sol gegen deine bestehenden Modelle.1
Anthropic setzt sein stärkstes Modell Claude Mythos 5 jetzt für Cyberabwehr ein. Der Sicherheits-Scanner läuft nach eigenen Angaben produktiv. Die Umstellung wurde vor drei Tagen gemeldet. Wenn du Security-Scans evaluierst, probiere Mythos-gestützte Prüfungen an deiner Codebasis.2
Inherent, gegründet von DeepMind-Alumni, stellt Faraday vor, einen Agenten für die Replikation von Forschung. Das Team sagt, Faraday habe OpenAI und Anthropic beim Replizieren von Papers übertroffen. Das sind Anbietertests, unabhängige Benchmarks fehlen. Wenn du Paper-Ergebnisse nachbauen willst, behalte Faraday im Blick.3
Ein Speichermangel treibt die Preise für Nvidia-AI-Server mit Vera Rubin und Grace Blackwell laut Berichten um etwa 15 Prozent nach oben. Das kann Beschaffungen verzögern und Budgets verschieben. Wenn du 2026/27 Kapazität planst, rechne mit höheren Stückpreisen.4
Eine neue Studie findet kaum öffentlich dokumentierte Pläne führender Labs, um abtrünnige Modelle einzudämmen. Das spricht für Lücken in der operativen Vorbereitung. Wenn du mit Frontier-Modellen arbeitest, fordere konkrete Notfall- und Abschaltpläne ein.5
Tools und Releases
OpenAI zeigt eine Vorschau für transparente Hintergründe in GPT-Image-2; die Funktion ist nicht allgemein verfügbar.6
Die Agentic Data Operations Platform auf Bedrock skizziert Agenten, die den Bronze-Silber-Gold-Datenpipeline-Zyklus automatisieren, bei durchgehender Governance.7
Ein Muster für query-aware Kontextkomprimierung auf Bedrock filtert Retrieval-Chunks mit einem kleineren Modell, bevor das Hauptmodell antwortet und senkt so Input-Kosten.8
SOP-Bench bringt eine erweiterbare Agenten-Benchmark für echte Geschäftsprozeduren statt isolierter Proxy-Aufgaben.9
AgentX veröffentlicht InferenceXv3 und ein Datenset im Millionenbereich, mit 1M+ Kontextlänge und 95%+ KV-Cache-Trefferquote, einem Zwischenspeicher zur Beschleunigung der Decodierung.10
NVIDIA DSX MaxLPS zielt auf mehr Performance pro Watt in AI-Fabriken unter harten Stromlimits.11
Research
Princeton und UC San Diego zeigen, dass Agenten von trainierten „Skills“ profitieren und in langen Aufgaben ohne passende Fähigkeiten früh scheitern.12
Neue Arbeit belegt, dass Weltmodelle, also interne Repräsentationen der Umwelt, falsche Handlungen vorhersagen, wenn sie menschliche Überzeugungen ignorieren.13
Quellen
- GPT-5.6 Sol drives OpenAI's revenue surge as it regains ground on Anthropic (the-decoder.com)
- Anthropic puts its most powerful model Claude Mythos 5 to work for cyber defense (the-decoder.com)
- Inherent, founded by DeepMind alumni, says its AI ‘teammate’ just outperformed Anthropic and OpenAI at replicating research (techcrunch.com)
- Memory shortage reportedly drives Nvidia AI server prices up about 15 percent (the-decoder.com)
- Frontier AI labs still won’t say how they’d contain a rogue model (techcrunch.com)
- OpenAI's GPT-Image-2 can now generate images without a background (the-decoder.com)
- Agentic Data Operations Platform (ADOP): Data engineering into hours (aws.amazon.com)
- Reduce RAG costs on Amazon Bedrock with query-aware compression (aws.amazon.com)
- SOP-Bench: A new benchmark for evaluating AI agents on real business procedures (amazon.science)
- AgentX - InferenceXv3: Does CUDA Moat Hold up in Agentic Inferencing? (newsletter.semianalysis.com)
- Maximizing AI Factory Performance per Watt with NVIDIA DSX MaxLPS (developer.nvidia.com)
- Study explains why AI agents benefit from "skills" and when they fail (the-decoder.com)
- World models that ignore human beliefs predict the wrong actions, new research shows (the-decoder.com)