Field Notes

OpenAI bringt Vollduplex-Voice, GPT-6 Astra führt in Mathe, Deepseek schont Agenten-RAM

Sprachagenten werden echtzeitfähig, Roboter lernen aus einem Video, und Mathe-Benchmarks verschieben sich.

Die wichtigsten Meldungen

OpenAI stellt mit GPT-Live-1 eine Entwickler-API für Sprachdialoge in Echtzeit bereit. Sie unterstützt Full-Duplex, also gleichzeitiges Sprechen und Zuhören. Damit baust du Voice-Agents ohne Push-to-Talk und mit natürlicher Unterbrechung. Der Start richtet sich an Entwickler, nicht an Endnutzer.1

Skild AI kündigt das Robotik-Grundlagenmodell S1 an, gebaut auf Nvidias Physical AI. Es soll neue, lange Aufgabenketten aus nur einem Video lernen können (Long-Horizon, also viele Schritte über größere Zeiträume). Unabhängige Tests fehlen, die Angaben stammen vom Anbieter. Wenn das trägt, sparst du bei Umrüstungen Daten und Zeit.2

GPT-6 Astra führt die ErdosBench für offene Mathematik-Probleme an. OpenAI betont, das Modell solle Tempo aus der Forschung nehmen, damit Menschen prüfen und beweisen. Die Benchmark-Angaben kommen vom Anbieter. Wenn du in Mathe arbeitest, nutze es als Ideengeber, die Beweise bleiben bei dir.3

Deepseek stellt V4.1-Flash vor, ein multimodales Modell mit 552 Milliarden Parametern. Es zielt auf Agenten-Szenarien und soll den Speicherbedarf deutlich senken. Wie groß der Vorteil ausfällt, bleibt in der Meldung ohne neutrale Messung. Falls der Effekt hält, bekommst du mehr gleichzeitige Agenten auf die gleiche Hardware.4

Pocket FM meldet einen verdoppelten Run Rate, also hochgerechneten Jahresumsatz, auf 500 Millionen Dollar. Laut Firma entstehen 93 Prozent der Audio-Stunden per KI, 99 Prozent der neuen Inhalte ebenso. Die Produktion sei etwa 80-mal günstiger, alle Zahlen sind Anbieterangaben. Wenn du Hörformate planst, rechne mit mehr KI-Ware im Feed deiner Nutzer.5

Tools und Releases

Amazon SageMaker Inference führt prefix-aware routing ein, das identische Prompt-Anfänge auf dieselbe Instanz lenkt und laut Benchmarks P50-Time-to-First-Token um bis zu 77 Prozent senkt.6 TwelveLabs Marengo Embed 3.0 ist in Bedrock Knowledge Bases allgemein verfügbar und ermöglicht verwaltete semantische Suche in Video, Bild und Audio.7 Universal Music kündigt mit ElevenLabs eine KI-Plattform für Remixes und Mashups aus lizenzierten Katalogen an; die Verfügbarkeit steht noch aus.8 Nvidia und Palantir koppeln ihre Plattformen für KI-gestützte Lieferketten, beginnend mit Nvidias eigener Million-Teile-Operation.9 Ein konfigurierbarer PII-Detektor auf Bedrock legt die zu erkennenden Entitäten in den Prompt und schlägt in fünf Datensätzen ein Standardtool, ohne Retraining.10 Meta startet Muse als WhatsApp-Agent, der Bestellungen, Mails und Preisverhandlungen übernimmt, alles im Chat.11

Research

Die Agent Evaluation Metric zerlegt Mehrturn-Interaktionen auf Turn-Ebene und markiert den Schritt, der den Fehlerverlauf auslöst.12 Neue Ergebnisse deuten darauf, dass Research-Agenten komprimierbare Datenmodelle lernen und dadurch wenig Raum für bloßes Memorieren bleibt.13

Quellen

  1. OpenAI's GPT-Live-1 API lets developers build apps that talk and listen at the same time (the-decoder.com)
  2. Skild AI Taps NVIDIA Physical AI to Teach Robots New Tasks From a Single Video (blogs.nvidia.com)
  3. GPT-6 Astra gives mathematicians a breather, and OpenAI says that's by design (the-decoder.com)
  4. New Deepseek model V4.1-Flash cuts memory needs for AI agents (the-decoder.com)
  5. India’s Pocket FM doubles revenue run rate to $500M as AI powers 93% of audio content (techcrunch.com)
  6. Reduce LLM latency with prefix-aware routing on Amazon SageMaker Inference (aws.amazon.com)
  7. Video and image search in Amazon Bedrock Knowledge Base using Marengo 3.0 (aws.amazon.com)
  8. Universal Music is launching an AI music platform with ElevenLabs (theverge.com)
  9. Nvidia and Palantir team up to run supply chains with AI, starting with Nvidia's own million-part operation (the-decoder.com)
  10. Model-agnostic PII detection with LLMs (aws.amazon.com)
  11. Muse can shop, write emails, and negotiate prices for users, all through WhatsApp (the-decoder.com)
  12. Agent Evaluation Metric for multi-turn conversations (aws.amazon.com)
  13. Why don’t machine learning research agents overfit? (amazon.science)