OpenAI zeigt Jalapeño-Chip, Google startet Gemini Legal, Ukraine öffnet Kriegsdatensatz
Inferenzhardware, KI fürs Recht und Militärdaten rücken vor, doch belastbare Vergleiche fehlen oft.
Die wichtigsten Meldungen
OpenAI zeigte Jalapeño, einen eigenen Inferenzchip. Interne Benchmarks sollen Nvidia Blackwell und Rubin schlagen. Die Zahlen kommen vom Anbieter, unabhängige Tests fehlen. Für dich ändert sich erst etwas, wenn Hardware und Dienste verfügbar sind.1
OpenAI sagt, Jalapeño liefert Antworten schneller und effizienter als Konkurrenz. Hardware-Chef Richard Ho spricht vom „best of both worlds“. Das sind Anbieterangaben ohne externe Bestätigung.2
OpenAI nennt erste Ergebnisse: führende Geschwindigkeit und Effizienz in der Inferenz. Versprochen sind höherer Durchsatz und geringere Latenz für moderne Modelle. Ohne unabhängige Benchmarks bleibt das ein Leistungsversprechen.3
Die Ukraine öffnet ein groß beschriftetes Gefechtsdaten-Set für britische Firmen. Es ist Teil einer KI-Waffenpartnerschaft mit der UK-Regierung. Wenn du in UK im Defence-Umfeld arbeitest, kannst du Zugang anstoßen.4
Google startet Gemini Enterprise for Legal zur Automatisierung von Verträgen und Recherche. Die Angaben stammen aus Googles Ankündigung, belastbare Praxisergebnisse fehlen. Wenn du in einer Rechtsabteilung arbeitest, plane einen eng begrenzten Pilot mit echten Dokumenten.5
Nvidia positioniert den Groq 3 LPX Inferenzchip als viermal schneller als Cerebras. Die Vergleichsrechnung ist kompliziert, und die Zahlen stammen von Nvidia. Ohne standardisierte Benchmarks ist der Vergleich schwer.6
Tools und Releases
Anthropic gibt Claude ein geteiltes Gedächtnis zwischen Chat und Cowork, damit du Projekte und Präferenzen nicht mehr wiederholst.7
llama.cpp 0.3.0 bringt das multimodale dots3-note, einen neuen KV-Cache, MTP-Support für GLM-4.5-Air und ggml 0.22.8
CUDA Python 1.0 wird stabil, vereinheitlicht die APIs und öffnet den vollen CUDA-Zugriff aus Python.9
Keenable tritt aus dem Stealth, sammelt 26 Millionen Dollar Seed und baut einen Webindex für AI-Agenten.10
Research
Quantization-Aware Healing zeigt, dass ein komprimiertes 4-Bit-Modell sein Vollpräzisions-Original übertreffen kann, dank Quantisierung, also der bewussten Reduktion der Zahlenauflösung beim Training.11
Quellen
- OpenAI's first custom chip "Jalapeño" reportedly beats Nvidia's Blackwell and Rubin in inference benchmarks (the-decoder.com)
- OpenAI says its Jalapeño chip can power faster AI responses than the competition (theverge.com)
- Jalapeño’s first results show industry-leading speed and efficiency in AI inference (openai.com)
- Ukraine opens its massive labeled battlefield dataset to British firms in a landmark AI weapons partnership (the-decoder.com)
- Google launches Gemini for legal work to automate contracts and research (the-decoder.com)
- Nvidia says its Groq 3 LPX is four times faster than Cerebras, but the math is more complicated (the-decoder.com)
- Claude Cowork finally remembers what you told the app in chat (techcrunch.com)
- llama.cpp v0.3.0 (github.com)
- CUDA Python 1.0: Stable APIs, One Foundation, Full Platform Access (developer.nvidia.com)
- Accel-backed Keenable is indexing the web for AI agents (techcrunch.com)
- Quantization-Aware Healing: a compressed, 4-bit model that outperforms its full-precision original (huggingface.co)