Field Notes

Anthropic prüft von innen, Meta schützt Brillendaten, Astra-Fälle zeigen Produktivitätsgewinne

Heute geht es um geprüfte Modelle, vertrauliche Verarbeitung in der Cloud und belegte Effizienzsprünge.

Wichtige KI-Nachrichten

Anthropic startet eingebettete Prüfungen mit Accenture

Anthropic und Accenture vereinbaren eine Partnerschaft für eingebettete Prüfer, also unabhängige Teams im Unternehmen mit internem Zugriff. Beide Seiten planen laut Ankündigung je mindestens 1 Mrd. US-Dollar in fünf Jahren. Die Zusammenarbeit ist nicht exklusiv, METR soll ebenfalls Elemente pilotieren. Anthropic finanziert die Accenture-Arbeit direkt, weitere Evaluatoren sollen folgen. Für dich heißt das: Mehr Prüfpfade und externe Sicht bei Frontier-Modellen, erst recht wenn du Anthropic nutzt.1

Meta bringt Private Processing für AI-Brillen

Meta beschreibt „Private Processing“ für AI-Brillen, eine vertrauliche Cloud-Verarbeitung auf Hardware-geschützten Umgebungen. Der Ansatz erweitert die 2025 eingeführte Technik auf Brillen und soll persönliche Kontexte verarbeiten, ohne dass Meta Daten im Betrieb einsehen kann. Die Ausführung läuft in abgeschirmten virtuellen Maschinen mit Attestierung (laut Meta). Wenn du mit Brillen arbeitest, kannst du kontextreiche Funktionen planen und gleichzeitig Datenschutzanforderungen adressieren.2

Astra in der Praxis: Recht, Research und Video

Neue Fallstudien zeigen den Einsatz von GPT-6 Astra in Unternehmen. Harvey meldet strukturiertere juristische Entwürfe, Parallel halbiert laut Anbieter Zeit und Kosten bei Arbeitsmarkt-Research. invideo berichtet von dreifach schnellerer Farbkorrektur und 50 Effekten an einem Tag, Higgsfield liefert Video-Features binnen eines Tages. Das sind Anbieterangaben ohne unabhängige Prüfung; wenn du ähnliche Aufgaben hast, lohnt ein begrenzter Pilot mit klaren Metriken.3456

Neues offenes MoE-Modell: Hunyuan-A13B

Hunyuan-A13B ist ein offenes Mixture-of-Experts-Modell mit 80 Mrd. Gesamtparametern, von denen 13 Mrd. zur Laufzeit aktiv sind. Das Team nennt 20T Trainings-Tokens und legt Wert auf Faktenhaltigkeit und Reasoning bei geringeren Betriebskosten. Für dich interessant, wenn du ein leistungsfähiges, effizienteres Open-Modell evaluieren willst. Lizenz- und Nutzungsbedingungen vor Einsatz prüfen.7

Highlights für deinen Arbeitsalltag

Unstrukturierte Medien in Salesforce nutzbar machen. AWS zeigt, wie du Agentforce mit Amazon Bedrock Data Automation und dem Model Context Protocol koppelst. Upload, automatische Extraktion und Abfrage passieren aus dem Salesforce-Chat heraus. Nächster Schritt: Prüfe, ob eure Edition externe MCP-Server erlaubt.8

Assistent mit Gerätespeicher bauen. DeepLearning.AI bietet einen Kurz-Kurs mit Qdrant zu lokalem Speichern, Suchen und Vergessen von Text- und Bild-Erinnerungen. Du lernst einen Offline-Assistenten für Mac, Windows oder Linux aufzusetzen, ohne Daten in die Cloud zu senden. Das ist nützlich, wenn Datenschutz für dich zählt.9

Evaluieren statt raten. Hamel Husain rät zu einem Eval-Audit, um schnelle Fehlerquellen zu finden. NVIDIA erklärt dazu, wie du Agenten vom Tool-Aufruf bis zur Aufgabenfertigstellung bewertest, statt nur hübsche Antworten zu prüfen. Fang mit einem realen End-to-End-Task an und miss Abschlussquote und Wiederanläufe.101112

Tools und Updates

  • Dify Agent: Baue Agenten per Gespräch, teste im Preview und verteile sie teamweit. Gut, wenn du eine gemeinsame Oberfläche für Ideen bis Betrieb willst. Voraussetzung: Bereitschaft, neue Agent-Workflows einzuführen.13
  • LangSmith Custom Apps: Erzeuge Interfaces aus Agent-Daten mit einem Prompt. Nützlich, um interne Dashboards ohne Frontend-Team zu skizzieren. Erfordert LangSmith-Nutzung.14
  • Gemini Connected Apps: Neue Verbindungen zu Adobe, Airtable, Linear, Peloton und mehr. Du kannst Aufgaben über verbundene Tools direkt aus Gemini anstoßen. Voraussetzung: Aktivierte App-Verknüpfungen in deinem Konto.15
  • Replit für Meta-Geräte: Beschreibe eine VR-App, Replit erzeugt den Startpunkt für Meta-Devices. Für Teams, die schnell Prototypen im VR-Umfeld brauchen. Zugang zu Replit und Meta-Zielgeräten nötig.16

In fünf Minuten ausprobieren

Eigene Übungsidee auf Basis von Spec-Driven Development: eine Mini-Spezifikation schreiben und vom Coding-Agenten umsetzen lassen.17

1) Kopiere diese Spez in dein Coding-Modell: „Baue ein CLI-Tool in Python, das eine CSV mit Spalten name, qty, price einliest und eine JSON-Liste mit Feldern name, qty:int, total:float ausgibt. total = qty*price, zwei Dezimalstellen. Fehlerhafte Zeilen überspringen und zählen. Ausgabe: JSON und am Ende ‚skipped: X‘.“ Beispiel-CSV:

name,qty,price Pen,3,1.20 Notebook,2,5.00 ErrorRow,abc,9.99

2) Lass den Agenten den Code liefern und führe ihn lokal oder im Browser-Interpreter deines Tools aus. Nutze die Beispiel-CSV als Eingabe.

3) Prüfkriterium: Die JSON-Ausgabe enthält zwei Objekte, totals 3.60 und 10.00, und die letzte Zeile lautet „skipped: 1“.

Erwartetes Ergebnis: Ein kurzes, überprüfbares Skript, das deiner Spez folgt und sauber mit fehlerhaften Zeilen umgeht.17

Ein guter Fund

Practical AI über Agenten im Unternehmen: Nimm Plattform-Engineering mit. Definiere Identität und Rechte für Agenten getrennt vom Nutzer, setze Sandboxes durch und führe ein MCP-Gateway zwischen Chat und Tools. Halte gemeinsamen Agenten-Speicher klein und prüfbar. Das hilft dir, Sicherheit und Betriebspfad zu klären, bevor du skalierst.18

Quellen

  1. The Quest for Embedded Evaluators (thezvi.substack.com)
  2. Bringing Private Processing to Meta AI Glasses (engineering.fb.com)
  3. Harvey turns legal context into stronger drafts with GPT-6 Astra (openai.com)
  4. Parallel cut research time and cost in half with GPT‑6 Astra (openai.com)
  5. How invideo improves color grading 3x with GPT‑6 Astra (openai.com)
  6. Higgsfield AI ships new video features in a day with GPT-6 Astra (openai.com)
  7. Paper: Hunyuan-A13B Technical Report (huggingface.co)
  8. Extending public sector intelligence with Agentforce and AWS (aws.amazon.com)
  9. Building AI Assistants with On-Device Memory (youtube.com)
  10. @hamelhusain: I recommend grabbing these skills that @sh_reya and I created and at the very least doing an /eval-audit of your existing pipeline.

We've found that people often find low hanging (x.com) 11. How to Evaluate AI Agents From Tool Calls to Task Completion (developer.nvidia.com) 12. @hamelhusain: This post was a labor of love! We’ve distilled thousands of hours of work on AI Evals into a 30 min read + skills you can use to quickly uncover errors in your product.

https://t. (x.com) 13. @dify_ai: Missed the new Dify Agent launch? Here’s the experience in two minutes.

Start with an idea, build through conversation, and test in Preview. Build once, then use it across the pla (x.com) 14. @langchain: Introducing LangSmith Custom Apps

Create any interface from your agent data with a prompt. If you can think it, LangSmith can build it.

Now GA. https://t.co/MayBpUbPdu https://t. (x.com) 15. A new wave of Connected Apps is rolling out to Gemini. (blog.google) 16. @replit: Your next app could be in VR.

Describe an app, and Replit builds it for @Meta devices.

Announced today at #MetaConnect. Start building: https://t.co/NIaZFInsRi https://t.co/Hmgc1 (x.com) 17. Full Course: Spec-Driven Development with Coding Agents (youtube.com) 18. From AGENTS.md to Enterprise Deployment (share.transistor.fm)