All Articles
6 minUpdated

Können Sie Ihr eigenes Meta Muse mit Claude Sonnet 5.5 und MCP bauen?

KI-AgentenClaudeMCPArchitektur

Kurze Antwort: Claude Sonnet 5.5 mit MCP-Servern deckt heute das Modell und die Tool-Schicht von Meta Muse ab. Die Runtime drumherum (Richtlinien-Gate, Token-Tresor, Gedächtnis, Job-Queue, Audit-Log, Schutz vor Injection und ein Browser-Sandbox) schreiben Sie weiterhin selbst. Dieser Beitrag geht jedes Teil durch und zeigt die Schleife, die alles verbindet.

Warum sollten Entwickler diese Launch-Woche beachten?

Zwei Launches lagen drei Wochen auseinander. Am 8. September 2026 kündigte Meta Muse an, einen persönlichen Agenten, der surft, E-Mails verschickt, einkauft und nach dem Schließen der App weiterarbeitet. Am 28. September veröffentlichte Anthropic Claude Sonnet 5.5 zu 2 Dollar pro Million Eingabe-Tokens und 10 Dollar pro Million Ausgabe-Tokens, mit 80,1 % im Computernutzungs-Benchmark OSWorld 2.1.

Wer Produkte baut, sollte fragen, wie viel von Muse sich nächsten Monat in die eigene App bringen lässt. Ich habe Muse in die Teile zerlegt, die Meta tatsächlich ausgeliefert hat, die heute von Claude und MCP abgedeckten markiert und den Rest als Code skizziert.

Was hat Meta tatsächlich ausgeliefert?

  • Muse Spark, das Modell.
  • Muse Secure VM: eine isolierte virtuelle Maschine pro Nutzer mit eigenem Browser und Speicher.
  • Sentinel: ein separater Richtlinienagent, der jede Connector-Anfrage und jeden ausgehenden Aufruf erlaubt, ablehnt oder an den Nutzer weitergibt.
  • Freigaben vor E-Mails und Käufen sowie ein vollständiges Audit-Protokoll.
  • Ein Gedächtnis für Routinen und einmalige Details, genutzt für proaktive Vorschläge.
  • Ausführung im Hintergrund, die nach dem Schließen der App weiterläuft.
  • Zahlungen über Link von Stripe mit Einmal-Kartennummern; Shop Pay und 1Password sind angekündigt.
  • Plattformen: iOS, Android, Web und WhatsApp, Rollout in den USA.

Nur der erste Punkt ist ein Modell. Die übrigen sieben sind Infrastruktur.

Animiertes Diagramm einer Muse-Browseraufgabe durch Secure VM, Sentinel und Nutzerfreigabe
Wie Muse eine Browseraufgabe ausführt: Plan, Barrierefreiheitsbaum lesen, Formular ausfüllen, Sentinel-Prüfung, Freigabe, Protokoll.

Was bringt Claude Sonnet 5.5 einem Agenten?

In diesem Aufbau ist Sonnet 5.5 der Planer. Für einen Agenten zählen diese Zahlen: Ausgabe rund 30 % schneller als bei Sonnet 5, bis zu 30 % geringere Kosten pro Aufgabe durch weniger Tokens und Tool-Aufrufe, 80,1 % in OSWorld 2.1 gegenüber 81,8 % bei Opus 5.5, einstellbare Aufwandsstufen und Verfügbarkeit über die Claude API, AWS, Google Cloud und Microsoft Azure. Lovable meldete nach dem Wechsel rund ein Drittel weniger Tool-Aufrufe.

Bei einem Agenten, der pro Aufgabe Dutzende Tool-Aufrufe macht, wiegt dieser Rückgang schwerer als ein Benchmark-Punkt. Jeder eingesparte Aufruf ist ein Netzwerk-Roundtrip weniger zu einem MCP-Server und eine Fehlerquelle weniger.

Was deckt MCP von Haus aus ab?

Das Model Context Protocol ist der offene Standard, den Anthropic 2024 geschaffen und im Dezember 2025 an die Agentic AI Foundation der Linux Foundation übergeben hat. Er gibt dem Agenten einen einheitlichen Weg zu jedem Tool. Ein Startpaket für einen Assistenten nach Muse-Vorbild sieht so aus:

BedarfMCP-ServerStatus
E-MailGmail-Connector oder Remote-ServerFertig
KalenderGoogle CalendarFertig
DokumenteGoogle DriveFertig
Browser@playwright/mcpFertig, Sie hosten ihn
Codegithub-mcp-serverFertig
Daten und Gedächtnis-EinträgePostgres-ServerFertig
Interne APIsKleiner eigener Server mit dem TypeScript- oder Python-SDKSchreiben Sie selbst
Animiertes Diagramm: Claude Sonnet 5.5 leitet Tool-Aufrufe über einen MCP-Client an sechs MCP-Server
Ein Aufruf nach dem anderen: Claude wählt das Tool, der MCP-Client leitet es weiter, der Server ruft die echte API auf, das Ergebnis geht zurück in den Kontext.

Welche sieben Teile schreiben Sie weiterhin selbst?

  1. Richtlinien-Gate. Markieren Sie jedes Tool als Lesen, Schreiben oder Geld. Lesen erlauben, Schreiben in eine Freigabe-Queue schicken, alles Unbekannte blockieren. Für den Anfang reicht eine Tabelle tool_policies(tool, risk, requires_approval).
  2. Token-Tresor. Refresh-Tokens pro Nutzer mit einem KMS oder libsodium verschlüsseln, in einem Worker erneuern und nie in den Prompt legen.
  3. Gedächtnis. Postgres mit pgvector, eine Tabelle memories mit Quelle und Zeitstempel jedes Fakts und eine Einstellungsseite, auf der Nutzer Einträge lesen und löschen können.
  4. Jobs. Eine Queue wie BullMQ auf Redis oder eine verwaltete wie SQS, dazu ein Scheduler für Anfragen wie "in fünf Tagen".
  5. Audit-Log. Eine Tabelle agent_events, an die nur angehängt wird: Aufgabe, Tool, Eingabe-Hash, Ergebniszusammenfassung, Freigebender und Zeit.
  6. Schutz vor Injection. Tool-Ergebnisse aus dem Web als nicht vertrauenswürdig markieren. Nach dem Lesen solcher Inhalte nur Lese-Tools erlauben, bis der Nutzer den nächsten Schreibvorgang freigibt.
  7. Browser-Sandbox. Ein Container pro Nutzersitzung mit Playwright, Live-Ansicht und Not-Aus.
Architektur eines Agenten nach Muse-Vorbild mit Claude Sonnet 5.5 in der Mitte, MCP-Servern, APIs, isoliertem Browser, Gedächtnis, Workern, Richtlinien-Gate und Audit-Log
Der komplette Stack: das Modell in der Mitte, alles darum herum ist Infrastruktur, die Sie betreiben.

Wie sieht eine minimale Agenten-Schleife aus?

Das ist der Kern der Runtime in TypeScript. Die meiste Arbeit erledigen das Modell und die MCP-Server. Die Schleife ergänzt Richtlinienprüfung, Protokoll und Pause.

import Anthropic from "@anthropic-ai/sdk";
const claude = new Anthropic();

export async function runTask(task: Task) {
  const messages = await memory.load(task.userId, task.goal);
  const tools = await mcp.listTools(task.userId); // tools from every connected MCP server

  for (let step = 0; step < 40; step++) {
    const res = await claude.messages.create({
      model: "claude-sonnet-5-5",
      max_tokens: 4096,
      tools,
      messages,
    });
    messages.push({ role: "assistant", content: res.content });
    if (res.stop_reason !== "tool_use") return finish(task, res);

    const results = [];
    for (const call of res.content.filter((b) => b.type === "tool_use")) {
      const verdict = policy.check(task.userId, call); // "allow" | "ask" | "deny"
      if (verdict === "ask") return queue.pauseForApproval(task, messages, call);
      const output = verdict === "allow"
        ? await mcp.callTool(task.userId, call.name, call.input)
        : "Blocked by policy.";
      await audit.log({ task: task.id, tool: call.name, verdict, output });
      results.push({ type: "tool_result", tool_use_id: call.id, content: output });
    }
    messages.push({ role: "user", content: results });
    await memory.checkpoint(task.id, messages);
  }
}

pauseForApproval speichert das Gespräch und den offenen Aufruf. Sobald der Nutzer freigibt, führt ein Worker den Aufruf aus, hängt das Ergebnis an und startet runTask ab dem Checkpoint neu. Diese kleine Funktion sorgt dafür, dass der Agent "nach dem Schließen der App weiterarbeitet".

Wie sieht die Jobsuche im Audit-Log aus?

So würde das Protokoll die Beispielanfrage "finde Remote-Jobs mit React, prüfe meinen Kalender, bereite Bewerbungen vor, hake in fünf Tagen nach" festhalten:

09:02  plan        search remote React roles, posted in last 7 days
09:02  browser     navigate jobs board        allow   42 listings (untrusted)
09:03  postgres    read prefs                 allow   remote, React, salary floor
09:03  calendar    find_free_slots(14d)       allow   6 slots
09:05  drive       create_doc x5              allow   5 cover letters
09:05  gmail       create_draft x5            ask     waiting for user
09:41  approval    user approved 4, rejected 1
09:42  browser     submit application x4      allow   4 submitted
09:42  scheduler   follow_up in 5 days        allow   job #8812
day 5  gmail       search replies             allow   1 reply, 3 silent
day 5  gmail       create_draft x3            ask     waiting for user

Jede Zeile mit ask ist eine Stelle, an der auch Sentinel in Muse angehalten hätte. Jede Zeile mit einer Jobnummer ist etwas, das ein Chatfenster allein nicht leisten kann.

Muse oder eigener Stack?

Nehmen Sie Muse, wenn Sie als Einzelperson Ergebnisse wollen und mit Metas Datenbedingungen, der Verfügbarkeit nur in den USA und der aktuellen Integrationsliste leben können.

Bauen Sie auf Claude und MCP, wenn der Agent in Ihrem Produkt leben, interne Systeme erreichen, Ihre Aufbewahrungsregeln einhalten oder später das Modell wechseln soll, ohne jede Integration neu zu schreiben.

Fazit

Sonnet 5.5 liefert einen Planer, der zum Preis der Mittelklasse nah am Spitzenmodell liegt. MCP macht aus der Tool-Schicht Konfiguration. Muses eigentlicher Vorsprung ist die Runtime: VM, Richtlinienagent, Tresor, Scheduler und Protokoll. Auf dieser Schicht werden Agenten-Produkte als Nächstes konkurrieren, und genau diese Schicht können Sie selbst bauen.

Quellen