Können Sie Ihr eigenes Meta Muse mit Claude Sonnet 5.5 und MCP bauen?
Kurze Antwort: Claude Sonnet 5.5 mit MCP-Servern deckt heute das Modell und die Tool-Schicht von Meta Muse ab. Die Runtime drumherum (Richtlinien-Gate, Token-Tresor, Gedächtnis, Job-Queue, Audit-Log, Schutz vor Injection und ein Browser-Sandbox) schreiben Sie weiterhin selbst. Dieser Beitrag geht jedes Teil durch und zeigt die Schleife, die alles verbindet.
Warum sollten Entwickler diese Launch-Woche beachten?
Zwei Launches lagen drei Wochen auseinander. Am 8. September 2026 kündigte Meta Muse an, einen persönlichen Agenten, der surft, E-Mails verschickt, einkauft und nach dem Schließen der App weiterarbeitet. Am 28. September veröffentlichte Anthropic Claude Sonnet 5.5 zu 2 Dollar pro Million Eingabe-Tokens und 10 Dollar pro Million Ausgabe-Tokens, mit 80,1 % im Computernutzungs-Benchmark OSWorld 2.1.
Wer Produkte baut, sollte fragen, wie viel von Muse sich nächsten Monat in die eigene App bringen lässt. Ich habe Muse in die Teile zerlegt, die Meta tatsächlich ausgeliefert hat, die heute von Claude und MCP abgedeckten markiert und den Rest als Code skizziert.
Was hat Meta tatsächlich ausgeliefert?
- Muse Spark, das Modell.
- Muse Secure VM: eine isolierte virtuelle Maschine pro Nutzer mit eigenem Browser und Speicher.
- Sentinel: ein separater Richtlinienagent, der jede Connector-Anfrage und jeden ausgehenden Aufruf erlaubt, ablehnt oder an den Nutzer weitergibt.
- Freigaben vor E-Mails und Käufen sowie ein vollständiges Audit-Protokoll.
- Ein Gedächtnis für Routinen und einmalige Details, genutzt für proaktive Vorschläge.
- Ausführung im Hintergrund, die nach dem Schließen der App weiterläuft.
- Zahlungen über Link von Stripe mit Einmal-Kartennummern; Shop Pay und 1Password sind angekündigt.
- Plattformen: iOS, Android, Web und WhatsApp, Rollout in den USA.
Nur der erste Punkt ist ein Modell. Die übrigen sieben sind Infrastruktur.
Was bringt Claude Sonnet 5.5 einem Agenten?
In diesem Aufbau ist Sonnet 5.5 der Planer. Für einen Agenten zählen diese Zahlen: Ausgabe rund 30 % schneller als bei Sonnet 5, bis zu 30 % geringere Kosten pro Aufgabe durch weniger Tokens und Tool-Aufrufe, 80,1 % in OSWorld 2.1 gegenüber 81,8 % bei Opus 5.5, einstellbare Aufwandsstufen und Verfügbarkeit über die Claude API, AWS, Google Cloud und Microsoft Azure. Lovable meldete nach dem Wechsel rund ein Drittel weniger Tool-Aufrufe.
Bei einem Agenten, der pro Aufgabe Dutzende Tool-Aufrufe macht, wiegt dieser Rückgang schwerer als ein Benchmark-Punkt. Jeder eingesparte Aufruf ist ein Netzwerk-Roundtrip weniger zu einem MCP-Server und eine Fehlerquelle weniger.
Was deckt MCP von Haus aus ab?
Das Model Context Protocol ist der offene Standard, den Anthropic 2024 geschaffen und im Dezember 2025 an die Agentic AI Foundation der Linux Foundation übergeben hat. Er gibt dem Agenten einen einheitlichen Weg zu jedem Tool. Ein Startpaket für einen Assistenten nach Muse-Vorbild sieht so aus:
| Bedarf | MCP-Server | Status |
|---|---|---|
| Gmail-Connector oder Remote-Server | Fertig | |
| Kalender | Google Calendar | Fertig |
| Dokumente | Google Drive | Fertig |
| Browser | @playwright/mcp | Fertig, Sie hosten ihn |
| Code | github-mcp-server | Fertig |
| Daten und Gedächtnis-Einträge | Postgres-Server | Fertig |
| Interne APIs | Kleiner eigener Server mit dem TypeScript- oder Python-SDK | Schreiben Sie selbst |
Welche sieben Teile schreiben Sie weiterhin selbst?
- Richtlinien-Gate. Markieren Sie jedes Tool als Lesen, Schreiben oder Geld. Lesen erlauben, Schreiben in eine Freigabe-Queue schicken, alles Unbekannte blockieren. Für den Anfang reicht eine Tabelle
tool_policies(tool, risk, requires_approval). - Token-Tresor. Refresh-Tokens pro Nutzer mit einem KMS oder libsodium verschlüsseln, in einem Worker erneuern und nie in den Prompt legen.
- Gedächtnis. Postgres mit pgvector, eine Tabelle
memoriesmit Quelle und Zeitstempel jedes Fakts und eine Einstellungsseite, auf der Nutzer Einträge lesen und löschen können. - Jobs. Eine Queue wie BullMQ auf Redis oder eine verwaltete wie SQS, dazu ein Scheduler für Anfragen wie "in fünf Tagen".
- Audit-Log. Eine Tabelle
agent_events, an die nur angehängt wird: Aufgabe, Tool, Eingabe-Hash, Ergebniszusammenfassung, Freigebender und Zeit. - Schutz vor Injection. Tool-Ergebnisse aus dem Web als nicht vertrauenswürdig markieren. Nach dem Lesen solcher Inhalte nur Lese-Tools erlauben, bis der Nutzer den nächsten Schreibvorgang freigibt.
- Browser-Sandbox. Ein Container pro Nutzersitzung mit Playwright, Live-Ansicht und Not-Aus.
Wie sieht eine minimale Agenten-Schleife aus?
Das ist der Kern der Runtime in TypeScript. Die meiste Arbeit erledigen das Modell und die MCP-Server. Die Schleife ergänzt Richtlinienprüfung, Protokoll und Pause.
import Anthropic from "@anthropic-ai/sdk";
const claude = new Anthropic();
export async function runTask(task: Task) {
const messages = await memory.load(task.userId, task.goal);
const tools = await mcp.listTools(task.userId); // tools from every connected MCP server
for (let step = 0; step < 40; step++) {
const res = await claude.messages.create({
model: "claude-sonnet-5-5",
max_tokens: 4096,
tools,
messages,
});
messages.push({ role: "assistant", content: res.content });
if (res.stop_reason !== "tool_use") return finish(task, res);
const results = [];
for (const call of res.content.filter((b) => b.type === "tool_use")) {
const verdict = policy.check(task.userId, call); // "allow" | "ask" | "deny"
if (verdict === "ask") return queue.pauseForApproval(task, messages, call);
const output = verdict === "allow"
? await mcp.callTool(task.userId, call.name, call.input)
: "Blocked by policy.";
await audit.log({ task: task.id, tool: call.name, verdict, output });
results.push({ type: "tool_result", tool_use_id: call.id, content: output });
}
messages.push({ role: "user", content: results });
await memory.checkpoint(task.id, messages);
}
}
pauseForApproval speichert das Gespräch und den offenen Aufruf. Sobald der Nutzer freigibt, führt ein Worker den Aufruf aus, hängt das Ergebnis an und startet runTask ab dem Checkpoint neu. Diese kleine Funktion sorgt dafür, dass der Agent "nach dem Schließen der App weiterarbeitet".
Wie sieht die Jobsuche im Audit-Log aus?
So würde das Protokoll die Beispielanfrage "finde Remote-Jobs mit React, prüfe meinen Kalender, bereite Bewerbungen vor, hake in fünf Tagen nach" festhalten:
09:02 plan search remote React roles, posted in last 7 days
09:02 browser navigate jobs board allow 42 listings (untrusted)
09:03 postgres read prefs allow remote, React, salary floor
09:03 calendar find_free_slots(14d) allow 6 slots
09:05 drive create_doc x5 allow 5 cover letters
09:05 gmail create_draft x5 ask waiting for user
09:41 approval user approved 4, rejected 1
09:42 browser submit application x4 allow 4 submitted
09:42 scheduler follow_up in 5 days allow job #8812
day 5 gmail search replies allow 1 reply, 3 silent
day 5 gmail create_draft x3 ask waiting for user
Jede Zeile mit ask ist eine Stelle, an der auch Sentinel in Muse angehalten hätte. Jede Zeile mit einer Jobnummer ist etwas, das ein Chatfenster allein nicht leisten kann.
Muse oder eigener Stack?
Nehmen Sie Muse, wenn Sie als Einzelperson Ergebnisse wollen und mit Metas Datenbedingungen, der Verfügbarkeit nur in den USA und der aktuellen Integrationsliste leben können.
Bauen Sie auf Claude und MCP, wenn der Agent in Ihrem Produkt leben, interne Systeme erreichen, Ihre Aufbewahrungsregeln einhalten oder später das Modell wechseln soll, ohne jede Integration neu zu schreiben.
Fazit
Sonnet 5.5 liefert einen Planer, der zum Preis der Mittelklasse nah am Spitzenmodell liegt. MCP macht aus der Tool-Schicht Konfiguration. Muses eigentlicher Vorsprung ist die Runtime: VM, Richtlinienagent, Tresor, Scheduler und Protokoll. Auf dieser Schicht werden Agenten-Produkte als Nächstes konkurrieren, und genau diese Schicht können Sie selbst bauen.