क्या आप Claude Sonnet 5.5 और MCP से अपना Meta Muse बना सकते हैं?
छोटा जवाब: Claude Sonnet 5.5 और MCP सर्वर आज Meta Muse के मॉडल और टूल वाले हिस्से को पूरा कर देते हैं। उनके आसपास का रनटाइम (पॉलिसी गेट, टोकन वॉल्ट, मेमोरी, जॉब क्यू, ऑडिट लॉग, इंजेक्शन से सुरक्षा और ब्राउज़र सैंडबॉक्स) आपको खुद लिखना होगा। इस लेख में हर हिस्सा और उन्हें जोड़ने वाला लूप दिखाया गया है।
डेवलपर्स को इस हफ़्ते के लॉन्च की परवाह क्यों करनी चाहिए?
दो लॉन्च तीन हफ़्ते के अंतर से आए। 8 सितंबर 2026 को मेटा ने Muse की घोषणा की, एक निजी एजेंट जो ब्राउज़ करता है, ईमेल भेजता है, ख़रीदारी करता है और ऐप बंद होने के बाद भी काम करता है। 28 सितंबर को Anthropic ने Claude Sonnet 5.5 जारी किया, कीमत 2 डॉलर प्रति मिलियन इनपुट टोकन और 10 डॉलर प्रति मिलियन आउटपुट टोकन, और कंप्यूटर-यूज़ बेंचमार्क OSWorld 2.1 पर 80.1% स्कोर।
अगर आप प्रोडक्ट बनाते हैं तो काम का सवाल यह है कि Muse का कितना हिस्सा आप अगले महीने अपने ऐप में डाल सकते हैं। मैंने Muse को उन हिस्सों में बाँटा जो मेटा ने सच में जारी किए, उन पर निशान लगाया जो आज Claude और MCP से पूरे होते हैं, और बाक़ी का ख़ाका कोड के रूप में बनाया।
मेटा ने असल में क्या जारी किया?
- Muse Spark, यानी मॉडल।
- Muse Secure VM: हर यूज़र के लिए एक अलग वर्चुअल मशीन, अपने ब्राउज़र और स्टोरेज के साथ।
- Sentinel: एक अलग पॉलिसी एजेंट जो हर कनेक्टर अनुरोध और बाहर जाने वाली कॉल को अनुमति देता है, रोकता है या यूज़र से पूछता है।
- ईमेल या ख़रीदारी से पहले मंज़ूरी, और पूरा ऑडिट ट्रेल।
- दिनचर्या और एक बार कही बातों की मेमोरी, जो ख़ुद से सुझाव देने में काम आती है।
- बैकग्राउंड में काम, जो ऐप बंद होने के बाद भी चलता है।
- Stripe के Link से भुगतान, एक बार इस्तेमाल होने वाले कार्ड नंबर के साथ; Shop Pay और 1Password की घोषणा हो चुकी है।
- प्लेटफ़ॉर्म: iOS, Android, वेब और WhatsApp, अमेरिका में रोलआउट।
इनमें सिर्फ़ पहली चीज़ मॉडल है। बाक़ी सात इंफ्रास्ट्रक्चर हैं।
Claude Sonnet 5.5 एजेंट को क्या देता है?
इस डिज़ाइन में Sonnet 5.5 योजनाकार है। एजेंट के लिए अहम आँकड़े ये हैं: Sonnet 5 से लगभग 30% तेज़ आउटपुट, कम टोकन और कम टूल कॉल की वजह से प्रति काम 30% तक कम लागत, OSWorld 2.1 पर 80.1% जबकि Opus 5.5 का 81.8%, बदले जा सकने वाले effort स्तर, और Claude API, AWS, Google Cloud और Microsoft Azure पर उपलब्धता। Lovable ने बताया कि बदलाव के बाद टूल कॉल लगभग एक तिहाई कम हो गए।
जो एजेंट एक काम में दर्जनों टूल कॉल करता है, उसके लिए कॉल में कमी बेंचमार्क के एक अंक से ज़्यादा मायने रखती है। हर बची हुई कॉल MCP सर्वर तक एक नेटवर्क चक्कर कम और नाकामी का एक मौक़ा कम है।
MCP शुरुआत से क्या-क्या सँभाल लेता है?
Model Context Protocol वह ओपन स्टैंडर्ड है जिसे Anthropic ने 2024 में बनाया और दिसंबर 2025 में Linux Foundation की Agentic AI Foundation को सौंपा। यह एजेंट को हर टूल तक पहुँचने का एक ही तरीक़ा देता है। Muse जैसे असिस्टेंट के लिए शुरुआती सेट ऐसा है:
| ज़रूरत | MCP सर्वर | स्थिति |
|---|---|---|
| ईमेल | Gmail कनेक्टर या रिमोट सर्वर | तैयार |
| कैलेंडर | Google Calendar | तैयार |
| दस्तावेज़ | Google Drive | तैयार |
| ब्राउज़र | @playwright/mcp | तैयार, होस्ट आप करें |
| कोड | github-mcp-server | तैयार |
| डेटा और मेमोरी रिकॉर्ड | Postgres सर्वर | तैयार |
| अंदरूनी API | TypeScript या Python SDK से छोटा कस्टम सर्वर | आप लिखेंगे |
कौन से सात हिस्से आपको फिर भी लिखने हैं?
- पॉलिसी गेट। हर टूल को पढ़ने, लिखने या पैसे वाला बताएँ। पढ़ने की अनुमति दें, लिखने वाले काम मंज़ूरी की क्यू में भेजें, और सूची से बाहर की हर चीज़ रोक दें। शुरुआत के लिए
tool_policies(tool, risk, requires_approval)टेबल काफ़ी है। - टोकन वॉल्ट। हर यूज़र के refresh टोकन KMS या libsodium से एन्क्रिप्ट करें, वर्कर में रिफ़्रेश करें, और उन्हें कभी प्रॉम्प्ट में न डालें।
- मेमोरी। pgvector के साथ Postgres, एक
memoriesटेबल जो हर बात का स्रोत और समय सहेजे, और सेटिंग्स का पेज जहाँ यूज़र एंट्री पढ़ और मिटा सके। - जॉब। Redis पर BullMQ या SQS जैसी मैनेज्ड क्यू, और "पाँच दिन बाद" जैसे अनुरोधों के लिए शेड्यूलर।
- ऑडिट लॉग। सिर्फ़ जोड़ने वाली
agent_eventsटेबल: काम, टूल, इनपुट हैश, नतीजे का सार, मंज़ूरी देने वाला और समय। - इंजेक्शन से सुरक्षा। वेब से आए टूल नतीजों को अविश्वसनीय मानें। अविश्वसनीय सामग्री पढ़ने के बाद सिर्फ़ पढ़ने वाले टूल चलने दें, जब तक यूज़र अगले लिखने वाले काम को मंज़ूरी न दे।
- ब्राउज़र सैंडबॉक्स। हर यूज़र सेशन के लिए एक कंटेनर जिसमें Playwright चले, साथ में लाइव व्यू और तुरंत रोकने का बटन।
न्यूनतम एजेंट लूप कैसा दिखता है?
यह TypeScript में रनटाइम का मुख्य हिस्सा है। ज़्यादातर काम मॉडल और MCP सर्वर करते हैं। लूप पॉलिसी जाँच, लॉग और ठहराव जोड़ता है।
import Anthropic from "@anthropic-ai/sdk";
const claude = new Anthropic();
export async function runTask(task: Task) {
const messages = await memory.load(task.userId, task.goal);
const tools = await mcp.listTools(task.userId); // tools from every connected MCP server
for (let step = 0; step < 40; step++) {
const res = await claude.messages.create({
model: "claude-sonnet-5-5",
max_tokens: 4096,
tools,
messages,
});
messages.push({ role: "assistant", content: res.content });
if (res.stop_reason !== "tool_use") return finish(task, res);
const results = [];
for (const call of res.content.filter((b) => b.type === "tool_use")) {
const verdict = policy.check(task.userId, call); // "allow" | "ask" | "deny"
if (verdict === "ask") return queue.pauseForApproval(task, messages, call);
const output = verdict === "allow"
? await mcp.callTool(task.userId, call.name, call.input)
: "Blocked by policy.";
await audit.log({ task: task.id, tool: call.name, verdict, output });
results.push({ type: "tool_result", tool_use_id: call.id, content: output });
}
messages.push({ role: "user", content: results });
await memory.checkpoint(task.id, messages);
}
}
pauseForApproval बातचीत और लंबित कॉल को सहेज लेता है। जब यूज़र मंज़ूरी देता है, तो एक वर्कर वह कॉल चलाता है, नतीजा जोड़ता है और चेकपॉइंट से runTask फिर शुरू करता है। "ऐप बंद होने के बाद भी काम जारी" इसी छोटे फ़ंक्शन से होता है।
नौकरी खोजने वाला काम ऑडिट लॉग में कैसा दिखता है?
यह उदाहरण वाला अनुरोध है, "रिमोट React नौकरियाँ ढूँढो, कैलेंडर देखो, आवेदन तैयार करो, पाँच दिन बाद फ़ॉलो-अप करो", जैसा लॉग उसे दर्ज करेगा:
09:02 plan search remote React roles, posted in last 7 days
09:02 browser navigate jobs board allow 42 listings (untrusted)
09:03 postgres read prefs allow remote, React, salary floor
09:03 calendar find_free_slots(14d) allow 6 slots
09:05 drive create_doc x5 allow 5 cover letters
09:05 gmail create_draft x5 ask waiting for user
09:41 approval user approved 4, rejected 1
09:42 browser submit application x4 allow 4 submitted
09:42 scheduler follow_up in 5 days allow job #8812
day 5 gmail search replies allow 1 reply, 3 silent
day 5 gmail create_draft x3 ask waiting for user
हर वह लाइन जिस पर ask है, ऐसी जगह है जहाँ Muse का Sentinel भी रुकता। हर वह लाइन जिस पर जॉब नंबर है, ऐसा काम है जो अकेली चैट विंडो नहीं कर सकती।
Muse इस्तेमाल करें या अपना स्टैक बनाएँ?
अगर आप एक व्यक्ति हैं जिसे नतीजा चाहिए, और मेटा की डेटा शर्तें, सिर्फ़ अमेरिका में उपलब्धता और मौजूदा इंटीग्रेशन आपके लिए ठीक हैं, तो Muse इस्तेमाल करें।
अगर एजेंट को आपके प्रोडक्ट के अंदर रहना है, अंदरूनी सिस्टम तक पहुँचना है, आपके डेटा रखने के नियम मानने हैं, या बाद में हर इंटीग्रेशन दोबारा लिखे बिना मॉडल बदलना है, तो Claude और MCP पर बनाएँ।
फ़ैसला
Sonnet 5.5 आपको ऐसा योजनाकार देता है जो मध्यम कीमत पर सबसे ऊपर वाले मॉडल के क़रीब है। MCP टूल की परत को कॉन्फ़िगरेशन बना देता है। Muse की असली बढ़त उसका रनटाइम है: VM, पॉलिसी एजेंट, वॉल्ट, शेड्यूलर और लॉग। एजेंट प्रोडक्ट्स का अगला मुक़ाबला इसी परत पर होगा, और यही वह परत है जिसे आप खुद बना सकते हैं।