All Articles
7 minUpdated

क्या आप Claude Sonnet 5.5 और MCP से अपना Meta Muse बना सकते हैं?

AI एजेंटClaudeMCPआर्किटेक्चर

छोटा जवाब: Claude Sonnet 5.5 और MCP सर्वर आज Meta Muse के मॉडल और टूल वाले हिस्से को पूरा कर देते हैं। उनके आसपास का रनटाइम (पॉलिसी गेट, टोकन वॉल्ट, मेमोरी, जॉब क्यू, ऑडिट लॉग, इंजेक्शन से सुरक्षा और ब्राउज़र सैंडबॉक्स) आपको खुद लिखना होगा। इस लेख में हर हिस्सा और उन्हें जोड़ने वाला लूप दिखाया गया है।

डेवलपर्स को इस हफ़्ते के लॉन्च की परवाह क्यों करनी चाहिए?

दो लॉन्च तीन हफ़्ते के अंतर से आए। 8 सितंबर 2026 को मेटा ने Muse की घोषणा की, एक निजी एजेंट जो ब्राउज़ करता है, ईमेल भेजता है, ख़रीदारी करता है और ऐप बंद होने के बाद भी काम करता है। 28 सितंबर को Anthropic ने Claude Sonnet 5.5 जारी किया, कीमत 2 डॉलर प्रति मिलियन इनपुट टोकन और 10 डॉलर प्रति मिलियन आउटपुट टोकन, और कंप्यूटर-यूज़ बेंचमार्क OSWorld 2.1 पर 80.1% स्कोर।

अगर आप प्रोडक्ट बनाते हैं तो काम का सवाल यह है कि Muse का कितना हिस्सा आप अगले महीने अपने ऐप में डाल सकते हैं। मैंने Muse को उन हिस्सों में बाँटा जो मेटा ने सच में जारी किए, उन पर निशान लगाया जो आज Claude और MCP से पूरे होते हैं, और बाक़ी का ख़ाका कोड के रूप में बनाया।

मेटा ने असल में क्या जारी किया?

  • Muse Spark, यानी मॉडल।
  • Muse Secure VM: हर यूज़र के लिए एक अलग वर्चुअल मशीन, अपने ब्राउज़र और स्टोरेज के साथ।
  • Sentinel: एक अलग पॉलिसी एजेंट जो हर कनेक्टर अनुरोध और बाहर जाने वाली कॉल को अनुमति देता है, रोकता है या यूज़र से पूछता है।
  • ईमेल या ख़रीदारी से पहले मंज़ूरी, और पूरा ऑडिट ट्रेल।
  • दिनचर्या और एक बार कही बातों की मेमोरी, जो ख़ुद से सुझाव देने में काम आती है।
  • बैकग्राउंड में काम, जो ऐप बंद होने के बाद भी चलता है।
  • Stripe के Link से भुगतान, एक बार इस्तेमाल होने वाले कार्ड नंबर के साथ; Shop Pay और 1Password की घोषणा हो चुकी है।
  • प्लेटफ़ॉर्म: iOS, Android, वेब और WhatsApp, अमेरिका में रोलआउट।

इनमें सिर्फ़ पहली चीज़ मॉडल है। बाक़ी सात इंफ्रास्ट्रक्चर हैं।

Meta Muse के ब्राउज़र टास्क का एनिमेटेड चित्र: Secure VM, Sentinel और यूज़र की मंज़ूरी
Muse ब्राउज़र टास्क कैसे चलाता है: योजना, accessibility tree पढ़ना, फ़ॉर्म भरना, Sentinel जाँच, मंज़ूरी, ऑडिट लॉग।

Claude Sonnet 5.5 एजेंट को क्या देता है?

इस डिज़ाइन में Sonnet 5.5 योजनाकार है। एजेंट के लिए अहम आँकड़े ये हैं: Sonnet 5 से लगभग 30% तेज़ आउटपुट, कम टोकन और कम टूल कॉल की वजह से प्रति काम 30% तक कम लागत, OSWorld 2.1 पर 80.1% जबकि Opus 5.5 का 81.8%, बदले जा सकने वाले effort स्तर, और Claude API, AWS, Google Cloud और Microsoft Azure पर उपलब्धता। Lovable ने बताया कि बदलाव के बाद टूल कॉल लगभग एक तिहाई कम हो गए।

जो एजेंट एक काम में दर्जनों टूल कॉल करता है, उसके लिए कॉल में कमी बेंचमार्क के एक अंक से ज़्यादा मायने रखती है। हर बची हुई कॉल MCP सर्वर तक एक नेटवर्क चक्कर कम और नाकामी का एक मौक़ा कम है।

MCP शुरुआत से क्या-क्या सँभाल लेता है?

Model Context Protocol वह ओपन स्टैंडर्ड है जिसे Anthropic ने 2024 में बनाया और दिसंबर 2025 में Linux Foundation की Agentic AI Foundation को सौंपा। यह एजेंट को हर टूल तक पहुँचने का एक ही तरीक़ा देता है। Muse जैसे असिस्टेंट के लिए शुरुआती सेट ऐसा है:

ज़रूरतMCP सर्वरस्थिति
ईमेलGmail कनेक्टर या रिमोट सर्वरतैयार
कैलेंडरGoogle Calendarतैयार
दस्तावेज़Google Driveतैयार
ब्राउज़र@playwright/mcpतैयार, होस्ट आप करें
कोडgithub-mcp-serverतैयार
डेटा और मेमोरी रिकॉर्डPostgres सर्वरतैयार
अंदरूनी APITypeScript या Python SDK से छोटा कस्टम सर्वरआप लिखेंगे
Claude Sonnet 5.5 की टूल कॉल का MCP क्लाइंट से छह MCP सर्वर तक जाने का एनिमेटेड चित्र
एक बार में एक टूल कॉल: Claude टूल चुनता है, MCP क्लाइंट उसे भेजता है, सर्वर असली API को कॉल करता है, नतीजा कॉन्टेक्स्ट में लौटता है।

कौन से सात हिस्से आपको फिर भी लिखने हैं?

  1. पॉलिसी गेट। हर टूल को पढ़ने, लिखने या पैसे वाला बताएँ। पढ़ने की अनुमति दें, लिखने वाले काम मंज़ूरी की क्यू में भेजें, और सूची से बाहर की हर चीज़ रोक दें। शुरुआत के लिए tool_policies(tool, risk, requires_approval) टेबल काफ़ी है।
  2. टोकन वॉल्ट। हर यूज़र के refresh टोकन KMS या libsodium से एन्क्रिप्ट करें, वर्कर में रिफ़्रेश करें, और उन्हें कभी प्रॉम्प्ट में न डालें।
  3. मेमोरी। pgvector के साथ Postgres, एक memories टेबल जो हर बात का स्रोत और समय सहेजे, और सेटिंग्स का पेज जहाँ यूज़र एंट्री पढ़ और मिटा सके।
  4. जॉब। Redis पर BullMQ या SQS जैसी मैनेज्ड क्यू, और "पाँच दिन बाद" जैसे अनुरोधों के लिए शेड्यूलर।
  5. ऑडिट लॉग। सिर्फ़ जोड़ने वाली agent_events टेबल: काम, टूल, इनपुट हैश, नतीजे का सार, मंज़ूरी देने वाला और समय।
  6. इंजेक्शन से सुरक्षा। वेब से आए टूल नतीजों को अविश्वसनीय मानें। अविश्वसनीय सामग्री पढ़ने के बाद सिर्फ़ पढ़ने वाले टूल चलने दें, जब तक यूज़र अगले लिखने वाले काम को मंज़ूरी न दे।
  7. ब्राउज़र सैंडबॉक्स। हर यूज़र सेशन के लिए एक कंटेनर जिसमें Playwright चले, साथ में लाइव व्यू और तुरंत रोकने का बटन।
Muse जैसे एजेंट का आर्किटेक्चर: बीच में Claude Sonnet 5.5, MCP सर्वर, API, अलग ब्राउज़र, मेमोरी, वर्कर, पॉलिसी गेट और ऑडिट लॉग
पूरा स्टैक: बीच में मॉडल, और उसके चारों ओर वह सारा इंफ्रास्ट्रक्चर जो आप चलाते हैं।

न्यूनतम एजेंट लूप कैसा दिखता है?

यह TypeScript में रनटाइम का मुख्य हिस्सा है। ज़्यादातर काम मॉडल और MCP सर्वर करते हैं। लूप पॉलिसी जाँच, लॉग और ठहराव जोड़ता है।

import Anthropic from "@anthropic-ai/sdk";
const claude = new Anthropic();

export async function runTask(task: Task) {
  const messages = await memory.load(task.userId, task.goal);
  const tools = await mcp.listTools(task.userId); // tools from every connected MCP server

  for (let step = 0; step < 40; step++) {
    const res = await claude.messages.create({
      model: "claude-sonnet-5-5",
      max_tokens: 4096,
      tools,
      messages,
    });
    messages.push({ role: "assistant", content: res.content });
    if (res.stop_reason !== "tool_use") return finish(task, res);

    const results = [];
    for (const call of res.content.filter((b) => b.type === "tool_use")) {
      const verdict = policy.check(task.userId, call); // "allow" | "ask" | "deny"
      if (verdict === "ask") return queue.pauseForApproval(task, messages, call);
      const output = verdict === "allow"
        ? await mcp.callTool(task.userId, call.name, call.input)
        : "Blocked by policy.";
      await audit.log({ task: task.id, tool: call.name, verdict, output });
      results.push({ type: "tool_result", tool_use_id: call.id, content: output });
    }
    messages.push({ role: "user", content: results });
    await memory.checkpoint(task.id, messages);
  }
}

pauseForApproval बातचीत और लंबित कॉल को सहेज लेता है। जब यूज़र मंज़ूरी देता है, तो एक वर्कर वह कॉल चलाता है, नतीजा जोड़ता है और चेकपॉइंट से runTask फिर शुरू करता है। "ऐप बंद होने के बाद भी काम जारी" इसी छोटे फ़ंक्शन से होता है।

नौकरी खोजने वाला काम ऑडिट लॉग में कैसा दिखता है?

यह उदाहरण वाला अनुरोध है, "रिमोट React नौकरियाँ ढूँढो, कैलेंडर देखो, आवेदन तैयार करो, पाँच दिन बाद फ़ॉलो-अप करो", जैसा लॉग उसे दर्ज करेगा:

09:02  plan        search remote React roles, posted in last 7 days
09:02  browser     navigate jobs board        allow   42 listings (untrusted)
09:03  postgres    read prefs                 allow   remote, React, salary floor
09:03  calendar    find_free_slots(14d)       allow   6 slots
09:05  drive       create_doc x5              allow   5 cover letters
09:05  gmail       create_draft x5            ask     waiting for user
09:41  approval    user approved 4, rejected 1
09:42  browser     submit application x4      allow   4 submitted
09:42  scheduler   follow_up in 5 days        allow   job #8812
day 5  gmail       search replies             allow   1 reply, 3 silent
day 5  gmail       create_draft x3            ask     waiting for user

हर वह लाइन जिस पर ask है, ऐसी जगह है जहाँ Muse का Sentinel भी रुकता। हर वह लाइन जिस पर जॉब नंबर है, ऐसा काम है जो अकेली चैट विंडो नहीं कर सकती।

Muse इस्तेमाल करें या अपना स्टैक बनाएँ?

अगर आप एक व्यक्ति हैं जिसे नतीजा चाहिए, और मेटा की डेटा शर्तें, सिर्फ़ अमेरिका में उपलब्धता और मौजूदा इंटीग्रेशन आपके लिए ठीक हैं, तो Muse इस्तेमाल करें।

अगर एजेंट को आपके प्रोडक्ट के अंदर रहना है, अंदरूनी सिस्टम तक पहुँचना है, आपके डेटा रखने के नियम मानने हैं, या बाद में हर इंटीग्रेशन दोबारा लिखे बिना मॉडल बदलना है, तो Claude और MCP पर बनाएँ।

फ़ैसला

Sonnet 5.5 आपको ऐसा योजनाकार देता है जो मध्यम कीमत पर सबसे ऊपर वाले मॉडल के क़रीब है। MCP टूल की परत को कॉन्फ़िगरेशन बना देता है। Muse की असली बढ़त उसका रनटाइम है: VM, पॉलिसी एजेंट, वॉल्ट, शेड्यूलर और लॉग। एजेंट प्रोडक्ट्स का अगला मुक़ाबला इसी परत पर होगा, और यही वह परत है जिसे आप खुद बना सकते हैं।

स्रोत