All Articles
7 minUpdated

کیا آپ Claude Sonnet 5.5 اور MCP سے اپنا Meta Muse بنا سکتے ہیں؟

AI ایجنٹسClaudeMCPآرکیٹیکچر

مختصر جواب: Claude Sonnet 5.5 اور MCP سرورز آج Meta Muse کا ماڈل اور ٹولز والا حصہ پورا کر دیتے ہیں۔ ان کے گرد رن ٹائم (پالیسی گیٹ، ٹوکن والٹ، یادداشت، جاب قطار، آڈٹ لاگ، انجیکشن سے حفاظت اور براؤزر سینڈ باکس) آپ کو خود لکھنا ہوگا۔ اس تحریر میں ہر حصہ اور انہیں جوڑنے والا لوپ دکھایا گیا ہے۔

ڈیولپرز کو اس ہفتے کے لانچز کی پروا کیوں کرنی چاہیے؟

دو لانچ تین ہفتوں کے فرق سے آئے۔ 8 ستمبر 2026 کو میٹا نے Muse کا اعلان کیا، ایک ذاتی ایجنٹ جو براؤز کرتا ہے، ای میل بھیجتا ہے، خریداری کرتا ہے اور ایپ بند ہونے کے بعد بھی کام کرتا ہے۔ 28 ستمبر کو Anthropic نے Claude Sonnet 5.5 جاری کیا، قیمت 2 ڈالر فی ملین ان پٹ ٹوکن اور 10 ڈالر فی ملین آؤٹ پٹ ٹوکن، اور کمپیوٹر یوز بینچ مارک OSWorld 2.1 پر 80.1% اسکور۔

اگر آپ پروڈکٹس بناتے ہیں تو کام کا سوال یہ ہے کہ Muse کا کتنا حصہ آپ اگلے مہینے اپنی ایپ میں شامل کر سکتے ہیں۔ میں نے Muse کو ان حصوں میں بانٹا جو میٹا نے واقعی جاری کیے، ان پر نشان لگایا جو آج Claude اور MCP سے پورے ہوتے ہیں، اور باقی کا خاکہ کوڈ کی شکل میں بنایا۔

میٹا نے اصل میں کیا جاری کیا؟

  • Muse Spark، یعنی ماڈل۔
  • Muse Secure VM: ہر صارف کے لیے ایک الگ ورچوئل مشین، اپنے براؤزر اور اسٹوریج کے ساتھ۔
  • Sentinel: ایک الگ پالیسی ایجنٹ جو ہر کنیکٹر درخواست اور باہر جانے والی کال کو اجازت دیتا ہے، روکتا ہے یا صارف سے پوچھتا ہے۔
  • ای میل یا خریداری سے پہلے منظوری، اور مکمل آڈٹ ٹریل۔
  • معمولات اور ایک بار کی باتوں کی یادداشت، جو خود سے تجاویز دینے میں کام آتی ہے۔
  • بیک گراؤنڈ میں کام جو ایپ بند ہونے کے بعد بھی چلتا ہے۔
  • Stripe کے Link سے ادائیگی، ایک بار استعمال ہونے والے کارڈ نمبرز کے ساتھ؛ Shop Pay اور 1Password کا اعلان ہو چکا ہے۔
  • پلیٹ فارمز: iOS، Android، ویب اور WhatsApp، امریکہ میں رول آؤٹ۔

ان میں صرف پہلی چیز ماڈل ہے۔ باقی سات انفراسٹرکچر ہیں۔

Meta Muse کے براؤزر ٹاسک کا متحرک خاکہ: Secure VM، Sentinel اور صارف کی منظوری
Muse براؤزر ٹاسک کیسے چلاتا ہے: منصوبہ، accessibility tree پڑھنا، فارم بھرنا، Sentinel چیک، صارف کی منظوری، آڈٹ لاگ۔

Claude Sonnet 5.5 ایجنٹ کو کیا دیتا ہے؟

اس ڈیزائن میں Sonnet 5.5 منصوبہ ساز ہے۔ ایجنٹ کے لیے اہم اعداد یہ ہیں: Sonnet 5 سے تقریباً 30% تیز آؤٹ پٹ، کم ٹوکن اور کم ٹول کالز کی وجہ سے فی کام 30% تک کم لاگت، OSWorld 2.1 پر 80.1% جبکہ Opus 5.5 کا 81.8%، effort کی قابلِ تبدیل سطحیں، اور Claude API، AWS، Google Cloud اور Microsoft Azure پر دستیابی۔ Lovable نے بتایا کہ تبدیلی کے بعد ٹول کالز تقریباً ایک تہائی کم ہو گئیں۔

جو ایجنٹ ایک کام میں درجنوں ٹول کالز کرتا ہو، اس کے لیے کالز میں کمی بینچ مارک کے ایک پوائنٹ سے زیادہ اہم ہے۔ ہر بچائی گئی کال MCP سرور تک ایک نیٹ ورک چکر کم اور ناکامی کا ایک موقع کم ہے۔

MCP شروع سے کیا کچھ سنبھال لیتا ہے؟

Model Context Protocol وہ اوپن اسٹینڈرڈ ہے جو Anthropic نے 2024 میں بنایا اور دسمبر 2025 میں Linux Foundation کی Agentic AI Foundation کے حوالے کیا۔ یہ ایجنٹ کو ہر ٹول تک پہنچنے کا ایک ہی طریقہ دیتا ہے۔ Muse جیسے اسسٹنٹ کے لیے ابتدائی سیٹ یوں ہے:

ضرورتMCP سرورحالت
ای میلGmail کنیکٹر یا ریموٹ سرورتیار
کیلنڈرGoogle Calendarتیار
دستاویزاتGoogle Driveتیار
براؤزر@playwright/mcpتیار، ہوسٹ آپ کریں
کوڈgithub-mcp-serverتیار
ڈیٹا اور یادداشت کے ریکارڈPostgres سرورتیار
اندرونی APIsTypeScript یا Python SDK سے چھوٹا کسٹم سرورآپ لکھیں گے
Claude Sonnet 5.5 کی ٹول کالز کا MCP کلائنٹ کے ذریعے چھ MCP سرورز تک جانے کا متحرک خاکہ
ایک وقت میں ایک ٹول کال: Claude ٹول چنتا ہے، MCP کلائنٹ اسے آگے بھیجتا ہے، سرور اصل API کو کال کرتا ہے، نتیجہ کانٹیکسٹ میں واپس آتا ہے۔

کون سے سات حصے آپ کو پھر بھی لکھنے ہیں؟

  1. پالیسی گیٹ۔ ہر ٹول کو پڑھنے، لکھنے یا پیسے والا قرار دیں۔ پڑھنے کی اجازت دیں، لکھنے والے کام منظوری کی قطار میں بھیجیں، اور فہرست سے باہر ہر چیز روک دیں۔ آغاز کے لیے tool_policies(tool, risk, requires_approval) ٹیبل کافی ہے۔
  2. ٹوکن والٹ۔ ہر صارف کے refresh ٹوکن KMS یا libsodium سے انکرپٹ کریں، ورکر میں ریفریش کریں، اور انہیں کبھی پرامپٹ میں نہ ڈالیں۔
  3. یادداشت۔ pgvector کے ساتھ Postgres، ایک memories ٹیبل جو ہر بات کا ذریعہ اور وقت محفوظ کرے، اور سیٹنگز کا صفحہ جہاں صارف اندراجات پڑھ اور مٹا سکے۔
  4. جابز۔ Redis پر BullMQ یا SQS جیسی منیجڈ قطار، اور "پانچ دن بعد" جیسی درخواستوں کے لیے شیڈیولر۔
  5. آڈٹ لاگ۔ صرف اضافے والی agent_events ٹیبل: کام، ٹول، ان پٹ ہیش، نتیجے کا خلاصہ، منظوری دینے والا اور وقت۔
  6. انجیکشن سے حفاظت۔ ویب سے آنے والے ٹول نتائج کو غیر معتبر قرار دیں۔ غیر معتبر مواد پڑھنے کے بعد صرف پڑھنے والے ٹولز چلنے دیں جب تک صارف اگلے لکھنے والے کام کی منظوری نہ دے۔
  7. براؤزر سینڈ باکس۔ ہر صارف سیشن کے لیے ایک کنٹینر جس میں Playwright چلے، ساتھ لائیو ویو اور فوری بند کرنے کا بٹن۔
Muse جیسے ایجنٹ کا آرکیٹیکچر: درمیان میں Claude Sonnet 5.5، MCP سرورز، APIs، الگ براؤزر، یادداشت، ورکرز، پالیسی گیٹ اور آڈٹ لاگ
پورا اسٹیک: درمیان میں ماڈل، اور اس کے گرد سب کچھ وہ انفراسٹرکچر جو آپ چلاتے ہیں۔

کم سے کم ایجنٹ لوپ کیسا ہوتا ہے؟

یہ TypeScript میں رن ٹائم کا مرکزی حصہ ہے۔ زیادہ تر کام ماڈل اور MCP سرورز کرتے ہیں۔ لوپ پالیسی چیک، لاگ اور وقفہ شامل کرتا ہے۔

import Anthropic from "@anthropic-ai/sdk";
const claude = new Anthropic();

export async function runTask(task: Task) {
  const messages = await memory.load(task.userId, task.goal);
  const tools = await mcp.listTools(task.userId); // tools from every connected MCP server

  for (let step = 0; step < 40; step++) {
    const res = await claude.messages.create({
      model: "claude-sonnet-5-5",
      max_tokens: 4096,
      tools,
      messages,
    });
    messages.push({ role: "assistant", content: res.content });
    if (res.stop_reason !== "tool_use") return finish(task, res);

    const results = [];
    for (const call of res.content.filter((b) => b.type === "tool_use")) {
      const verdict = policy.check(task.userId, call); // "allow" | "ask" | "deny"
      if (verdict === "ask") return queue.pauseForApproval(task, messages, call);
      const output = verdict === "allow"
        ? await mcp.callTool(task.userId, call.name, call.input)
        : "Blocked by policy.";
      await audit.log({ task: task.id, tool: call.name, verdict, output });
      results.push({ type: "tool_result", tool_use_id: call.id, content: output });
    }
    messages.push({ role: "user", content: results });
    await memory.checkpoint(task.id, messages);
  }
}

pauseForApproval گفتگو اور زیرِ التوا کال محفوظ کر لیتا ہے۔ جب صارف منظوری دیتا ہے تو ایک ورکر وہ کال چلاتا ہے، نتیجہ جوڑتا ہے اور چیک پوائنٹ سے runTask دوبارہ شروع کرتا ہے۔ "ایپ بند ہونے کے بعد بھی کام جاری" اسی چھوٹے فنکشن سے ممکن ہوتا ہے۔

نوکری تلاش کرنے کا کام آڈٹ لاگ میں کیسا دکھتا ہے؟

یہ مثال والی درخواست ہے، "ریموٹ React نوکریاں ڈھونڈو، کیلنڈر دیکھو، درخواستیں تیار کرو، پانچ دن بعد فالو اپ کرو"، جیسے لاگ اسے درج کرے گا:

09:02  plan        search remote React roles, posted in last 7 days
09:02  browser     navigate jobs board        allow   42 listings (untrusted)
09:03  postgres    read prefs                 allow   remote, React, salary floor
09:03  calendar    find_free_slots(14d)       allow   6 slots
09:05  drive       create_doc x5              allow   5 cover letters
09:05  gmail       create_draft x5            ask     waiting for user
09:41  approval    user approved 4, rejected 1
09:42  browser     submit application x4      allow   4 submitted
09:42  scheduler   follow_up in 5 days        allow   job #8812
day 5  gmail       search replies             allow   1 reply, 3 silent
day 5  gmail       create_draft x3            ask     waiting for user

ہر وہ لائن جس پر ask ہے، ایسی جگہ ہے جہاں Muse کا Sentinel بھی رکتا۔ ہر وہ لائن جس پر جاب نمبر ہے، ایسا کام ہے جو صرف چیٹ ونڈو خود نہیں کر سکتی۔

Muse استعمال کریں یا اپنا اسٹیک بنائیں؟

اگر آپ ایک فرد ہیں جسے نتیجہ چاہیے، اور میٹا کی ڈیٹا شرائط، صرف امریکہ میں دستیابی اور موجودہ انٹیگریشنز آپ کے لیے ٹھیک ہیں تو Muse استعمال کریں۔

اگر ایجنٹ کو آپ کی پروڈکٹ کے اندر رہنا ہے، اندرونی سسٹمز تک پہنچنا ہے، آپ کے ڈیٹا رکھنے کے اصول ماننے ہیں، یا بعد میں ہر انٹیگریشن دوبارہ لکھے بغیر ماڈل بدلنا ہے، تو Claude اور MCP پر بنائیں۔

فیصلہ

Sonnet 5.5 آپ کو ایسا منصوبہ ساز دیتا ہے جو درمیانی قیمت پر سب سے اوپر والے ماڈل کے قریب ہے۔ MCP ٹولز کی تہہ کو کنفیگریشن بنا دیتا ہے۔ Muse کی اصل برتری اس کا رن ٹائم ہے: VM، پالیسی ایجنٹ، والٹ، شیڈیولر اور لاگ۔ ایجنٹ پروڈکٹس کا اگلا مقابلہ اسی تہہ پر ہوگا، اور یہی وہ تہہ ہے جو آپ خود بنا سکتے ہیں۔

ذرائع