Home تقنية لقد قمت بتقييم 36 خادم MCP مشهورًا من حيث سهولة استخدام الوكيل....

لقد قمت بتقييم 36 خادم MCP مشهورًا من حيث سهولة استخدام الوكيل. وحصل الثالث على D أو F | itg-ar.com

3
0
لقد قمت بتقييم 36 خادم MCP مشهورًا من حيث سهولة استخدام الوكيل. وحصل الثالث على D أو F
| itg-ar.com

لقد قمت بتقييم 36 خادم MCP مشهورًا من حيث سهولة استخدام الوكيل. وحصل الثالث على D أو F

21-07-2026AgentsMCPEngineering يمكن أن يكون خادم MCP الخاص بك متوافقًا مع المواصفات بنسبة 100% ولا يزال غير قابل للاستخدام بواسطة الوكيل. تخبرك مواصفات بروتوكول سياق النموذج بكيفية نقل الأدوات: تأطير JSON-RPC، والتفاوض على الإمكانيات، وأشكال المخطط. لا يذكر شيئًا عما إذا كان النموذج يمكنه بالفعل استخدام ما تقدمه – سواء كان يختار الأداة المناسبة من الكتالوج الخاص بك، أو يملأ الوسائط بشكل صحيح، أو يحرق 8 آلاف رمز مميز لتحليل المخططات الخاصة بك في كل طلب على حدة. أقوم بدمج موصلات MCP من الطرف الأول والثالث في وكيل ذكاء اصطناعي للإنتاج لكسب لقمة العيش، وظللت أرى نفس الفشل: الخوادم التي تجتاز كل فحص للامتثال، ومع ذلك يستدعي النموذج الأداة الخاطئة، أو يهلوس الحجج، أو يتجاهل الأداة تمامًا. لم تكن المشاكل أبدًا في طبقة البروتوكول. لقد كانت في الأجزاء التي لم يتطرق إليها أحد: الأوصاف، والتسمية، وتصميم المخطط. لذلك كتبت mcpgrade – بطاقة أداء على طراز المنارة لخوادم MCP. أمر واحد، بدون مفتاح API، تقرير في ثوانٍ: npx mcpgrade –stdio “npx -y your-mcp-server” ثم أشرت إلى 36 خادمًا شائعًا. لم تسر الأمور على ما يرام. النتائج جدول فرز كامل: (https://tengli.dev/mcp-leaderboard.html). النسخة القصيرة (تحليل ثابت، لقطة في الوقت المناسب؛ الخوادم التي تم وضع علامة عليها (مؤرشفة) هي تطبيقات مرجعية غير قابلة للصيانة، مضمنة لأنها لا تزال مثبتة ونسخها على نطاق واسع): أعلى الفئة (A): البحث الشجاع (المؤرشف)، exa، خرائط جوجل (المؤرشفة)، Slack (المؤرشفة)، Perplexity-ask، @shopify/dev-mcp، @apify/actors-mcp-server، airbnb، Figma-developer-mcp، وtavily، وgitlab (المؤرشفة)، و Elastic، وShrimp-task-manager، والمزيد — 15 من 36. أسفل الفصل (D/F)، 11 من 36 — وهي ليست مشاريع هواية: خادم MongoDB الرسمي (66، مع 66 خطأ)، خادم Notion الرسمي (62)، Airtable (69، 66 خطأ)، todoist-mcp-server (67، 110 خطأ)، والخادم المرجعي المؤرشف لـ GitHub (67، 44 خطأ)، وfirecrawl-mcp في الأسفل (57، 134 خطأ). لا يمكن فحص خادمين آخرين (Stripe وSupabase) باستخدام بيانات اعتماد وهمية وتم استبعادهما بدلاً من تصنيفهما. النتيجة 1: النظام البيئي لديه وباء معلمات غير موثقة تقريبًا كل خادم D/F لديه درجة وصف صفر بينما تكون درجات المخطط والتسمية والرمز المميز جيدة. هناك قاعدة واحدة تهيمن: D004 – لا تحتوي المعلمة على وصف. الزحف الناري: 132 من 134 خطأً هي معلمات غير موثقة. url، formats، jsonOptions — يحصل النموذج على اسم ونوع، ولا شيء آخر. تودويست: 110. MongoDB وAirtable: 66 لكل منهما. السبب الجذري واضح في مصدر جميعها تقريبًا: يتم إنشاء المخططات من تعريفات zod أو OpenAPI، ولا يضيف أحد .describe(). يعرف نظام الكتابة عنوان url: string. يحتاج النموذج إلى معرفة عنوان URL، وبأي تنسيق، وبأي قيود. يقوم منشئ المخطط الخاص بك بهدوء بتجريد الإشارة الأكثر أهمية التي تمتلكها أدواتك. إذا أخذت شيئًا واحدًا من هذا المنشور: افتح الخادم الخاص بك، واحسب المعلمات بدون وصف، وقم بإصلاحها. إنها أعلى ساعة نفوذ يمكنك إنفاقها على موثوقية الوكيل. النتيجة 2: إنه نظام التوثيق، وليس حجم الكتالوج – ولكن الحجم يجعل الانضباط أكثر صعوبة. لقد اقترح تمريري الأول لهذه البيانات “فوز الكتالوجات الصغيرة”: معظم الهدافين الذين يزيد عددهم عن 95 شخصًا لديهم عدد قليل من الأدوات، وتتجمع خوادم الأدوات التي يبلغ عددها 24-26 في D/F. ثم حصل مدير مهام الروبيان على درجة A/96 باستخدام 15 أداة – موثقة بعناية، ومسماة بإحكام، وكل وصف مميز. لذا فإن النسخة الصادقة: من الممكن وجود كتالوجات كبيرة موثقة جيدًا؛ إنهم نادرون فقط. كل أداة تضيفها هي وصف آخر للكتابة، واسم آخر يمكن أن يتعارض، ومخطط آخر يجب الحفاظ عليه. الانضباط لا يتسع بشكل افتراضي. (لا يزال الحجم يفرض عليك ضرائب في كلتا الحالتين: يتم إجراء تسلسل للكتالوج الكامل في كل طلب.) العثور على 3: الامتثال وسهولة الاستخدام هما محوران مختلفان، الخوادم الأكثر تحديثًا ليست هي الأكثر قابلية للاستخدام. حصل خادم Slack المرجعي المؤرشف – وهو رمز لا يحتفظ به أحد – على درجة A/97، لأن شخصًا ما قام بتوثيق كل أداة وكل معلمة يدويًا. وفي الوقت نفسه، تقوم العديد من الخوادم التجارية التي تم تطويرها بنشاط بشحن المعلمات بدون أي وصف على الإطلاق. تعتبر سهولة استخدام الوكيل مشكلة كتابة أكثر من كونها مشكلة هندسية. ولا يستطيع مدققو الامتثال قياسه. هذه هي الفجوة التي يملأها mcpgrade. (إحدى النقاط المقابلة المفعمة بالأمل: أثناء كتابة هذا، قامت شركة context7 بشحن إصدار جديد أصلح جميع أوصاف المعلمات المفقودة – حيث قفزت من لغة C إلى نتيجة ثابتة مثالية. يمكن للنظام البيئي أن يتحرك بسرعة عندما تكون الفجوة مرئية.) النتيجة 4: لقد تحققت من الدرجات الثابتة مقابل نموذج حقيقي. الرقم المخيف هو الرفض. Static Lint هو وكيل، لذلك قمت ببناء –eval: فهو يقوم بتجميع مهام واقعية ذات خطوة واحدة (كل منها يتضمن قيمًا محددة لكل معلمة مطلوبة)، ويعرض نموذجًا للكتالوج الكامل، ويقيس ما إذا كان يختار الأداة الصحيحة ويملأ الوسائط الصحيحة. تفاصيل ومنهجية المعايرة: docs/eval-calibration.md. التكلفة: قرشات لكل خادم على نموذج صغير. هناك نتيجتان تستحقان اهتمامك: النتائج الثابتة تتنبأ بالارتباك المباشر. على الخوادم الموثقة جيدًا، كانت دقة اختيار الأداة 100%. في الزحف الناري، انخفضت النسبة إلى 84% – وتهبط الأخطاء تمامًا على علامة القواعد الثابتة لتصادمات التسمية: extractscrape، agent_statuscheck_crawl_status، Feedbacksearch_feedback. كتالوجات غامضة كبيرة تكسر الرفض. نظرًا للمهام التي تقع خارج النطاق عمدًا، فقد انخفض النموذج بشكل صحيح بنسبة 100% من الوقت في الكتالوجات الصغيرة الموثقة جيدًا – ولكن بنسبة 50% فقط من الوقت في الأدوات غير الواضحة البالغ عددها 26 أداة. في نصف الوقت “وجدت” أداة معقولة وسمتها. في الإنتاج، هذا هو الوكيل الذي يفعل شيئًا ما عندما لا ينبغي له أن يفعل شيئًا – يمكن القول إن هذا هو أخطر وضع فشل على الإطلاق. كيف يبدو “الجيد” من أفضل الهدافين، قائمة مرجعية: كل وصف للأداة يجيب على ثلاثة أسئلة: ماذا تفعل، ومتى تستخدمها، وماذا ترجع. تحتوي كل معلمة على وصف بتنسيق وقيمة مثال واحدة. مجموعات القيمة الثابتة تعيش في التعداد، وليس في النثر. مطلوب تم الإعلان عنه بشكل صريح – حتى عندما يكون فارغًا. اصطلاح تسمية واحد، ونمط الفعل_الكائن، ولا توجد أفعال عامة، ولا توجد أسماء قريبة من التوأم. تقوم الأخطاء بتسمية المعلمة المفقودة/غير الصالحة حتى يتمكن النموذج من التصحيح الذاتي في دورة واحدة. جربه على الخادم الخاص بك npx mcpgrade –stdio “node ./my-server.js” # local stdio npx mcpgrade https://my-server.example/mcp # HTTP npx mcpgrade القابل للتدفق –خطأ في الفشل # بوابة CI npx mcpgrade –eval # اختبار النموذج المباشر (مفتاح BYO؛ أي نقطة نهاية متوافقة مع OpenAI تعمل) 24 قاعدة، لكل منها إصلاح ملموس ومبرر منطقي مرحبًا بكم في النزاع حول هذه القضايا – مجموعة القواعد مبنية على رأي حسب التصميم، وأنا أفضل أن يكون الجدال علنيًا. (كيف يختلف هذا عن mcp-lint وأدوات MCP QA الأخرى – مع مخرجات جنبًا إلى جنب: docs/comparison.md.) إذا احتفظت بأحد الخوادم أعلاه وقمت بإصلاح درجاتك، فافتح مشكلة إعادة الفحص – سأسعد بإعادة تشغيل الجدول وتحديثه. تغلب العلاقات العامة على الخوادم الخاصة بك على الحجج باستخدام مجموعة القواعد الخاصة بي. أقوم ببناء عمليات تكامل لوكلاء الذكاء الاصطناعي للإنتاج في شركة تكنولوجيا كبيرة؛ يعد mcpgrade مشروعًا شخصيًا ويعكس الندوب الناتجة عن دمج العشرات من موصلات MCP. لا يوجد أي انتماء لأي خادم في المرتبة أعلاه. ← جميع الكتابة (العلامات للترجمة)الصين، أخبار


تم النشر: 2026-07-22 06:51:00

مصدر: tengli.dev