Home الأخبار يُطلق Anthropic لأول مرة لعبة Claude Opus 5 مع أعلى معايير البرمجة...

يُطلق Anthropic لأول مرة لعبة Claude Opus 5 مع أعلى معايير البرمجة بنصف تكلفة المهمة | itg-ar.com

2
0
يُطلق Anthropic لأول مرة لعبة Claude Opus 5 مع أعلى معايير البرمجة بنصف تكلفة المهمة
| itg-ar.com
Claude logo artwork.Getty

يُطلق Anthropic لأول مرة لعبة Claude Opus 5 مع أعلى معايير البرمجة بنصف تكلفة المهمة

أطلقت Anthropic كلود أوبوس 5، وهو نموذج رئيسي جديد تقول الشركة إنه يقدم أداءً متطورًا في مهام البرمجة والعمل المعرفي بينما يكلف نفس تكلفة استخدامه مثل سابقه. النموذج متاح اليوم عبر منصات Anthropic بسعر 5 دولارات لكل مليون رمز إدخال و25 دولارًا لكل مليون رمز إخراج. وهو متوفر أيضًا في وضع أسرع يعمل بمعدل 2.5 مرة أسرع من الإعداد الافتراضي، على الرغم من أن هذا الخيار يكلف ضعف ذلك. تقول Anthropic إن Opus 5 مصمم للتعامل مع هندسة البرمجيات المعقدة وأتمتة الأعمال والبحث العلمي ومهام استخدام الكمبيوتر بشكل أكثر كفاءة. تضعه الشركة كنموذج للاستخدام اليومي وليس نموذجًا مخصصًا فقط لأحمال العمل الأكثر تطلبًا. في Frontier-Bench v0.1، وهو تقييم يركز على هندسة البرمجيات، أفادت التقارير أن Opus 5 تفوق على النماذج الأخرى التي تم اختبارها وضاعف أداء Opus 4.8 بتكلفة أقل لكل مهمة. بأقصى جهد على CursorBench 3.2، وصلت النتيجة إلى 0.5% من أعلى درجة حققها Claude Fable 5، بينما كانت تكلف نصف التكلفة لكل مهمة. نموذج جديد يدفع الأداء تمتد مكاسب الأداء إلى ما هو أبعد من البرمجة. تقول Anthropic إن Opus 5 سجل أعلى بثلاث مرات من ثاني أفضل نموذج في ARC-AGI 3، والذي يختبر مدى نجاح النماذج في حل المشكلات الجديدة. في Zapier AutomationBench، الذي يقيس ما إذا كانت النماذج يمكنها إكمال مهام العمل من البداية إلى النهاية، حقق Opus 5 حوالي 1.5 مرة معدل نجاح النموذج الأفضل التالي بنفس التكلفة لكل مهمة. تفوق النموذج أيضًا على الأنظمة الأخرى في OSWorld 2.0، وهو معيار لقدرات استخدام الكمبيوتر، متجاوزًا أفضل نتيجة لـ Fable 5 بما يزيد قليلاً عن ثلث التكلفة. تشير الأنثروبولوجية أيضًا إلى حدوث تحسينات في البحث العلمي، وخاصة في علوم الحياة. وفي اختبار الكيمياء العضوية الداخلي الذي يتضمن الهياكل الجزيئية المستنتجة من بيانات التحليل الطيفي، سجل Opus 5 أعلى بنسبة 10.2 نقطة مئوية من Opus 4.8. كما تحسنت بنسبة 7.7 نقطة مئوية في المهام التي تنطوي على تأثير اختلافات تسلسل البروتين على الوظيفة. وتقول الشركة إن النموذج أفضل أيضًا في التحقق من عمله والقيام بمحاولات متكررة عند فشل النهج الأولي. في أحد الاختبارات، تم إعطاء Opus 5 صورة لجزء من الآلة ولكن لم يكن هناك طريقة مباشرة لمشاهدتها وطُلب منه إعادة إنشاء الجزء كنموذج FreeCAD ثلاثي الأبعاد. وبدلاً من التوقف عند هذا الحد، يقال إن النموذج قام ببناء خط رؤية حاسوبي خاص به لاستخراج الهندسة من وحدات البكسل الأولية للصورة قبل إعادة بناء الجزء. وقالت أنثروبيك إنها نجحت مرارا وتكرارا، في حين فشلت النماذج المنافسة بعد خمس محاولات في ظل نفس الظروف. يتم أيضًا تقديم Opus 5 بتكلفة أقل وضمانات أقوى مع ضوابط أمان مصممة وفقًا لقدراتها المتنامية. تقول Anthropic إن هذا النموذج هو الأكثر توافقًا حتى الآن استنادًا إلى اختبار السلوك الآلي ولديه معدل سلوك خادع أقل من النماذج الحديثة. وقالت الشركة إن Opus 5 لا يزال متخلفًا عن نموذج Mythos 5 فيما يتعلق بقدرات الأمن السيبراني الهجومية. في حين أن النموذجين كانا قادرين بشكل مماثل على تحديد نقاط الضعف في البرامج في تقييم OSS-Fuzz الخاص بـ Anthropic، إلا أن Opus 5 كان أقل نجاحًا إلى حد كبير في تطوير عمليات الاستغلال. أضافت Anthropic أيضًا قيودًا أقوى حول بعض مهام الأمن السيبراني، بما في ذلك فحص الثغرات الأمنية الثنائية، واختبار الاختراق، وتوليد الثغرات. يمكن أن تعود الطلبات التي تم الإبلاغ عنها بواسطة أنظمة الأمان تلقائيًا إلى Opus 4.8. إلى جانب الإطلاق، تقدم Anthropic ميزات تجريبية تسمح للمطورين بتغيير الأدوات المتاحة في منتصف المحادثة دون إبطال ذاكرة التخزين المؤقت السريعة وتوجيه طلبات API التي تم وضع علامة عليها تلقائيًا إلى نموذج آخر. يعد Opus 5 الآن النموذج الافتراضي لـ Claude Max وأقوى نموذج متاح لمستخدمي Claude Pro.


تم النشر: 2026-07-24 19:41:00

مصدر: interestingengineering.com