تدفق 3
FLUX 3 متوفر الآن في الوصول المبكر. FLUX 3 هو نموذجنا الأساسي الجديد متعدد الوسائط. فهو يتعلم بشكل مشترك من الصور ومقاطع الفيديو والصوت ضمن بنية موحدة، لأن ما يحتاج إلى تعلمه ليس أيًا من هذه العناصر بمعزل عن الآخر. بدلًا من ذلك، يجب أن يتعلم النموذج تمثيل العالم: كيف تتماسك الأشياء معًا، وكيف تتحرك الأشياء، وكيف تبدو الأحداث. ولا توجد طريقة واحدة توفر وصفًا كاملاً. كل منها عبارة عن إسقاط لنفس الواقع الأساسي، يتم التقاطه بواسطة أجهزة استشعار مختلفة، ويفقد كل منها بعض المعلومات في هذه العملية. تلتقط الصور الهياكل والعلاقات المكانية في نقطة زمنية محددة. تستعيد مقاطع الفيديو بُعد الزمن وتكشف عن الديناميكيات الزمنية والقوانين الفيزيائية. يكشف الصوت عن علاقات سببية بين الظواهر الميكانيكية والصوتيات التي لا تستطيع الرؤية وحدها اكتشافها. تربط اللغة هذه التصورات بالأهداف والتجريدات والتعليمات. وتعلم من أحد هذه التصورات وستحصل على نموذج جيد لهذا الإسقاط. تعلم منها جميعًا في وقت واحد، وستخبرك قيودها المتبادلة بالمزيد: يجب أن يتوافق الصوت مع التأثير، ويجب أن تخضع الحركة للكتلة، ويجب أن يتبع المستقبل الماضي. تتوقف الطرائق عن الانفصال وتبدأ في كونها دليلاً على حقيقة أساسية واحدة. فلوكس 3 هو نموذجنا الأول المبني بالكامل على هذا المبدأ، ونقطة تفتيش في مهمتنا لتطوير الذكاء البصري في العالم الحقيقي: النماذج التي تدرك وتتنبأ وتتصرف عبر البيئات المادية والرقمية. تشير النتائج المبكرة في إنشاء المحتوى والذكاء الاصطناعي المادي إلى أن هذا هو المسار الصحيح. FLUX 3: نموذج واحد وقدرات متعددة. يعتمد FLUX 3 على التدفق الذاتي، وهو نهجنا لمواءمة إنشاء الوسائط المتعددة والفهم بكفاءة ضمن نفس البنية الأساسية. استنادًا إلى هذا النهج، قمنا بتوسيع موارد الحوسبة والبيانات بشكل كبير لتدريب FLUX 3 عبر الفيديو والصور والصوت في نفس الوقت. التدفق الذاتي مقابل مطابقة التدفق (FM). على اليسار: خطأ التوليد (مسافة فريشيه) لكل طريقة، تم تطبيع كل منها إلى FM = 100 (الأقل هو الأفضل). على اليمين: متوسط معدل النجاح في مهام المعالجة على أربع مجموعات مهام من خلال الضبط الدقيق (الأعلى هو الأفضل). القدرات والتقييمات المبكرة ونتيجة لذلك، فإن FLUX 3 قادر على مزج الطرائق وتوليد الصور والفيديو + الصوت معًا؛ سواء من خلال مطالبات النص الخالص أو عند توفير مراجع الإدخال مثل الصور والفيديو. نحن نسلط الضوء على عدد قليل من القدرات الرئيسية للنموذج أدناه. يمكن لـ VideoFLUX 3 إنشاء مقاطع فيديو متنوعة للغاية مع صوت يصل طوله إلى 20 ثانية في جيل واحد. وتشمل قدراته الأساسية ما يلي (جميع المخرجات تأتي مع توليد الصوت الأصلي): إنشاء نص إلى فيديو. إنشاء صورة إلى فيديو، إما الاستمرار من إطار البداية (“الرسوم المتحركة”) أو استخدام الصور كمراجع مرئية. إنشاء فيديو إلى فيديو من مقطع مرجعي، يحمل العناصر المركزية للفيديو المصدر – على سبيل المثال، نفس الشخصية – في مشهد أو سياق جديد. استمرار فيديو وصوت مولد من إدخال الفيديو والصوت. إنشاء إطار رئيسي إلى فيديو للانتقالات التي يمكن التحكم فيها بين اللحظات المحددة. حوار متعدد اللغات. مجموعة واسعة من الأنماط المرئية ونسب العرض إلى الارتفاع، تمتد إلى ما هو أبعد من الإخراج السينمائي التقليدي. تسلسل فعال للمقاطع الفردية إلى تسلسلات أطول ومتعددة اللقطات. تنوع عالي الأسلوب – يتعامل FLUX 3 Video بسهولة مع نطاقات من الأنماط من لقطات كاميرا الفيديو الصريحة إلى الرسوم المتحركة و سينمائية.توليد طباعة قوية وتصميمات متحركة. بالنسبة للتحليل الأولي أدناه، قمنا بإنشاء مقاطع فيديو مدتها 10 ثوانٍ بدقة 720 بكسل مع الصوت. التقييمات مبكرة ونتوقع المزيد من التحسينات نظرًا لأن النموذج والأداة المحيطة به لا تزال قيد التطوير، فإن هذه النتائج أولية، ونتوقع المزيد من التحسينات خلال مرحلة الوصول المبكر. عبر التقييمات المبكرة، تم تفضيل FLUX 3 على Grok Imagine Video في ما يصل إلى 69% من المقارنات، وKling v3 Pro في 60%، وHappy Horse v1 في 59%، وHappy Horse 1.1 في 57%، وSeedance 2.0 وGemini Omni Flash في 52%. تم تفضيل FLUX 3 على Runway Gen-4.5 في 77% من المقارنات وعلى Luma Ray 3.2 في 93% من المقارنات. بينما لا يزال FLUX 3 Video قيد التطوير، فهو بالفعل قوي بشكل خاص في التقاط تعبيرات الوجه البشرية، وربط الأصوات بالأحداث الجسدية، وإمكانيات متعددة اللغات. علاوة على ذلك، يمكن دمج هذه الإمكانات لإنشاء تسلسلات تدوم عدة دقائق، حيث تساعد المراجع المرئية على ضمان بقاء الشخصيات متسقة عبر جميع المشاهد. يتوفر الآن فيديو FLUX 3 في الوصول المبكر هنا. يمكن لـ ImageFLUX 3 تجميع الصور وتحريرها في مجموعة واسعة من الأنماط ونسب العرض إلى الارتفاع ودرجات الدقة. في التقييمات الأولية التي تم إجراؤها أثناء التدريب المتوسط، يُظهر FLUX 3 بالفعل تحسنًا كبيرًا مقارنة بالإصدارات السابقة من FLUX: لقد تحسنت قدرته على التعامل مع المطالبات المعقدة وإنشاء النص بشكل ملحوظ. يُنتج النموذج نطاقًا واسعًا من أنماط الإخراج (راجع النماذج التالية)، وهو قادر على تقديم نص عالي الدقة بلغات متعددة. وكما هو الحال مع تقييمات الفيديو، فهذه نتائج أولية، ونتوقع المزيد من التحسينات قبل الإصدار. سنفتح مرحلة الوصول المبكر لصورة FLUX 3 في الأسابيع التالية. ويمتد الفهم العالمي لـ ActionFLUX 3 إلى التنبؤ بالعمل. لقد اتخذنا طريقين لتحقيق ذلك: دمج التنبؤ بالإجراء الأصلي في FLUX 3 مباشرة، وتوسيع نطاق عملنا الأولي في Self-Flow؛ واستخدام العمود الفقري للفيديو المُدرب مسبقًا كأساس مدرك للديناميكيات يمكن ضبط نماذج العمل المتخصصة منه ببيانات محدودة خاصة بالمهمة. بالنسبة للثانية، كانت mimic robotics واحدة من أوائل الشركاء الذين حصلوا على وصول مبكر إلى FLUX 3. قمنا معًا بتطوير FLUX-mimic، وهو نموذج حركة فيديو يجمع بين العمود الفقري FLUX 3 وخبرة mimic في تعلم الروبوت من أجل التلاعب الماهر ونشر الإنتاج. اقرأ أطروحتنا حول سبب تشغيل الذكاء الاصطناعي المادي وإنشاء المحتوى على نفس الأساس، وكيف يتم اختباره على مهام إنتاج حقيقية في Audi. خطة الإطلاق على مدار الأسابيع والأشهر القليلة المقبلة، سنوفر القدرات التالية، كل منها بعد مرحلة الوصول المبكر لضمان التشغيل السلس وجمع التعليقات واختبار السلامة الصارم. يتم إنشاء جميع الإمكانات من نفس نموذج مطابقة التدفق متعدد الوسائط الأساسي. تتضمن هذه القدرات والنماذج ما يلي: إنشاء الفيديو والصوت وتحريرهما من خلال واجهات برمجة التطبيقات والوصول إلى الوزن الخاص. (“فيديو FLUX 3”) التنبؤ بالحركة من خلال شركاء بحثيين وتجاريين مختارين، بدءًا من محاكاة الروبوتات (“FLUX-mimic وFLUX 3 Action”) تركيب الصور وتحريرها من خلال واجهات برمجة التطبيقات والوصول إلى الوزن الخاص. (“FLUX 3 Image”) وصول مفتوح الوزن إلى العمود الفقري متعدد الوسائط لإنشاء المحتوى (الفيديو والصوت والصورة) والتنبؤ بالإجراء. (“FLUX 3 Dev”) سنقوم أيضًا بإصدار المزيد من التفاصيل الفنية حول النهج الأساسي. طلب الوصول المبكر هنا ما هي الخطوة التالية؟ لقد بدأنا للتو في خدش سطح النماذج المتعددة الوسائط المتعددة الاستخدامات والقادرة والموحدة، وما الذي ستمكنه. من تحرير الصور والفيديو التفاعلي، والمحاكاة إلى استخدام الكمبيوتر والذكاء الاصطناعي الفعلي، فإن الحدود مفتوحة على مصراعيها. وبينما نطرح هذه الإمكانات الجديدة تدريجيًا، فإننا نعمل بالفعل على نماذج الجيل التالي. هدفنا هو توحيد الإدراك الحسي والتنبؤ بالحركة واللغة في نفس النموذج الموحد. إذا كنت مهتمًا بالاستكشاف والبناء باستخدام FLUX 3، تواصل معنا هنا. إذا كنت مهتمًا بالمساهمة في مهمتنا، انضم إلينا! نحن نوظف في ألمانيا والولايات المتحدة.
تم النشر: 2026-07-24 07:17:00
مصدر: bfl.ai








