مبتكر DDIM ورئيس العلماء السابق في Luma AI، ساعدت أعماله في تسريع أخذ العينات بالانتشار في تحويل نماذج الانتشار من فضول أكاديمي إلى محرك صناعة الذكاء الاصطناعي التوليدي.
| تاريخ الميلاد | حوالي 1994، الصين |
| الجنسية | صيني |
| المنصب الحالي | مستقل (اعتبارًا من يونيو 2026)؛ سابقًا Luma AI (رئيس العلماء) |
| مجالات البحث | نماذج الانتشار، النماذج التوليدية القائمة على الدرجات، التوليد متعدد الوسائط والفيديو، التحسين البايزي، التعلم المعزز، التعلم بالمحاكاة |
| المشرف على الدكتوراه | ستيفانو إرمون |
| أطروحة الدكتوراه | الضغط والتوليد والاستدلال عبر التعلم الخاضع للإشراف (جامعة ستانفورد، 2021) |
| الموقع الإلكتروني | tsong.me |
| X / تويتر | @baaadas |
| GitHub | jiamings |
| Google Scholar | Jiaming Song — أكثر من 35,900 استشهاد |
نظرة عامة
جيامينغ سونغ هو باحث صيني في الذكاء الاصطناعي التوليدي، اشتهر بإنشاء DDIM (نماذج الانتشار الضمنية لإزالة الضوضاء)، وهو المُسرِّع الذي جعل نماذج الانتشار مجدية حسابيًا على نطاق الإنتاج وأصبح مكونًا قياسيًا في أنظمة تشمل Stable Diffusion و DALL·E 2 و Imagen. تلقى تدريبه في جامعة تسينغهوا وستانفورد، حيث عمل تحت إشراف ستيفانو إرمون، واكتسب سمعة في الجمع بين النظرية الاحتمالية العميقة والرؤية الهندسية عالية التأثير. بعد فترة ما بعد الدكتوراه في ستانفورد وفترة في NVIDIA Research، انضم إلى Luma AI كرئيس للعلماء، حيث قاد فريق البحث عبر ثلاثة محاور منتج متتالية – من إعادة البناء ثلاثي الأبعاد إلى توليد الفيديو إلى النمذجة متعددة الوسائط الموحدة – وبلغت ذروتها في نموذج الفيديو Dream Machine (Ray) ونظام الاستدلال متعدد الوسائط Uni-1. غادر Luma AI في منتصف عام 2026، مع عدم الكشف عن وجهته التالية.
النشأة والتعليم
تلقى سونغ تعليمه الجامعي في جامعة تسينغهوا، حيث حصل على بكالوريوس الهندسة في علوم وتكنولوجيا الكمبيوتر بين عامي 2012 و 2016. تخرج بمرتبة الشرف المتميزة (أعلى 1% من فصله)، وحصل على منحة Zhong Shimo – أعلى منحة استحقاق في قسم علوم الكمبيوتر (أعلى 0.75%) – بالإضافة إلى منحة Google للتميز (تُمنح لـ 58 طالبًا في جميع أنحاء الصين) ومنحة Qualcomm للبحث الاستثنائي. امتد تقديره المبكر إلى الرياضيات التنافسية والحوسبة: حصل على الميدالية البرونزية في الأولمبياد الوطني للمعلوماتية في عام 2011، وحصل على الفائز المتميز (أعلى 0.3%) في مسابقة النمذجة متعددة التخصصات في عام 2015. خلال سنوات دراسته الجامعية، كان باحثًا زائرًا في مبادرة المعلومات بجامعة ديوك (صيف 2015)، حيث عمل على شبكات المعتقدات السينية الزمنية، مما يشير إلى توجه مبكر نحو النماذج التوليدية الاحتمالية.
في سبتمبر 2016، التحق سونغ بـ جامعة ستانفورد لدراسة الدكتوراه في علوم الكمبيوتر، وانضم إلى المجموعة البحثية للبروفيسور ستيفانو إرمون في مختبر ستانفورد للذكاء الاصطناعي. طورت أطروحته، الضغط والتوليد والاستدلال عبر التعلم الخاضع للإشراف، إطارًا موحدًا لتعلم التوزيعات المعقدة دون الحاجة إلى تسوية صريحة، وربطت بين النمذجة التوليدية القائمة على الدرجات، والنماذج الاحتمالية الضمنية، وتطبيقاتها على المشكلات العكسية. خلال فترة الدكتوراه، تدرب في OpenAI (صيف 2017)، حيث عمل على تجريد المهارات القابلة للتفسير من اللغة، وفي Facebook AI Research (صيف 2018)، وساهم في عد الأشياء على نطاق واسع من صور الأقمار الصناعية. أكمل الدكتوراه في سبتمبر 2021 وبقي في ستانفورد كباحث ما بعد الدكتوراه تحت إشراف إرمون لمدة عام إضافي (حتى يونيو 2022).
المسيرة المهنية
جامعة ستانفورد، مجموعة إرمون (2016–2022)
جاءت أهم مساهمات سونغ في مرحلة الدراسات العليا في أكتوبر 2020 مع نشر نماذج الانتشار الضمنية لإزالة الضوضاء (DDIM) على arXiv، بالمشاركة مع تشينلين مينغ وستيفانو إرمون، وعُرضت في ICLR 2021. في ذلك الوقت، كانت نماذج الانتشار الاحتمالية لإزالة الضوضاء (DDPMs) تتطلب محاكاة سلسلة ماركوف المكونة من 1000 خطوة أو أكثر لتوليد صورة واحدة، مما يجعلها غير عملية لمعظم عمليات النشر الإنتاجي. كانت رؤية سونغ الرئيسية هي أن هدف التدريب لنماذج DDPMs متوافق مع عائلة أوسع من عمليات الانتشار غير الماركوفية التي يمكن حل خطواتها العكسية بعدد أقل بكثير من التكرارات. قلل DDIM خطوات أخذ العينات المطلوبة بنسبة تصل إلى 50 ضعفًا مع الحفاظ على جودة الصورة وإدخال قدرة جديدة: أخذ العينات الحتمي الذي يتيح الاستيفاء الدلالي في الفضاء الكامن. أصبحت الورقة واحدة من أكثر الأعمال استشهادًا في تاريخ الذكاء الاصطناعي التوليدي، وتم دمج أداة أخذ العينات DDIM بشكل شبه عالمي في الأنظمة اللاحقة بما في ذلك Stable Diffusion و DALL·E 2 و Imagen و Midjourney.
تشمل المساهمات الهامة الأخرى في فترة الدكتوراه SDEdit (ICLR 2022)، وهي طريقة لتوليف وتحرير الصور تعتمد على مسبقات نماذج الانتشار والتي مكنت توليد الصور الموجه بالضربات دون تدريب عدائي؛ و DDRM (نماذج ترميم الانتشار بإزالة الضوضاء، NeurIPS 2022)، والتي وسعت نماذج الانتشار إلى المشكلات العكسية الخطية العامة بما في ذلك الدقة الفائقة وإزالة الضبابية والملء؛ و D2C (نماذج الانتشار وإزالة الضوضاء للتوليد المشروط بقليل من الأمثلة، NeurIPS 2021). حصل على جائزة الورقة المتميزة في ICLR 2022 عن خط عمل منفصل — „مقارنة التوزيعات عن طريق قياس الاختلافات التي تؤثر على اتخاذ القرار“ — مما يدل على نطاق يتجاوز النمذجة التوليدية البحتة.
كطالب ما بعد الدكتوراه (2021–2022)، واصل سونغ النشر عند تقاطع التحسين البايزي والنماذج التوليدية، بما في ذلك „وصفة عامة للتحسين البايزي الخالي من الاحتمالية“ (ICML 2022 Long Oral، أعلى 2.2%).
NVIDIA Research (يونيو 2022 – حوالي 2023)
انضم سونغ إلى NVIDIA Research كعالم أبحاث، وركز على نماذج الانتشار للتوليد متعدد الوسائط وأبحاث النماذج الأساسية. هناك شارك في تأليف eDiff-I: نماذج الانتشار من النص إلى الصورة مع مجموعة من خبراء إزالة الضوضاء (TMLR 2023)، والتي أظهرت أن المراحل المختلفة لعملية أخذ عينات الانتشار تستفيد من خبرة النموذج المتخصص واقترحت إطارًا عمليًا لمزيج من مزيلات الضوضاء لتوليف عالي الدقة من النص إلى الصورة.
Luma AI، رئيس العلماء (حوالي 2023 – يونيو 2026)
انضم سونغ إلى Luma AI كرئيس للعلماء بينما كانت الشركة تتحول من جذورها في إعادة البناء ثلاثي الأبعاد القائم على مجالات الإشعاع العصبي (NeRF) نحو الفيديو التوليدي والذكاء الاصطناعي متعدد الوسائط. قاد البحث عبر مجموعة النمذجة الكاملة — الهندسة المعمارية، والبنية التحتية للتدريب، وخطوط أنابيب البيانات — عبر ثلاث مراحل منتج متتالية.
Genie كان خط التوليد ثلاثي الأبعاد من Luma، حيث طبق تقنيات قائمة على الانتشار لتوليف الأشياء والمشاهد القابلة للتحكم. قاد سونغ الانتقال من هذه القاعدة إلى توليد الفيديو.
Ray / Dream Machine (أُطلق للجمهور في يونيو 2024) هي عائلة نماذج توليد الفيديو من Luma، وركزت على التماسك الزمني، والحركة الواعية بالكاميرا، والتحكم الإبداعي من مطالبات النص أو الصورة. اجتذبت Dream Machine أكثر من مليون مستخدم في غضون أربعة أيام من الإصدار. أسس النموذج Luma AI كلاعب رائد في مجال توليد فيديو الذكاء الاصطناعي إلى جانب Sora (OpenAI) و Gen-3 (Runway) و Kling (Kuaishou). لهذا العمل، تم تسمية سونغ في قائمة مبتكري MIT Technology Review تحت 35 عامًا في عام 2024.
Uni-1 (أُطلق في 2025) هو نموذج الاستدلال متعدد الوسائط الموحد من Luma لتوليف الصور وتحريرها، المبني حول فهم النية، والاستدلال المكاني، والتوليد الموجه بالمراجع، والإبداع البصري الواعي ثقافيًا — مما يمثل تحرك Luma نحو الذكاء الاصطناعي متعدد الوسائط الموجه بالوكالة والأوامر.
إلى جانب عمله على المنتج، واصل سونغ النشر حول مشاكل النمذجة التوليدية الأساسية. في أوائل عام 2025 شارك في تأليف „أفكار في تحجيم وقت الاستدلال يمكن أن تفيد خوارزميات التدريب المسبق التوليدية“ (مع لينكي تشو)، مجادلًا ضد الانقسام الزائف بين الانحدار التلقائي والانتشار واقترحًا أن خرائط التدفق يمكن أن تمكن الحساب في وقت الاستدلال من تحسين جودة التدريب المسبق التوليدي — وهو خط تفكير شرحه أيضًا في مقالته „تحجيم وقت الاستدلال للتدريب المسبق التوليدي.“ شارك في تأليف „مطابقة اللحظة الاستقرائية“ (مع لينكي تشو وستيفانو إرمون) و„مطابقة السرعة النهائية“، وكلاهما يطور نظرية تدريب النموذج التوليدي الفعال.
أكد سونغ مغادرته من Luma AI في يونيو 2026. يصفه موقعه الشخصي بأنه يبني „أنظمة ذكاء اصطناعي متعددة الوسائط للذكاء العام“، ولم يتم الإعلان عن مشروعه أو منصبه التالي علنًا حتى وقت كتابة هذا التقرير.
المساهمات الرئيسية
- DDIM (نماذج الانتشار الضمنية لإزالة الضوضاء) — قدمت فئة من عمليات الانتشار غير الماركوفية التي تعيد استخدام تدريب DDPM الحالي مع تمكين أخذ عينات أسرع بمقدار 10-50 ضعفًا والاستيفاء الكامن الحتمي؛ تم اعتمادها عالميًا تقريبًا في أنظمة توليد الصور الإنتاجية بما في ذلك Stable Diffusion و DALL·E 2 و Imagen و Midjourney. تراكمت الورقة أكثر من 35,900 استشهاد عبر الملف الأكاديمي لسونغ؛ DDIM وحده من بين أكثر الأوراق استشهادًا في التعلم العميق الحديث.
- SDEdit: توليف الصور الموجه عبر المعادلات التفاضلية العشوائية (ICLR 2022) — مكن تحرير الصور الموجه بالضربات والمراجع من خلال مسبقات الانتشار دون تدريب عدائي أو نماذج خاصة بالمهمة، مما فتح خطًا من أبحاث التوليد القابلة للتحكم بتأثير واسع في المراحل اللاحقة.
- DDRM: نماذج ترميم الانتشار بإزالة الضوضاء (NeurIPS 2022) — وسعت إطار الانتشار إلى عائلة المشكلات العكسية الخطية (إزالة الضبابية، الدقة الفائقة، الملء)، متفوقة على الطرق غير الخاضعة للإشراف السابقة في جودة إعادة البناء والإخلاص الإدراكي بسرعة أكبر 5 مرات.
- eDiff-I (TMLR 2023) — اقترحت بنية مجموعة من خبراء إزالة الضوضاء لتوليد النص إلى الصورة، مما أظهر أن خطوات إزالة الضوضاء المختلفة تستفيد من شبكات متخصصة؛ ساهمت في خارطة طريق NVIDIA للذكاء الاصطناعي التوليدي.
- Dream Machine / Ray (Luma AI, 2024) — قاد الأبحاث حول نموذج توليد الفيديو الذي تبناه المبدعون على نطاق واسع واعتُبر نقلة نوعية في فيديو الذكاء الاصطناعي المتسق مع الكاميرا والمعقول فيزيائيًا؛ وصل إلى أكثر من مليون مستخدم في أربعة أيام من الإطلاق.
- Uni-1 (Luma AI, 2025) — قاد تطوير نموذج متعدد الوسائط موحد يجمع فهم الصورة وتوليدها وتحريرها تحت بنية واحدة موجهة بقصد اللغة الطبيعية.
- تحجيم وقت الاستدلال للتدريب المسبق التوليدي (2025) — اتجاه بحثي ناشئ يجادل بأن الحوسبة في وقت الاستدلال يمكن أن تحسن بشكل منهجي التدريب المسبق القائم على الانتشار والتدفق، مع آثار مماثلة لتحجيم سلسلة الفكر في نماذج اللغة.
الجوائز والتقدير
- مبتكرون تحت 35 من MIT Technology Review — آسيا والمحيط الهادئ (2024) — تم تقديره لقيادة تطوير Dream Machine والمساهمات الرائدة في توليد فيديو الذكاء الاصطناعي على نطاق واسع.
- جائزة الورقة المتميزة في ICLR 2022 — عن „مقارنة التوزيعات عن طريق قياس الاختلافات التي تؤثر على اتخاذ القرار“، وهي إحدى الأوراق الأعلى تقديرًا في المؤتمر الدولي لتمثيلات التعلم.
- عرض ICML 2022 Long Oral (أعلى 2.2%) — عن „وصفة عامة للتحسين البايزي الخالي من الاحتمالية.“
- زمالة الابتكار من Qualcomm (2018) — واحد من ثمانية متلقين على المستوى الوطني عن مشروع „التعلم بالمحاكاة الآمن متعدد الوكلاء للقيادة الذاتية.“
- منحة Qualcomm، جامعة تسينغهوا (2016) — تُمنح لأفضل 1% من طلاب تسينغهوا الجامعيين لمخرجات بحثية استثنائية.
- منحة Google للتميز (2015) — تُمنح لـ 58 طالبًا جامعيًا ودراسات عليا في جميع أنحاء الصين للتميز الأكاديمي والبحثي.
- الفائز المتميز، مسابقة النمذجة متعددة التخصصات (2015) — أعلى 0.3% عالميًا.
- طالب جامعي متميز، رابطة الحاسوب الصينية (2014) — واحد من اثنين من المتلقين في جامعة تسينغهوا.
- منحة Zhong Shimo، قسم علوم الكمبيوتر بجامعة تسينغهوا (2013) — أعلى منحة على مستوى القسم، أعلى 0.75%.
- الميدالية البرونزية، الأولمبياد الوطني للمعلوماتية (2011) — تقدير وطني في البرمجة التنافسية.
العلاقات الرئيسية
- ستيفانو إرمون — مشرف الدكتوراه وما بعد الدكتوراه في ستانفورد؛ أستاذ علوم الكمبيوتر وقائد مجموعة النمذجة الاحتمالية في مختبر ستانفورد للذكاء الاصطناعي. مكن عمل إرمون التأسيسي على النماذج التوليدية القائمة على الدرجات بشكل مباشر من DDIM، وقد واصل الاثنان المشاركة في التأليف طوال مسيرة سونغ بما في ذلك ورقة مطابقة اللحظة الاستقرائية لعام 2025.
- تشينلين مينغ — أقرب متعاون في فترة الدكتوراه ومؤلف مشارك أول لكل من DDIM و SDEdit؛ الآن باحثة في ستانفورد ومؤسسة شركة ناشئة مستقلة. كان الاثنان القوة الدافعة الرئيسية وراء العديد من الأوراق الأكثر تأثيرًا التي خرجت من مجموعة إرمون.
- يانغ سونغ — باحث متداخل في مجموعة إرمون شكل عمله على النماذج التوليدية القائمة على الدرجات عبر المعادلات التفاضلية العشوائية (ICLR 2021 أفضل ورقة) المكمل النظري في الزمن المستمر لـ DDIM الخاص بجيامينغ سونغ؛ عمل الاثنان بالتوازي على ما أصبح الأساس المزدوج لأدبيات نماذج الانتشار الحديثة.
- لينكي تشو — متعاون متكرر مؤخرًا (مطابقة السرعة النهائية، مطابقة اللحظة الاستقرائية، تحجيم وقت الاستدلال)؛ زميل سابق في Luma AI وشريك بحثي مستمر بعد المغادرة.
- أمبريش راوات / فريق Luma AI — تعاون عبر محاور المنتج Genie → Ray → Uni-1؛ كانت قيادة سونغ البحثية في Luma مكملة بفريق هندسي متمكن مكن من ترجمة النموذج إلى منتج.
الأسلوب الشخصي
يحتل سونغ موقعًا نادرًا في مشهد الذكاء الاصطناعي التوليدي كشخص قدم مساهمات نظرية تأسيسية حقيقية — DDIM يعيد كتابة رياضيات أخذ عينات الانتشار، وليس فقط تنفيذها — مع إظهار غرائز المنتج لتوجيه شركة من خلال محاور استراتيجية متعددة كاملة. كتاباته المنشورة، بما في ذلك مقالة مارس 2025 حول تحجيم وقت الاستدلال، ملحوظة لاستعدادها لتحدي الإجماع: فهو يجادل بأن المعارضة بين نهج الانحدار التلقائي والانتشار هي انقسام زائف، وأن الأهداف القائمة على التدفق تفتح أراضي نظرية جديدة للتدريب المسبق. حضوره على X / تويتر تحت الاسم @baaadas متفرق لكنه دقيق، بما يتفق مع باحث يفضل التحدث من خلال العمل. يشير الخيط الموحد من جوائز تسينغهوا التنافسية، من خلال الأناقة المقتضبة لاشتقاق DDIM، إلى أوراقه النظرية الأخيرة حول مطابقة اللحظة والسرعة إلى تفضيل مستمر لإيجاد أنقى بنية رياضية تحت مشكلة تبدو معقدة.
المراجع
- الموقع الشخصي: tsong.me
- السيرة الذاتية على Hello.cv: hello.cv/quchao-1
- Google Scholar: scholar.google.com/citations?user=6dP660cAAAAJ
- DBLP: dblp.org/pid/173/5104.html
- Semantic Scholar: semanticscholar.org/author/Jiaming-Song/51453887
- أطروحة ستانفورد: purl.stanford.edu/zy983tp3399 (سجل DBLP لـ الضغط والتوليد والاستدلال عبر التعلم الخاضع للإشراف)
- ورقة DDIM (ICLR 2021): arxiv.org/abs/2010.02502
- مبتكرون تحت 35 من MIT Technology Review (2024): innovatorsunder35.com/the-list/jiaming-song
- Luma AI Uni-1: lumalabs.ai/uni-1
- Luma AI Ray: lumalabs.ai/ray
- المدونة: „تحجيم وقت الاستدلال للتدريب المسبق التوليدي“: tsong.me/blog/inference-time-scaling