باحث ياباني في مجال الذكاء الاصطناعي شارك في قيادة تطوير GPT-J ومجموعات بيانات LAION، ونشر أول حجة تجريبية للتدريب الأمثل حسابيًا لمرحلة واحدة في عام 2019، وشارك في اقتراح “sparse upcycling” في Google Research، وأنشأ أحد أكثر حسابات مشاركة الأبحاث تأثيرًا في مجتمع الباحثين.
الملف الشخصي
| الجنسية | ياباني |
| الجهة الحالية | باحث مستقل (ما بعد الدكتوراه) |
| مجالات البحث | نماذج اللغة الكبيرة، قوانين القياس، خليط الخبراء، الذكاء الاصطناعي مفتوح المصدر، الذكاء الاصطناعي التوليدي، مجموعات بيانات الصور والنصوص |
| أطروحة الدكتوراه | دكتوراه في التعلم الآلي (معهد جورجيا للتكنولوجيا، 2023) |
| المدونة | arankomatsuzaki.wordpress.com |
| X / تويتر | @arankomatsuzaki (بالإنجليزية)؛ @arank_jp (باللغة اليابانية) |
| GitHub | AranKomat |
| Google Scholar | Aran Komatsuzaki |
نظرة عامة
أران كوماتسوزاكي (小松崎 あらん) هو باحث ياباني في مجال الذكاء الاصطناعي أكمل درجة الدكتوراه في التعلم الآلي في معهد جورجيا للتكنولوجيا في عام 2023، وكان نشطًا في أبحاث الذكاء الاصطناعي التوليدي منذ عام 2017، مع التركيز على قدرات بنيات مفكك التشفير المحول. اشتهر بالمشاركة في قيادة تطوير GPT-J في عام 2021 — وهو نموذج لغة مفتوح المصدر بـ 6 مليارات معلمة كان، في ذلك الوقت، أول نموذج متاح للجمهور يطابق أداء GPT-3 — وبالمشاركة في قيادة إنشاء LAION-400M، أول مجموعة بيانات مفتوحة المصدر واسعة النطاق للصور والنصوص، والتي أصبحت بنية تحتية أساسية لتدريب Stable Diffusion و Imagen من Google. وقبل ذلك بعام، في عام 2019، نشر ورقة بعنوان „One Epoch Is All You Need“، وهي طبعة أولية أظهرت الكفاءة الحسابية للتدريب لمرحلة واحدة مع مجموعات بيانات موسعة — وهي حجة مبكرة ومهملة إلى حد كبير لما أصبح يُعرف لاحقًا باسم القياس الأمثل حسابيًا، والذي تمت صياغته في ورقة Chinchilla لعام 2022. خلال فترة تدريب داخلي في Google Research في عام 2022، شارك في اقتراح “sparse upcycling”، وهي تقنية لتحويل النماذج الكثيفة المدربة مسبقًا إلى بنيات خليط الخبراء بتكلفة إضافية منخفضة. بالتوازي مع مسيرته البحثية، بنى حضورًا على وسائل التواصل الاجتماعي يضم أكثر من 100,000 متابع من خلال المشاركة المنهجية للأوراق البحثية، ووثقت دراسة من جامعة كاليفورنيا في سانتا باربرا لعام 2024 تأثيره — إلى جانب @_akhaliq — على أنماط الاقتباس والاتجاهات البحثية عبر مجتمع الذكاء الاصطناعي.
النشأة والتعليم
كوماتسوزاكي ياباني وانتقل إلى الولايات المتحدة للدراسات العليا، والتحق ببرنامج الدكتوراه في التعلم الآلي في معهد جورجيا للتكنولوجيا (ML@GT). أكمل درجة الدكتوراه في عام 2023. لا يتم تأكيد المشرف على أطروحة الدكتوراه بشكل علني في المصادر المتاحة. يحافظ على حضور ثنائي اللغة (الإنجليزية واليابانية)، مما يعكس تفاعله مع كل من مجتمع أبحاث الذكاء الاصطناعي الدولي الناطق باللغة الإنجليزية ومجتمع الذكاء الاصطناعي الياباني.
المسيرة المهنية
الأبحاث المستقلة وقوانين القياس المبكرة (2017–2020)
بدأ كوماتسوزاكي مشاركته في أبحاث الذكاء الاصطناعي التوليدي في عام 2017، قبل وقت قصير من ورقة GPT الأصلية، ووصف تركيزه منذ البداية بأنه استكشاف القدرة الكاملة لمفكك التشفير المحول. كانت مساهمته المبكرة الأكثر أهمية هي الطبعة الأولية „One Epoch Is All You Need“ (arXiv:1906.06669، يونيو 2019)، والتي جادلت بأن الممارسة القياسية لتدريب الشبكات العصبية على مجموعات بيانات صغيرة لعدة عصور — مع تنظيم ثقيل وأحجام نماذج عشوائية — كانت مضيعة من الناحية الحسابية. أظهرت الورقة أنه يمكن تقليل حساب التدريب بشكل كبير من خلال توسيع مجموعة البيانات، والتدريب لعصر واحد أو بضعة عصور فقط، وتخفيف التنظيم، وتحسين عدد المعلمات وعدد رموز التدريب بشكل مشترك كدالة لميزانية الحوسبة. كانت هذه أول حجة قائمة على الأدلة التجريبية لما سيصبح بعد ثلاث سنوات معروفًا على نطاق واسع باسم القياس الأمثل حسابيًا أو قياس „Chinchilla“، وقد وصف كوماتسوزاكي هذه الطبعة الأولية بأنها الأولى التي توضح المبادئ الأساسية.
EleutherAI — باحث رئيسي (2020–2023)
كان كوماتسوزاكي عضوًا مبكرًا ومركزيًا في EleutherAI، وهو مجموعة شعبية من الباحثين المتطوعين التي تشكلت في عام 2020 بهدف إضفاء الطابع الديمقراطي على الوصول إلى أبحاث نماذج اللغة الكبيرة. كان أول إنتاج رئيسي لـ EleutherAI هو The Pile، وهو مجموعة نصوص بحجم 825 غيغابايت تم تجميعها من مصادر متنوعة — بما في ذلك GitHub و PubMed Central و FreeLaw و Stack Exchange — مصممة لتحسين تنوع بيانات تدريب GPT-3. ساهم كوماتسوزاكي في مجموعة البيانات ومنطق تنظيمها.
GPT-J (2021). في مايو 2021، أصدرت EleutherAI GPT-J-6B — وهو نموذج لغة انحداري بـ 6 مليارات معلمة تم تدريبه على The Pile باستخدام إطار عمل mesh-transformer-jax الخاص ببن وانغ. شارك كوماتسوزاكي في قيادة التطوير، وساهم في تصميم التجارب والمنشورات التقنية على المدونة. كان النموذج أول نموذج لغة متاح للجمهور يطابق أداء GPT-3 على معايير اللقطات الصفرية والقليلة، وتم إصداره بأوزان كاملة بموجب ترخيص مفتوح. أصبح واحدًا من أكثر نماذج اللغة مفتوحة المصدر تحميلاً في تلك الفترة، وكان بمثابة الأساس للعديد من النماذج المضبوطة في تطبيقات الرعاية الصحية والقانونية والعلمية.
LAION-400M (2021). بالتوازي مع ذلك، شارك كوماتسوزاكي في قيادة إنشاء LAION-400M (الشبكة المفتوحة واسعة النطاق للذكاء الاصطناعي)، وهي مجموعة بيانات مكونة من 400 مليون زوج من الصور والنصوص تمت تصفيتها باستخدام درجات تشابه CLIP من مسح أوسع للإنترنت. تم إصدار مجموعة البيانات في أواخر عام 2021، وكانت أول مجموعة بيانات مفتوحة المصدر للصور والنصوص على النطاق اللازم لتدريب نماذج من فئة CLIP من الصفر. تم استخدامها مباشرة في تدريب Stable Diffusion (Stability AI) وتم الاستشهاد بها كبنية تحتية تدريبية أساسية لـ Imagen من Google. امتد إصدار LAION-5B اللاحق ليشمل 5.85 مليار زوج.
هندسة المطالبات — خدعة Unreal Engine (مايو 2021). في 31 مايو 2021، نشر كوماتسوزاكي تغريدة أظهر فيها أن إضافة عبارة „Unreal Engine" إلى مطالبات توليد الصور يحسن بشكل كبير الجودة المرئية للمخرجات من تخليق الصور VQGAN+CLIP. أصبحت التغريدة واحدة من أوائل العروض واسعة الانتشار لهندسة المطالبات لتوليد الصور، وتم نسخها على نطاق واسع عبر مجتمعات الفن بالذكاء الاصطناعي، ويُنسب إليها تعميم مفهوم تحسين الجودة القائم على الكلمات المفتاحية في نماذج النص إلى الصورة. وقد وصف نفسه بأنه أحد أوائل المدافعين عن هندسة المطالبات كمجال منهجي.
Google Research — متدرب بحثي (صيف 2022)
خلال تدريب داخلي في Google Research في عام 2022، شارك كوماتسوزاكي في اقتراح “sparse upcycling” — الذي نُشر بعنوان „Sparse Upcycling: Training Mixture-of-Experts from Dense Checkpoints“ (ICLR 2023)، بالاشتراك مع جيمس لي ثورب، وكارلوس ريكيلمي، وباسيل مصطفى، وجوشوا أينسلي، ويي تاي، ومصطفى دهقاني، ونيل هولسبي. تقوم الطريقة بتهيئة نموذج خليط الخبراء المُفعَّل بشكل متفرق عن طريق تكرار وتوجيه طبقات التغذية الأمامية لنقطة تفتيش محول كثيفة موجودة. حققت النماذج المُعاد تدويرها أداءً أفضل بشكل كبير من نظيراتها الكثيفة على معايير SuperGLUE و ImageNet باستخدام حوالي 50% فقط من ميزانية حساب التدريب الأصلية، وتفوقت على نماذج خليط الخبراء المدربة من الصفر على نفس الحساب. تم اعتماد “sparse upcycling” منذ ذلك الحين كتقنية قياسية لتوسيع نطاق النماذج بكفاءة حسابية، وتم الاستشهاد بها في العشرات من الأوراق البحثية اللاحقة حول خليط الخبراء وكفاءة النماذج.
إكمال الدكتوراه في معهد جورجيا للتكنولوجيا (2023–حتى الآن)
أكمل كوماتسوزاكي درجة الدكتوراه في معهد جورجيا للتكنولوجيا في عام 2023. لا تحدد صفحة „عني“ الخاصة به (آخر تحديث في أغسطس 2024) انتماء مؤسسيًا حاليًا بعد الحصول على الدرجة. يحافظ على نشاط بحثي وتفاعل على وسائل التواصل الاجتماعي ويستمر في المشاركة في مجتمع الذكاء الاصطناعي مفتوح المصدر.
المساهمات الرئيسية
-
„One Epoch Is All You Need“ (arXiv, 2019) — أول حجة تجريبية منشورة للتدريب الأمثل حسابيًا: أظهرت أن التدريب لمرحلة واحدة على مجموعات بيانات كبيرة بأحجام نماذج وأعداد رموز تدريب مناسبة يقلل بشكل كبير من هدر الحوسبة مقارنة بالممارسة السائدة للتدريب متعدد المراحل مع التنظيم الثقيل. توقعت إطار قوانين القياس الرسمي لهوفمان وآخرين (2022) بثلاث سنوات.
-
GPT-J-6B (EleutherAI، 2021) — شارك في قيادة تطوير GPT-J، أول نموذج لغة مفتوح المصدر يطابق GPT-3 على المعايير العامة، وتم إصداره بأوزان كاملة. أصبح بنية تحتية أساسية للنظام البيئي لنماذج اللغة الكبيرة مفتوحة المصدر ومكّن أبحاث الضبط الدقيق في مجالات متعددة.
-
LAION-400M و LAION-5B (2021) — شارك في قيادة إنشاء أول مجموعات بيانات مفتوحة المصدر واسعة النطاق للصور والنصوص، والتي كانت بمثابة بيانات التدريب لـ Stable Diffusion وساهمت في البنية التحتية للبيانات الأساسية لمجال الذكاء الاصطناعي التوليدي للصور.
-
Sparse Upcycling (ICLR 2023) — شارك في اقتراح طريقة لتحويل نقاط تفتيش المحول الكثيفة المدربة مسبقًا إلى نماذج خليط خبراء مُفعَّلة بشكل متفرق بحوالي 50% من تكلفة حساب التدريب الأصلية، مما يتيح التوسع المستمر في سعة النموذج دون تكلفة تدريب نماذج خليط الخبراء من الصفر.
-
„خدعة Unreal Engine" (مايو 2021) — تغريدة منتشرة على نطاق واسع أظهرت أن إضافة „Unreal Engine" إلى مطالبات توليد الصور يحسن بشكل كبير جودة المخرجات؛ واحدة من أوائل العروض المعاد إنتاجها على نطاق واسع لهندسة المطالبات لنماذج النص إلى الصورة، مما ساهم في تعميم الضبط القائم على الكلمات المفتاحية.
-
مشاركة الأبحاث والتأثير المجتمعي — حافظ على مشاركة يومية منهجية للأوراق البحثية على X/تويتر مع أكثر من 100,000 متابع؛ تم توثيقه في دراسة من جامعة كاليفورنيا في سانتا باربرا لعام 2024 (arXiv:2401.13782) على أنه ذو تأثير قابل للقياس على أنماط الاقتباس والاتجاهات البحثية عبر مجتمع أبحاث الذكاء الاصطناعي، إلى جانب @_akhaliq.
الجوائز والتقدير
- ICLR 2023 — تم قبول ورقة Sparse Upcycling في المؤتمر الدولي لتمثيلات التعلم.
- التأثير المجتمعي الموثق — تم تسميته إلى جانب @_akhaliq في دراسة من جامعة كاليفورنيا في سانتا باربرا لعام 2024 كواحد من أكثر حسابات مشاركة الأبحاث تأثيرًا، مع تأثير قابل للقياس على اتجاهات الاقتباس.
- الاستشهاد بـ GPT-J واعتماده — أصبح GPT-J واحدًا من أكثر نماذج اللغة مفتوحة المصدر تحميلًا واستشهادًا في 2021–2022، وتم اعتماده كنموذج أساسي عبر أبحاث معالجة اللغة الطبيعية في الرعاية الصحية والقانون والمجالات العلمية.
العلاقات الرئيسية
- بن وانغ (Ben Wang) — مطور مشارك في EleutherAI والمنفذ الرئيسي لـ GPT-J باستخدام mesh-transformer-jax على أجهزة Google TPU Research Cloud؛ يُشار إلى الائتمان المشترك بين وانغ وكوماتسوزاكي في الاستشهاد الرسمي.
- كونور ليهي (Connor Leahy) — المؤسس المشارك لـ EleutherAI؛ جزء من المجموعة المؤسسة التي شكلت رؤية البنية التحتية لنماذج اللغة الكبيرة مفتوحة المصدر السياق الذي تم فيه بناء LAION و GPT-J.
- كريستوف شومان (Christoph Schuhmann) — المؤسس المشارك لـ LAION؛ قاد جهود التنسيق التنظيمي والمجتمعي وراء LAION-400M و LAION-5B.
- جيمس لي ثورب (James Lee-Thorp) — مؤلف مشارك في Google Research وقائد مشارك لمشروع sparse upcycling.
- يي تاي (Yi Tay)، مصطفى دهقاني (Mostafa Dehghani)، نيل هولسبي (Neil Houlsby) — مؤلفون مشاركون في Google Research في ورقة sparse upcycling، جزء من نفس الفريق في منطقة زيورخ المسؤول عن ViT و MLP-Mixer والبنيات ذات الصلة.
- @_akhaliq (خالد الخطيب) — تم تحديدهما معًا في دراسة تأثير جامعة كاليفورنيا في سانتا باربرا كحسابات مشاركة أبحاث رئيسية أخرى؛ يتم الاستشهاد بهما معًا بشكل متكرر على أنهما شكلا الأوراق البحثية التي اكتسبت زخمًا في مجتمع الباحثين.
الأسلوب الشخصي
يصف كوماتسوزاكي نفسه بأنه „كان يستكشف قدرة مفكك التشفير المحول منذ بدايته“ — وهو وصف ذاتي دقيق: ورقة القياس لمرحلة واحدة الصادرة في 2019 سبقت الوعي المجتمعي الواسع بقوانين القياس، وعمله على GPT-J سبق معظم حركة نماذج اللغة الكبيرة مفتوحة المصدر بسنة. يعمل في وقت واحد في البحث التقني (الأوراق المحكمة، بناء مجموعات البيانات، ابتكارات البنيات) وفي التنظيم المجتمعي (المشاركة اليومية للأوراق، التغريدات المؤثرة)، وكان شفافًا بشكل غير معتاد بشأن الآليات الاجتماعية التي تكتسب بها الأبحاث زخمًا. يعكس حفاظه على حسابين منفصلين باللغتين الإنجليزية واليابانية على X جهدًا متعمدًا للبقاء على اتصال بكل من محادثة أبحاث الذكاء الاصطناعي العالمية ومجتمع التعلم الآلي الناطق باللغة اليابانية. وقد أعرب عن آرائه بشأن حواجز الحوسبة التي تواجه النماذج مفتوحة المصدر مقارنة بالمختبرات الرائدة، والتقليل من تقدير جودة البيانات والتعليقات البشرية كعوامل مقيدة إلى جانب قوة الحوسبة الخام.
المراجع
- الموقع الشخصي / صفحة عني: arankomatsuzaki.wordpress.com
- Google Scholar: scholar.google.com
- „One Epoch Is All You Need“ (arXiv, 2019): arxiv.org/abs/1906.06669
- GPT-J-6B: huggingface.co/EleutherAI/gpt-j-6b
- LAION-400M (arXiv): arxiv.org/abs/2111.02114
- Sparse Upcycling (arXiv): arxiv.org/abs/2212.05055
- دراسة تأثير جامعة كاليفورنيا في سانتا باربرا (arXiv): arxiv.org/abs/2401.13782
- بودكاست التعلم غير الخاضع للإشراف (يوليو 2023): unsupervisedlearning.substack.com
- ملف Digg: digg.com/u/x/arankomatsuzaki