نسل جدید مدل‌های زبانی بزرگ؛ تحولی فراتر از ترنسفورمرها

امتیاز دهید post

آخرین بروزرسانی در ۲۰ مرداد ۱۴۰۵ توسط Dr.Arman

در دنیای پرشتاب اخبار فناوری، هوش مصنوعی همواره در حال تغییر است. محققان اکنون به دنبال راهکارهایی فراتر از مدل‌های فعلی هستند. مدل‌های زبانی بزرگ امروزی بر پایه فناوری ترنسفورمر بنا شده‌اند. این فناوری از سال ۲۰۱۷ تاکنون بر جهان حکمرانی کرده است. اما اکنون نشانه‌هایی از محدودیت در این ساختار دیده می‌شود.

فناوری ترنسفورمر برای اولین بار توسط گوگل معرفی شد. این ساختار در پردازش توالی‌های طولانی داده بسیار عالی عمل می‌کند. امروزه تمام مدل‌های مشهور بازار از همین موتور استفاده می‌کنند. جاستین دنگل، مدیرعامل استارتاپ ساب‌کوادراتیک، اهمیت آن را بسیار زیاد می‌داند. او معتقد است ترنسفورمرها تاریخ علوم کامپیوتر را تغییر دادند. با این حال، این تکنولوژی در حال پیر شدن است.

پیشرفت‌های اخیر در مدل‌های استدلالی چالش‌های جدیدی ایجاد کرده است. این مدل‌ها به حجم عظیمی از داده‌های ورودی نیاز دارند. ساختارهای فعلی برای مدیریت این حجم از داده بهینه نیستند. دانشمندان اکنون به دنبال نسل جدید مدل‌های زبانی بزرگ هستند. این نسل جدید باید نقص‌های بنیادین گذشته را برطرف کند. بسیاری از شرکت‌های پیشرو به دنبال معماری‌های جایگزین هستند.

چالش‌های جایگزین ترنسفورمر در دنیای محاسبات

نقطه قوت اصلی ترنسفورمرها در مکانیزم توجه متراکم نهفته است. این مکانیزم معنای متن را به صورت اعداد کدگذاری می‌کند. در این فرآیند، هر کلمه با تمام کلمات دیگر مقایسه می‌شود. این عملیات شامل ضرب‌های ریاضی بسیار پیچیده و متعدد است. با افزایش طول متن، تعداد محاسبات به شدت رشد می‌کند. این موضوع باعث مصرف انرژی بسیار زیادی می‌شود.

هزینه‌های اجرای این مدل‌ها برای شرکت‌ها بسیار کمرشکن است. بر اساس گزارش‌های معتبر، هزینه‌های محاسباتی به شدت افزایش یافته است. شرکت اوپن ای‌آی مبالغ هنگفتی را صرف تامین زیرساخت می‌کند. آمارهای رسمی نشان‌دهنده رشد مصرف برق مراکز داده است. پیش‌بینی می‌شود این مصرف تا سال ۲۰۳۰ دو برابر شود.

ترنسفورمرها در مدیریت پنجره بافت یا کانکست با محدودیت روبرو هستند. آن‌ها نمی‌توانند مقادیر بسیار زیاد اطلاعات را همزمان پیگیری کنند. اگر بخواهیم وظایف سخت‌تری به هوش مصنوعی بسپاریم، به داده‌های بیشتری نیاز داریم. مدل‌های فعلی در پردازش کتابخانه‌های بزرگ یا کدهای پیچیده ضعف دارند. اینجاست که نیاز به یک جایگزین ترنسفورمر بیش از پیش احساس می‌شود.

  • افزایش تصاعدی محاسبات با رشد طول متن
  • مصرف انرژی بسیار بالا در مقیاس صنعتی
  • محدودیت در پردازش همزمان اطلاعات حجیم
  • هزینه‌های سرسام‌آور برای شرکت‌های توسعه‌دهنده

استارتاپ‌های نوظهور در حال بازنگری در مفهوم مکانیزم توجه هستند. ساب‌کوادراتیک ادعا می‌کند مکانیزم توجه پراکنده را ابداع کرده است. این روش تنها روی کلمات مهم متمرکز می‌شود. این کار باعث کاهش چشمگیر حجم محاسبات ریاضی می‌شود. آن‌ها مدعی هستند این مدل در جستجو و کدنویسی عالی است.

شرکت مانیفست ای‌آی نیز رویکرد متفاوتی را برگزیده است. آن‌ها به جای تغییر توجه، به دنبال جایگزینی کامل آن هستند. تکنولوژی آن‌ها “حفظ قدرت” نام دارد که اطلاعات حیاتی را ذخیره می‌کند. این روش مانع از انفجار حجم داده‌ها در حین پردازش می‌شود. مانیفست ای‌آی ادعا می‌کند مدل‌هایشان برای پردازش ویدیوهای طولانی عالی هستند.

نام شرکت فناوری کلیدی هدف اصلی
Subquadratic Sparse Attention کاهش محاسبات ریاضی
Manifest AI Power Retention مدیریت داده‌های حجیم
Liquid AI Liquid Neural Networks بهره‌وری انرژی
Inception Diffusion for Text سرعت تولید محتوا

نقش معماری شبکه عصبی در کاهش مصرف انرژی

شرکت لیکوئید ای‌آی از دانشگاه ام‌آی‌تی منشعب شده است. آن‌ها بر روی توسعه معماری شبکه عصبی مایع تمرکز دارند. این مدل‌ها بسیار کوچک‌تر از مدل‌های زبانی معمولی هستند. این شرکت مدل‌هایی می‌سازد که روی تراشه‌های کوچک خودرو کار می‌کنند. برخی از این مدل‌ها حتی روی رایانه‌های ارزان‌قیمت اجرا می‌شوند.

مدل‌های مایع از مغز کرم‌ها الهام گرفته شده‌اند. ویژگی اصلی آن‌ها قابلیت انطباق در حین یادگیری است. در ترنسفورمرها، رفتار مدل پس از آموزش کاملاً ثابت می‌ماند. اما مدل‌های مایع می‌توانند رفتارهای خود را با اطلاعات جدید تطبیق دهند. این موضوع یک پیشرفت بزرگ در علم کامپیوتر محسوب می‌شود.

مدل‌های جدید این شرکت ترکیبی از فناوری‌های مختلف هستند. حدود ۲۰ درصد از ساختار آن‌ها را ترنسفورمرها تشکیل می‌دهند. ۸۰ درصد باقی‌مانده از شبکه‌های عصبی مایع ساخته شده است. این ترکیب باعث شده تا عملکرد آن‌ها با مدل‌های بزرگتر برابری کند. رامین حسنی معتقد است مغز انسان تنها ۲۰ وات برق مصرف می‌کند. او می‌گوید ما باید در طراحی‌ها خلاقیت بیشتری داشته باشیم.

  1. تحلیل ساختار مغز موجودات زنده برای طراحی الگو
  2. ساخت مدل‌های هیبریدی با بهره‌وری بالاتر
  3. کاهش نیاز به سخت‌افزارهای گران‌قیمت و مصرفی
  4. ارائه مدل‌های رایگان برای سازمان‌های کوچک

تولید متن در مدل‌های فعلی به صورت کلمه به کلمه است. این روش برای کامپیوترها بسیار ناکارآمد و کند است. استارتاپ اینسپشن به دنبال تولید متن به صورت یکجا است. آن‌ها از تکنولوژی دیفیوژن یا نفوذ استفاده می‌کنند. این همان فناوری است که در تولید تصاویر و ویدیوها به کار می‌رود.

در این روش، کل جملات یا پاراگراف‌ها همزمان تولید می‌شوند. مدل‌های این شرکت بسیار سریع‌تر از رقبا عمل می‌کنند. چالش اصلی، تطبیق ریاضیات تصویر با ساختار کلمات بود. استفانو ارمون و همکارانش در استنفورد این مشکل را حل کردند. مدل‌های آن‌ها ۱۰ برابر سریع‌تر از نسخه‌های مشابه هستند.

آینده بهره‌وری هوش مصنوعی در صنایع B2B

برای موفقیت در بازارهای تجاری، بهره‌وری هوش مصنوعی کلیدی است. شرکت پث‌وی به دنبال رهاسازی مدل‌ها از محدودیت‌های زبانی است. آن‌ها مدلی ساخته‌اند که در حل معماهای سخت عالی عمل می‌کند. ترنسفورمرها تمایل دارند همه چیز را در قالب متن ببینند. اما زبان همیشه بهترین ابزار برای استدلال‌های منطقی نیست.

پث‌وی از ساختار ریاضی متفاوتی به نام فضای حالت استفاده می‌کند. این روش اطلاعات را به جای کلمات، به صورت انتزاعی فشرده می‌کند. این تکنولوژی به مدل اجازه می‌دهد استدلال‌های غیرکلامی انجام دهد. این رویکرد برای حل مسائل ریاضی و شطرنج بسیار موثر است. استامیراوسکا معتقد است برای درمان سرطان نباید فقط به کتاب‌ها تکیه کرد.

بسیاری از متخصصان معتقدند ترنسفورمرها تنها یک شروع بودند. ما نباید در یک فناوری خاص متوقف شویم. نسل جدید مدل‌های زبانی بزرگ باید هوشمندی را با هزینه کمتر ارائه دهند. در نهایت، ارزش واقعی هوش مصنوعی با معیار “هوش بر دلار” سنجیده می‌شود. شرکت‌هایی موفق می‌شوند که سرعت و صرفه اقتصادی را ترکیب کنند.

تحولات اخیر نشان‌دهنده یک تغییر پارادایم بزرگ است. معماری شبکه عصبی در حال عبور از محدودیت‌های سنتی است. برای کاربران نهایی، این به معنای ابزارهای هوشمندتر و ارزان‌تر خواهد بود. بهره‌وری هوش مصنوعی می‌تواند صنایع مختلف را متحول کند. ما در ابتدای راهی هستیم که در آن ترنسفورمرها جای خود را به نوآوری‌های برتر می‌دهند.

در پایان باید گفت که رقابت در این حوزه بسیار شدید است. گوگل و شرکت‌های بزرگ نیز در حال آزمایش رویکردهای جدید هستند. اما استارتاپ‌ها با جسارت بیشتری به سمت آینده حرکت می‌کنند. آن‌ها چیزی برای از دست دادن ندارند و دنیای جدیدی را می‌سازند. آینده هوش مصنوعی فراتر از کلمات و ترنسفورمرها رقم خواهد خورد.

منبع:

https://www.technologyreview.com/2026/08/10/1141511/these-startups-are-chasing-the-next-big-thing-in-llms/

دیدگاهتان را بنویسید

نشانی ایمیل شما منتشر نخواهد شد. بخش‌های موردنیاز علامت‌گذاری شده‌اند *