Qwen3.8-27B؛ مدل محلی که مرزهای هوش مصنوعی را جابه‌جا کرد

امتیاز دهید post

آخرین بروزرسانی در ۲۷ مرداد ۱۴۰۵ توسط Dr.Arman

ظهور Qwen3.8-27B، مسیر تازه‌ای برای هوش مصنوعی برنامه‌نویسی گشوده است. این مدل ۲۷ میلیارد پارامتری، به‌صورت محلی و بدون نیاز به ابر اجرا می‌شود.

چرا Qwen3.8-27B به یک مدل منبع‌باز برجسته تبدیل شده است؟

پنجشنبه گذشته، علی‌بابا مدل Qwen3.8-27B را در هافینگ‌فیس منتشر کرد. این انتشار با مجوز آپاچی ۲ انجام شده است. مجوز آپاچی ۲ برای استفاده تجاری و تغییرات آزادانه است.

این مدل معمولی نیست. این مدل به‌صورت بومی تصویر و ویدیو را می‌فهمد. پنجره زمینه آن ۲۶۲٬۱۴۴ توکن است. حالت استدلال آن قابل تنظیم است. به‌علاوه، برای کدنویسی و عامل‌های هوشمند بهینه شده است.

  • درک تصویر و ویدیو بدون افزونه
  • پنجره زمینه ۲۶۲ هزار توکنی
  • پشتیبانی از گردش‌کارهای عامل‌محور
  • سازگاری با چارچوب‌های vLLM، SGLang و TokenSpeed

چنین ترکیبی در مدل‌های محلی کمیاب است. مدل منبع‌باز جدید علی‌بابا به توانایی‌های نسل بزرگ‌تر Qwen3.8 نزدیک شده است. با این حال، اجرای آن روی سخت‌افزار معمولی ممکن است.

اعداد اولیه علی‌بابا توجه زیادی جلب کرده است. این شرکت اعلام کرده که مدل در SWE-bench Pro نمره ۶۱/۷ گرفته است. در LiveCodeBench v6 نیز نمره ۹۰/۳ به دست آمده است. همچنین در OSWorld-Verified نمره ۸۴/۳ ثبت شده است.

نکته جالب، مقایسه با مدل‌های اختصاصی است. در جدول علی‌بابا، Qwen3.8-27B از Claude Opus 4.6 Max در دو بنچمارک جلو زده است. در Terminal-Bench و GPQA Diamond همچنان Claude پیشتاز است.

برخی بنچمارک‌ها داخلی هستند. روش ارزیابی نیز در هر جدول متفاوت است. بنابراین نمی‌توان این اعداد را دلیل برتری قطعی دانست.

بنچمارک نمره Qwen3.8-27B نکته
SWE-bench Pro ۶۱/۷ برتری در جدول علی‌بابا
LiveCodeBench v6 ۹۰/۳ توانایی بالا در کدنویسی
OSWorld-Verified ۸۴/۳ عملکرد قوی در کارهای عامل‌محور

اجرای محلی هوش مصنوعی؛ فرصتی تازه برای توسعه‌دهندگان

اجرای محلی هوش مصنوعی دیگر محدود به نمونه‌های ساده نیست. Qwen3.8-27B توانسته کارهای سنگین را روی سیستم شخصی انجام دهد. ارزیابی‌های مستقل این موضوع را تأیید می‌کنند.

Artificial Analysis به این مدل نمره ۵۲ در شاخص هوش داده است. این شاخص از ۹ ارزیابی مختلف تشکیل شده است. همین نمره را GPT-5.6 Luna در بالاترین حالت استدلال دارد. این مدل اختصاصی فقط از طریق ابر در دسترس است.

در شاخص عامل‌محور این بنچمارک نیز نمره ۵۱ ثبت شده است. این نتیجه از Claude Opus 4.8 با حداکثر تلاش استدلال بالاتر است. این مدل حدود سه ماه پیش منتشر شده بود.

واکنش توسعه‌دهندگان به این نتایج بسیار مثبت بوده است. ابزار کلاین نوشت که برای نخستین بار یک مدل محلی به توانایی مدل‌های مرزی رسیده است. این اتفاق خیلی زودتر از انتظارها رخ داده است.

یکی از توسعه‌دهندگان با نام Sero اشاره کرد که مدلی با سخت‌افزار ۳ هزار دلاری می‌تواند نتایج مدل‌های ماه قبل را شکست دهد. او گفت «طبقه تحتانی دائمی لغو شده است.»

کاربردهای عملی در توسعه نرم‌افزار

سایمون ویلیسون، توسعه‌دهنده شناخته‌شده، این مدل را روی مک‌بوک پرو و DGX Spark آزمایش کرد. او نسخه کوانتیزه‌شده با حدود ۱۷ گیگابایت را اجرا کرد. مدل توانست کد بنویسد و تصاویر را تفسیر کند.

در یک آزمایش، مدل در پایگاه کد جست‌وجو کرد و نحوه احراز هویت را شرح داد. در آزمایش دیگر، یک ابزار پایتون برای تبدیل فرمت ساخت و آن را آزمایش کرد. ویلیسون این تجربه را «معجزه‌آسا» توصیف کرده است.

کوانتیزه‌سازی مدل و اجرا روی سخت‌افزار معمولی

کوانتیزه‌سازی مدل نقش اصلی را در کاهش نیازهای سخت‌افزاری ایفا می‌کند. نسخه کامل ۱۶ بیتی حدود ۵۶ گیگابایت حافظه ویدئویی نیاز دارد. نسخه FP8 حدود ۲۸ گیگابایت مصرف می‌کند. نسخه ۴ بیتی فقط حدود ۱۷ گیگابایت اشغال می‌کند.

جدول زیر تصویر روشنی از حافظه موردنیاز ارائه می‌دهد:

نسخه حافظه موردنیاز کاربرد پیشنهادی
دقت ۱۶ بیتی حدود ۵۶ گیگابایت سرورهای سازمانی
دقت FP8 حدود ۲۸ گیگابایت ایستگاه‌های کاری
کوانتیزه‌سازی ۴ بیتی حدود ۱۷ گیگابایت رایانه‌های شخصی

با این حجم، رایانه‌های شخصی قدرتمند می‌توانند مدل را اجرا کنند. لپ‌تاپ‌های مجهز به کارت گرافیک خوب نیز از این قاعده مستثنی نیستند. به همین دلیل، کوانتیزه‌سازی مدل مورد استقبال قرار گرفته است.

برای اجرای محلی این مدل، دنبال کردن این مراحل مفید است:

  1. دانلود نسخه کوانتیزه‌شده از مخزن رسمی Hugging Face.
  2. نصب چارچوب سرویس‌دهی مثل llama.cpp.
  3. فعال‌سازی چند پیش‌بینی توکن MTP.
  4. تنظیم سطح استدلال بر اساس نوع کار.

فعال‌سازی MTP می‌تواند سرعت را افزایش دهد. سایمون ویلیسون در DGX Spark بهبود ۷۲ درصدی سرعت را مشاهده کرد. این بهبود در مقایسه با تنظیمات پیش‌فرض LM Studio به دست آمد.

با این حال، Qwen3.8-27B گاهی بیش از حد فکر می‌کند. Artificial Analysis اعلام کرده که این مدل ۱۶۰ میلیون توکن خروجی در آزمون‌هایش تولید کرده است. میانگین مدل‌های مشابه باز فقط ۴۳ میلیون توکن بوده است.

سایمون ویلیسون نیز نمونه شدیدی از این رفتار را دیده است. درخواست تولید یک SVG ساده ۲۱ دقیقه زمان برد. این درخواست بیش از ۲۲ هزار توکن استدلال مصرف کرد. او توصیه می‌کند برای کارهای عادی، سطح استدلال پایین باشد.

توماس تونگوز، سرمایه‌گذار و توسعه‌دهنده، نیز به این نکته اشاره کرده است. او در یک آزمون کوچک دریافت که این مدل با استدلال فعال کیفیت بهتری دارد. اما سرعت آن حدود ۳۰ برابر کمتر و هزینه آن ۴/۵ برابر بیشتر بود.

با وجود این چالش‌ها، استقبال گسترده بوده است. به گزارش Cybernews، دانلودهای این مدل در سه روز نخست از ۳ میلیون گذشت. نسخه‌های کوانتیزه نیز به‌سرعت برای ابزارهای محلی منتشر شدند.

انجمن LocalLLaMA در ردیت بحث گسترده‌ای درباره مدل ایجاد کرده است. کاربران بنچمارک‌ها و تنظیمات مختلف را مقایسه می‌کنند. یکی از کاربران که یک بازی را به‌صورت محلی تولید کرده بود، این مدل را «جانوری متفاوت» نامید.

برای سازمان‌ها، پرسش اصلی مقایسه مستقیم با GPT یا Claude نیست. پرسش این است که آیا یک مدل کوچک می‌تواند بخشی از کارهای API را در داخل سازمان انجام دهد؟ پاسخ در بسیاری از موارد مثبت است.

این مدل با مجوز آپاچی ۲ قابل بازبینی و تغییر است. داده‌ها برای پردازش از سازمان خارج نمی‌شوند. این موضوع حریم خصوصی و حاکمیت داده را تقویت می‌کند.

علی‌بابا اعلام کرده که نسخه ابری مدیریت‌شده با پنجره زمینه یک میلیون توکنی در راه است. تا آن زمان، اجرای محلی گزینه عملی و جذابی باقی می‌ماند.

به نظر می‌رسد Qwen3.8-27B فقط آغاز یک تغییر بزرگ است. مدل‌های محلی در حال رسیدن به نقطه اوج هستند. توسعه‌دهندگان اکنون می‌توانند ابزارهای پیشرفته را بدون واسطه اجرا کنند. این تحول برای آینده هوش مصنوعی برنامه‌نویسی اهمیت زیادی دارد.

Qwen3.8-27B ثابت کرده است که توانایی‌های بزرگ لزوماً به مدل‌های ابری وابسته نیستند. بنچمارک‌ها هنوز به اعتبارسنجی بیشتری نیاز دارند. رفتار پیش‌فرض استدلال نیز گاهی ناکارآمد است.

با این حال، تجربه توسعه‌دهندگان از اجرای یک فایل ۱۷ گیگابایتی روی سخت‌افزار شخصی، نقطه عطفی محسوب می‌شود. این تجربه، معیار مهمی برای آینده هوش مصنوعی برنامه‌نویسی است.

منبع:

https://venturebeat.com/technology/qwen3-8-27b-runs-frontier-class-coding-agents-and-reasoning-locally-no-cloud-api-required

دیدگاهتان را بنویسید

نشانی ایمیل شما منتشر نخواهد شد. بخش‌های موردنیاز علامت‌گذاری شده‌اند *