آخرین بروزرسانی در ۲۷ مرداد ۱۴۰۵ توسط Dr.Arman
ظهور Qwen3.8-27B، مسیر تازهای برای هوش مصنوعی برنامهنویسی گشوده است. این مدل ۲۷ میلیارد پارامتری، بهصورت محلی و بدون نیاز به ابر اجرا میشود.
چرا Qwen3.8-27B به یک مدل منبعباز برجسته تبدیل شده است؟
پنجشنبه گذشته، علیبابا مدل Qwen3.8-27B را در هافینگفیس منتشر کرد. این انتشار با مجوز آپاچی ۲ انجام شده است. مجوز آپاچی ۲ برای استفاده تجاری و تغییرات آزادانه است.
این مدل معمولی نیست. این مدل بهصورت بومی تصویر و ویدیو را میفهمد. پنجره زمینه آن ۲۶۲٬۱۴۴ توکن است. حالت استدلال آن قابل تنظیم است. بهعلاوه، برای کدنویسی و عاملهای هوشمند بهینه شده است.
- درک تصویر و ویدیو بدون افزونه
- پنجره زمینه ۲۶۲ هزار توکنی
- پشتیبانی از گردشکارهای عاملمحور
- سازگاری با چارچوبهای vLLM، SGLang و TokenSpeed
چنین ترکیبی در مدلهای محلی کمیاب است. مدل منبعباز جدید علیبابا به تواناییهای نسل بزرگتر Qwen3.8 نزدیک شده است. با این حال، اجرای آن روی سختافزار معمولی ممکن است.
اعداد اولیه علیبابا توجه زیادی جلب کرده است. این شرکت اعلام کرده که مدل در SWE-bench Pro نمره ۶۱/۷ گرفته است. در LiveCodeBench v6 نیز نمره ۹۰/۳ به دست آمده است. همچنین در OSWorld-Verified نمره ۸۴/۳ ثبت شده است.
نکته جالب، مقایسه با مدلهای اختصاصی است. در جدول علیبابا، Qwen3.8-27B از Claude Opus 4.6 Max در دو بنچمارک جلو زده است. در Terminal-Bench و GPQA Diamond همچنان Claude پیشتاز است.
برخی بنچمارکها داخلی هستند. روش ارزیابی نیز در هر جدول متفاوت است. بنابراین نمیتوان این اعداد را دلیل برتری قطعی دانست.
| بنچمارک | نمره Qwen3.8-27B | نکته |
|---|---|---|
| SWE-bench Pro | ۶۱/۷ | برتری در جدول علیبابا |
| LiveCodeBench v6 | ۹۰/۳ | توانایی بالا در کدنویسی |
| OSWorld-Verified | ۸۴/۳ | عملکرد قوی در کارهای عاملمحور |
اجرای محلی هوش مصنوعی؛ فرصتی تازه برای توسعهدهندگان
اجرای محلی هوش مصنوعی دیگر محدود به نمونههای ساده نیست. Qwen3.8-27B توانسته کارهای سنگین را روی سیستم شخصی انجام دهد. ارزیابیهای مستقل این موضوع را تأیید میکنند.
Artificial Analysis به این مدل نمره ۵۲ در شاخص هوش داده است. این شاخص از ۹ ارزیابی مختلف تشکیل شده است. همین نمره را GPT-5.6 Luna در بالاترین حالت استدلال دارد. این مدل اختصاصی فقط از طریق ابر در دسترس است.
در شاخص عاملمحور این بنچمارک نیز نمره ۵۱ ثبت شده است. این نتیجه از Claude Opus 4.8 با حداکثر تلاش استدلال بالاتر است. این مدل حدود سه ماه پیش منتشر شده بود.
واکنش توسعهدهندگان به این نتایج بسیار مثبت بوده است. ابزار کلاین نوشت که برای نخستین بار یک مدل محلی به توانایی مدلهای مرزی رسیده است. این اتفاق خیلی زودتر از انتظارها رخ داده است.
یکی از توسعهدهندگان با نام Sero اشاره کرد که مدلی با سختافزار ۳ هزار دلاری میتواند نتایج مدلهای ماه قبل را شکست دهد. او گفت «طبقه تحتانی دائمی لغو شده است.»
کاربردهای عملی در توسعه نرمافزار
سایمون ویلیسون، توسعهدهنده شناختهشده، این مدل را روی مکبوک پرو و DGX Spark آزمایش کرد. او نسخه کوانتیزهشده با حدود ۱۷ گیگابایت را اجرا کرد. مدل توانست کد بنویسد و تصاویر را تفسیر کند.
در یک آزمایش، مدل در پایگاه کد جستوجو کرد و نحوه احراز هویت را شرح داد. در آزمایش دیگر، یک ابزار پایتون برای تبدیل فرمت ساخت و آن را آزمایش کرد. ویلیسون این تجربه را «معجزهآسا» توصیف کرده است.
کوانتیزهسازی مدل و اجرا روی سختافزار معمولی
کوانتیزهسازی مدل نقش اصلی را در کاهش نیازهای سختافزاری ایفا میکند. نسخه کامل ۱۶ بیتی حدود ۵۶ گیگابایت حافظه ویدئویی نیاز دارد. نسخه FP8 حدود ۲۸ گیگابایت مصرف میکند. نسخه ۴ بیتی فقط حدود ۱۷ گیگابایت اشغال میکند.
جدول زیر تصویر روشنی از حافظه موردنیاز ارائه میدهد:
| نسخه | حافظه موردنیاز | کاربرد پیشنهادی |
|---|---|---|
| دقت ۱۶ بیتی | حدود ۵۶ گیگابایت | سرورهای سازمانی |
| دقت FP8 | حدود ۲۸ گیگابایت | ایستگاههای کاری |
| کوانتیزهسازی ۴ بیتی | حدود ۱۷ گیگابایت | رایانههای شخصی |
با این حجم، رایانههای شخصی قدرتمند میتوانند مدل را اجرا کنند. لپتاپهای مجهز به کارت گرافیک خوب نیز از این قاعده مستثنی نیستند. به همین دلیل، کوانتیزهسازی مدل مورد استقبال قرار گرفته است.
برای اجرای محلی این مدل، دنبال کردن این مراحل مفید است:
- دانلود نسخه کوانتیزهشده از مخزن رسمی Hugging Face.
- نصب چارچوب سرویسدهی مثل llama.cpp.
- فعالسازی چند پیشبینی توکن MTP.
- تنظیم سطح استدلال بر اساس نوع کار.
فعالسازی MTP میتواند سرعت را افزایش دهد. سایمون ویلیسون در DGX Spark بهبود ۷۲ درصدی سرعت را مشاهده کرد. این بهبود در مقایسه با تنظیمات پیشفرض LM Studio به دست آمد.
با این حال، Qwen3.8-27B گاهی بیش از حد فکر میکند. Artificial Analysis اعلام کرده که این مدل ۱۶۰ میلیون توکن خروجی در آزمونهایش تولید کرده است. میانگین مدلهای مشابه باز فقط ۴۳ میلیون توکن بوده است.
سایمون ویلیسون نیز نمونه شدیدی از این رفتار را دیده است. درخواست تولید یک SVG ساده ۲۱ دقیقه زمان برد. این درخواست بیش از ۲۲ هزار توکن استدلال مصرف کرد. او توصیه میکند برای کارهای عادی، سطح استدلال پایین باشد.
توماس تونگوز، سرمایهگذار و توسعهدهنده، نیز به این نکته اشاره کرده است. او در یک آزمون کوچک دریافت که این مدل با استدلال فعال کیفیت بهتری دارد. اما سرعت آن حدود ۳۰ برابر کمتر و هزینه آن ۴/۵ برابر بیشتر بود.
با وجود این چالشها، استقبال گسترده بوده است. به گزارش Cybernews، دانلودهای این مدل در سه روز نخست از ۳ میلیون گذشت. نسخههای کوانتیزه نیز بهسرعت برای ابزارهای محلی منتشر شدند.
انجمن LocalLLaMA در ردیت بحث گستردهای درباره مدل ایجاد کرده است. کاربران بنچمارکها و تنظیمات مختلف را مقایسه میکنند. یکی از کاربران که یک بازی را بهصورت محلی تولید کرده بود، این مدل را «جانوری متفاوت» نامید.
برای سازمانها، پرسش اصلی مقایسه مستقیم با GPT یا Claude نیست. پرسش این است که آیا یک مدل کوچک میتواند بخشی از کارهای API را در داخل سازمان انجام دهد؟ پاسخ در بسیاری از موارد مثبت است.
این مدل با مجوز آپاچی ۲ قابل بازبینی و تغییر است. دادهها برای پردازش از سازمان خارج نمیشوند. این موضوع حریم خصوصی و حاکمیت داده را تقویت میکند.
علیبابا اعلام کرده که نسخه ابری مدیریتشده با پنجره زمینه یک میلیون توکنی در راه است. تا آن زمان، اجرای محلی گزینه عملی و جذابی باقی میماند.
به نظر میرسد Qwen3.8-27B فقط آغاز یک تغییر بزرگ است. مدلهای محلی در حال رسیدن به نقطه اوج هستند. توسعهدهندگان اکنون میتوانند ابزارهای پیشرفته را بدون واسطه اجرا کنند. این تحول برای آینده هوش مصنوعی برنامهنویسی اهمیت زیادی دارد.
Qwen3.8-27B ثابت کرده است که تواناییهای بزرگ لزوماً به مدلهای ابری وابسته نیستند. بنچمارکها هنوز به اعتبارسنجی بیشتری نیاز دارند. رفتار پیشفرض استدلال نیز گاهی ناکارآمد است.
با این حال، تجربه توسعهدهندگان از اجرای یک فایل ۱۷ گیگابایتی روی سختافزار شخصی، نقطه عطفی محسوب میشود. این تجربه، معیار مهمی برای آینده هوش مصنوعی برنامهنویسی است.
منبع:
https://venturebeat.com/technology/qwen3-8-27b-runs-frontier-class-coding-agents-and-reasoning-locally-no-cloud-api-required

مطالب مرتبط