مدل هوش مصنوعی Qwen Image 2.1 علی بابا گوگل را به چالش کشید

شرکت علی بابا کلود از مدل تولید تصویر جدید و سبک وزن Qwen Image 2.1 با ۷ میلیارد پارامتر رونمایی کرد که توانسته در بنچمارک‌ها با مدل‌های بزرگ‌تر رقابت کند.

تتیم تحریریه۶ دقیقه مطالعه۰ بازدیدهمین حالا
مدل هوش مصنوعی Qwen Image 2.1 علی بابا گوگل را به چالش کشید

شرکت علی بابا کلود (Alibaba Cloud) از یک مدل هوش مصنوعی تولید تصویر سبک‌وزن جدید به نام Qwen Image 2.1 رونمایی کرده است. این مدل با داشتن تنها ۷ میلیارد پارامتر، یک مدل با وزن باز (open-weight) بسیار کم‌حجم است که حتی روی کارت‌های گرافیک قدیمی‌تر مصرف‌کننده مانند RTX 3090 نیز اجرا می‌شود. علی‌رغم طراحی سبک‌وزن، توسعه‌دهندگان آن ادعا می‌کنند که این مدل از طیف وسیعی از مدل‌های وزن‌بسته (closed-weight)، از جمله مدل Nano Banana 2.0 گوگل (Google)، توانمندتر است.

این نتیجه بر اساس بنچمارک داخلی خود آن‌ها به دست آمده است، بنابراین قبل از هرگونه ادعای قطعی دوست داریم آزمایش‌های بیشتری را ببینیم، اما گزارش‌های اولیه نشان می‌دهند که این یک مدل تصویر بسیار توانمند، با پشتیبانی از شفافیت بومی (native transparency) و قابلیت ایجاد تصاویر یکپارچه از طیف وسیعی از تصاویر مرجع است.

با این حال، یکی از زمینه‌هایی که باعث تعجب شده، تغییر در توافق‌نامه مجوز (licensing agreement) مدل Qwen Image 2.1 است. برخلاف نسخه قبلی، این نسخه صراحتاً فروش مجدد تجاری مدل را ممنوع می‌کند و از هرکسی که بخواهد از آن برای این منظور استفاده کند، می‌خواهد که مجوز جداگانه‌ای مستقیماً از توسعه‌دهنده دریافت کند.

رقابت با بهترین‌ها؟

مدل Qwen Image 2.1 تعدادی ویژگی جدید معرفی می‌کند که کارایی آن را بهبود می‌بخشد و به آن کمک می‌کند تا بهتر با جایگزین‌های تثبیت‌شده رقابت کند. این مدل از شفافیت بومی پشتیبانی می‌کند، بنابراین می‌توانید از آن بخواهید تصاویری با پس‌زمینه‌های شفاف تولید کند، که می‌تواند به ویژه برای هنرمندانی که می‌خواهند از هوش مصنوعی به عنوان بخشی از چیز دیگری استفاده کنند، یا برای محصولات چاپ بر اساس تقاضا (print-on-demand) مانند برچسب‌ها مفید باشد.

این مدل همچنین ویرایش تصویر را با قابلیت استفاده از حداکثر ۱۰ تصویر مرجع بهبود می‌بخشد. مثال‌های ذکر شده شامل گرفتن یک تصویر موجود از یک شخص، دادن تصاویر اقلام پوشاک به مدل، و سپس ترکیب کردن تصویری از آن شخص که آن لباس‌ها را پوشیده است، می‌باشد. تیم Qwen ثبات را در سرتاسر تصاویر تضمین می‌کند و افراد و محصولات را به طور مؤثری حفظ می‌کند.

با این حال، ویژگی برجسته Qwen Image 2.1 اندازه جمع‌وجور آن است. بخش تولید بصری آن تنها دارای ۷ میلیارد پارامتر است که آن را به یکی از کم‌حجم‌ترین مدل‌ها در نوع خود تبدیل می‌کند. در تست‌های مقایسه‌ای اولیه، تنها مدلی که پارامترهای کمتری داشت، مدل LongCat-Image توسعه‌یافته توسط Meituan بود که با ۶ میلیارد پارامتر عرضه شد. بیشتر مدل‌های دیگر چند برابر این اندازه هستند یا کاملاً وزن‌بسته هستند.

با این حال، توسعه‌دهندگان Qwen Image 2.1 ادعا می‌کنند که این مدل می‌تواند مستقیماً با همان مدل‌های وزن‌بسته رقابت کند. در همان بنچمارک داخلی، مدل آن‌ها امتیاز ۶۰.۲ را در بنچمارک تصویر Qwen کسب کرد. در مقایسه، مدل GPT Image 2.5 Sunburst شرکت اوپن‌آی‌وی (OpenAI) امتیاز ۶۷، مدل Muse Image امتیاز ۶۲.۳۴ و مدل Nano Banana 2.0 گوگل امتیاز ۵۹.۸۲ را کسب کردند.

آزمایش‌های اولیه در AI Arena نشان می‌دهد که این مدل در شرایط بنچمارک نامساعدتر به همان اندازه قوی نیست، اما همچنان بسیار نزدیک است. در آنجا، این مدل امتیاز ۱۲۲۸ را به دست آورد، در حالی که Nano Banana 2 موفق به کسب امتیاز ۱۲۶۰ شد. مدل Muse Image دوباره چند پله بالاتر قرار دارد و امتیاز ۱۲۷۶ را دارد، در حالی که GPT 65 Sunburst با امتیاز ۱۴۲۳ در صدر قرار دارد.

در حوزه ویرایش تصویر، AI Arena ادعا می‌کند که این مدل اکنون بهترین گزینه در میان گزینه‌های وزن‌باز است:

این‌ها هنوز نتایج اولیه‌ای هستند و برای تأیید یا رد کامل ادعای تیم Qwen به آزمایش‌های بیشتری نیاز است، اما تاکنون به نظر می‌رسد که آن‌ها بسیار نزدیک به واقعیت هستند. اگرچه ما نمی‌دانیم مدل‌های اختصاصی برای دستیابی به امتیازات بالاتر خود به چه تعداد پارامتر اتکا می‌کنند، به نظر می‌رسد Qwen Image 2.1 با وزن‌های متوسط خود به دنبال آن‌ها است.

این مدل روی سخت‌افزار محلی به خوبی کار می‌کند

گزارش‌ها از سوی کاربران اولیه مدل Qwen Image 2.1 حاکی از آن است که این مدل روی کارت‌های گرافیک مصرف‌کننده آن‌ها به خوبی اجرا می‌شود. کاربر انجمن هکر نیوز (Hacker News) به نام Vunderba، توسعه‌دهنده سایت GenAI Showdown، ادعا می‌کند که آن‌ها توانسته‌اند یک تصویر ۱ مگاپیکسلی را با استفاده از Qwen Image 2.1 در حدود پنج ثانیه روی یک کارت RTX 4090 تبدیل کنند.

در ساب‌ردیت Stable Diffusion، کاربر cgs019283 قابلیت‌های آن را تحسین کرد و اظهار داشت که این مدل می‌تواند تصاویر ۱ مگاپیکسلی را در حدود ۲۵ ثانیه روی کارت‌های گرافیک مدرن سری ۵۰ انویدیا (Nvidia) مانند RTX 5070 و RTX 5080 تولید کند. با این حال، آن‌ها بیان کردند که اگر از تصاویر مرجع زیادی استفاده کنید، ممکن است بسیار بیشتر طول بکشد و ویرایش تصویر کندترین عملکرد مدل در آزمایش آن‌ها بوده است.

سایرین این مدل را روی سخت‌افزارهای قدیمی‌تر و بسیار سبک‌تر کار انداخته‌اند. یک کاربر ادعا می‌کند که از آن برای تولید تصاویری با وضوح 2K در حدود ۵۰ ثانیه با استفاده از یک کارت RTX 3060 شرکت انویدیا و ۶۴ گیگابایت حافظه استفاده می‌کند.

یک کاربر به اندازه کافی خوش‌شانس است که یک کارت RTX 6000 Pro برای کار کردن دارد. در آنجا، سخت‌افزار قدرتمند قادر است تصاویر 1024 در 1024 را تنها در چند ثانیه خارج کند.

اگرچه راه‌اندازی و استفاده از هوش مصنوعی محلی هنوز فاصله زیادی با دسترسی‌پذیری پلتفرم‌های مبتنی بر ابر مانند Nano Banana گوگل و مدل‌های GPT Image شرکت اوپن‌آی‌آی دارد، اما نتایج اولیه حداقل در ظاهر چشمگیر به نظر می‌رسند. اگر مجموعه ویژگی‌ها تحت آزمایش‌های دقیق‌تر دوام بیاورد، کسانی که خواهان تولید تصویر سریع و باکیفیت هستند اما به صورت محلی با کنترل کامل و بدون نیاز به حساب‌های ابری یا اشتراک‌ها اجرا می‌شوند، می‌توانند آن را به یک رقیب سرسخت تبدیل کنند.

معمای صدور مجوز

از میان تمام نظرات کاربران اولیه Qwen Image 2.1، بحثی که مدام مطرح می‌شود این است که توسعه‌دهندگان چگونه با مجوز (licensing) برخورد می‌کنند. عبارت‌بندی به این شکل مبهم به نظر می‌رسد:

«شما تحت مالکیت معکری یا سایر حقوق متعلق به ما که در مواد تجسم یافته است، یک مجوز محدود غیرانحصاری، جهانی، غیرقابل انتقال و بدون حق امتیاز برای استفاده، بازتولید، توزیع، کپی، ایجاد آثار مشتق شده و ایجاد تغییرات در مواد منحصراً برای اهداف غیرتجاری دریافت می‌کنید.»

سپس می‌گوید که هرکسی که بخواهد از آن «مواد» برای اهداف تجاری استفاده کند، باید یک مجوز از تیم Qwen به‌طور خاص برای آن مورد استفاده دریافت کند. این امر نگرانی کافی را در جامعه ایجاد کرده است که تیم Qwen بیانیه‌ای را در توییتر/ایکس منتشر کرد:

این بیانیه بیشتر مسائل را روشن می‌کند. هر چیزی که با این مدل تولید می‌کنید نباید به عنوان یک ماده مجاز طبقه‌بندی شود، بنابراین نباید مشمول این بند شود.

با این حال، معنای این امر این است که خود مدل بدون مجوز از علی بابا قابل فروش مجدد نیست. این بسیار متفاوت از مدل آپاچی (Apache) است که نسخه اصلی Qwen Image بر اساس آن ساخته شده بود و به‌طور بالقوه تعریف وزن‌باز را کش می‌دهد. قطعاً به آن بازی که می‌توانست باشد، باز نیست.

اما برای بیشتر مردم، این موضوع نگران‌کننده‌ای نیست. شما می‌توانید Qwen Image 2.1 را روی سخت‌افزار محلی خود اجرا کنید تا تصاویر تولید شده بسیار مؤثری بسازید و از آن‌ها هر طور که می‌خواهید استفاده کنید. با چنین طراحی سبک‌وزنی که قابلیت‌های چشمگیری ارائه می‌دهد، دیدن پاسخ توسعه‌دهندگان مدل‌های وزن‌بسته جالب خواهد بود.


منبع: tomshardware.com

نظرات۰

برای نوشتن نظر، وارد حساب خود شوید.

ورود / ثبت‌نام

هنوز نظری ثبت نشده — اولین نفری باش که نظر می‌دهد.