10 مرداد 1405
در سالهای اخیر، مرز بین خلاقیت انسانی و پردازشهای ماشینی به شکلی بیسابقه کمرنگ شده است. اگر هنر دیجیتال را یک ساحل در نظر بگیریم، موجهای هوش مصنوعی هر روز بلندتر و قدرتمندتر میشوند. در قلب این طوفان، نامی میدرخشد که نه تنها با
ابزارهای دیگر رقابت میکند، بلکه استانداردهای جدیدی را برای “زیباییشناسی دیجیتال” تعریف کرده است: Midjourney.
با عرضه Midjourney v7، ما دیگر تنها با یک ابزار بهبود یافته روبرو نیستیم؛ ما با یک جهش تکاملی روبرو هستیم. اگر نسخههای قبلی ما را از “ساخت یک تصویر زیبا” به سمت “ساخت یک تصویر با کیفیت” هدایت کردند، نسخه هفتم هدف خود را قرار
داده است: “ساخت واقعیتی که از واقعیت هم زیباتر است.”
Midjourney یک مدل هوش مصنوعی مبتنی بر یادگیری عمیق (Deep Learning) و معماری انتشار (Diffusion Model) است که توسط تیم Midjourney توسعه یافته است. برخلاف مدلهایی مانند DALL-E که بیشتر بر پایه درک دقیق دستورات
متنی (Semantic Understanding) تمرکز دارند، Midjourney بر روی “هنر” تمرکز دارد. این پلتفرم نه تنها دستور شما را میفهمد، بلکه با درک مفاهیم نورپردازی، ترکیببندی (Composition)، بافت و سبکهای هنری تاریخی، خروجیهایی
تولید میکند که از نظر بصری خیرهکننده هستند.
تکامل از نسخه ۱ تا نسخه ۷، مسیری از “تصاویر مبهم و نویزدار” به سمت “شاهکارهای سینمایی” بوده است. در نسخه هفتم، مهندسان توانستهاند بزرگترین چالشهای هوش مصنوعی تولید تصویر، یعنی دقت در جزئیات ظریف انسانی و درک منطقی روابط فیزیکی
در صحنه را حل کنند. در نسخه v7، دیگر خبری از انگشتان اضافه یا اشکال نامتعارف در پسزمینه نیست؛ ما با مدلی روبرو هستیم که “منطق بصری” را درک میکند.
چه چیزی نسخه ۷ را از نسخههای پیشین متمایز میکند؟ پاسخ در بهبود مدلهای زبانی و پردازش تصویر نهفته است. در Midjourney v7، مدل هوش مصنوعی با مجموعهای بسیار حجیمتر و باکیفیتتر از تصاویر و توصیفات هنری آموزش دیده است.
یکی از تغییرات بنیادین، بهبود Natural Language Processing (NLP) است. در نسخههای قدیمی، کاربران مجبور بودند از کلمات کلیدی پراکنده و ساختارهای عجیب استفاده کنند تا نتیجه بگیرند. اما در v7، شما میتوانید مانند یک انسان با هوش
مصنوعی صحبت کنید.
اگر بگویید: “یک نور ملایم عصرگاهی که از بین شکاف درختان بلوط به چشم یک پیرمرد میتابد”، نسخه هفتم نه تنها تمام عناصر را تشخیص میدهد، بلکه تعامل نور و سایه (Global Illumination) را با دقت فیزیکی محاسبه میکند.
اگر نسخه ۶ را یک هنرمند ماهر بدانیم، نسخه ۷ یک “کارگردان سینمایی” است. در این بخش، به بررسی ویژگیهایی میپردازیم که باعث شده Midjourney v7 در صدر جدول ردهبندی جهانی قرار بگیرد.
بزرگترین نقطه ضعف هوش مصنوعی در سالهای گذشته، بازسازی پوست انسان، چشمها و موها بود. تصاویر اغلب بیش از حد صاف (Plastic-like) یا غیرطبیعی به نظر میرسیدند. Midjourney v7 با استفاده از الگوریتمهای جدید، توانسته است
“نقصهای زیبا” را بازسازی کند؛ مثل منافذ ریز پوست، چین و چروکهای طبیعی، و بازتاب نور در مردمک چشم. این یعنی اگر از v7 بخواهید عکسی پرتره از یک پیرمرد تهیه کند، شما بافت واقعی پوست و جزئیات رگهای چشم را خواهید دید که با واقعیت
غیرقابل تشخیص است.
یکی از چالشهای بزرگ در تولید تصویر، قرارگیری درست اشیاء در فضا بود (مثلاً یک لیوان که روی میز شناور است یا سایهای که در جهت اشتباه میافتد). نسخه ۷ با درک عمیقتر از قوانین فیزیک و نورپردازی، روابط بین اشیاء را بهبود بخشیده است. اگر
در پرامپت خود بخواهید “یک گوی شیشهای که نور را از میان خود عبور میدهد و روی زمین منعکس میکند” را توصیف کنید، v7 محاسبات شکست نور (Refraction) را با دقت بسیار بالایی انجام میدهد.
مدلهای قبلی در نوشتن کلمات درون تصویر (مثلاً روی یک تابلو یا تیشرت) بسیار ضعیف عمل میکردند و کلمات معمولاً به شکل حروف نامفهوم بودند. Midjourney v7 با ادغام مدلهای زبانی پیشرفتهتر، اکنون میتواند متنهای دقیق و خوانا را با فونتهای
متنوع در دل تصاویر قرار دهد. این ویژگی، v7 را به ابزاری بیرقیب برای طراحان گرافیک و تبلیغات تبدیل کرده است.
قابلیت Vary Region در نسخه ۷ بسیار هوشمندتر شده است. شما میتوانید بخشی از تصویر را انتخاب کنید و از هوش مصنوعی بخواهید فقط آن بخش را تغییر دهد (مثلاً تغییر رنگ لباس یا اضافه کردن عینک به یک چهره) بدون اینکه ساختار کلی تصویر یا
نورپردازی آن به هم بریزد. همچنین قابلیت Out-painting (گسترش کادر تصویر) اکنون با دقت بسیار بالایی محیطهای اطراف را از نظر منطقی تخمین میزند.
--s, --c, --w) در اختیار شما میگذارد، در حالی که DALL-E بیشتر یک جعبه سیاه است که شما را مجبور میکند با کلمات بازی کنید تا نتیجه بگیرید.
اگرچه طراحی لوگوی دقیق با متن هنوز کمی چالشبرانگیز است، اما Midjourney v7 برای تولید Concept Art و ایدههای اولیه (Moodboards) بینظیر است. یک طراح میتواند با استفاده از پرامپتهای سبک مینیمال یا سهبعدی، دهها ایده اولیه
برای یک برند را در چند دقیقه تولید کند و سپس آنها را در فتوشاپ نهایی کند.
اینستاگرام، تیکتاک و یوتیوب تشنه تصاویر باکیفیت هستند. تولیدکنندگان محتوا میتوانند از v7 برای ساخت تصاویر پسزمینه (Backgrounds) برای ویدئوهای خود، ساخت کاور (Thumbnail) جذاب یوتیوب، یا حتی ساخت شخصیتهای مجازی
(Virtual Influencers) استفاده کنند.
بازارهای جهانی مانند Adobe Stock یا Shutterstock اکنون به شدت به تصاویر تولید شده توسط هوش مصنوعی علاقه دارند (البته با رعایت قوانین کپیرایت). همچنین فروش پرامپتهای حرفهای در سایتهایی مثل PromptBase یک منبع
درآمد غیرفعال (Passive Income) بسیار عالی است.
معماران میتوانند با وارد کردن عکسهای ساده از نقشهها و استفاده از قابلیت Image-to-Image در نسخه ۷، ایدههای خیرهکننده برای طراحی داخلی یا نمای ساختمان با نورپردازیهای مختلف دریافت کنند. این کار زمانِ “رندر گرفتن” را از روزها به چند دقیقه کاهش میدهد.
ما در آستانه یک تحول بزرگ هستیم. Midjourney v7 تنها یک ابزار نیست؛ بلکه یک پل است؛ پلی میان “تصورات ذهنی” و “واقعیتهای بصری”. این تکنولوژی به ما میگوید که محدودیتهای فنی (مثل ناتوانی در نقاشی یا نداشتن تجهیزات گرانقیمت) دیگر مانعی برای هنر نیستند.
اگر میخواهید در عصر هوش مصنوعی عقب نمانید، یادگیری این ابزار را شروع کنید. اما به یاد داشته باشید:
هوش مصنوعی جایگزین هنرمند نمیشود، بلکه هنرمندی که از هوش مصنوعی استفاده میکند، جایگزین هنرمندی خواهد شد که از آن استفاده نمیکند.
با استفاده از فرم «با پیام ذخیره شده موافقید»، میتوانید همین حالا مستقیماً با ما تماس بگیرید.