جمنای ۳٫۷ فلش گوگل؛ مدلی سریع‌تر برای کدنویسی و ایجنت‌های هوش مصنوعی؟

گوگل چند روز پیش جمنای ۳٫۷ فلش را با تمرکز بر کدنویسی و عامل‌های هوش مصنوعی معرفی کرد؛ مدلی که در چند آزمون کلیدی از نسل قبل جلوتر است.

جمنای ۳٫۷ فلش گوگل؛ مدلی سریع‌تر برای کدنویسی و ایجنت‌های هوش مصنوعی؟

به گزارش سایت دیدبان ایران، گوگل چند روز پیش جمنای ۳٫۷ فلش را با تمرکز بر کدنویسی و عامل‌های هوش مصنوعی معرفی کرد؛ مدلی که در چند آزمون کلیدی از نسل قبل جلوتر است.

تا همین چند وقت پیش، اگر از یک مدل هوش مصنوعی انتظار داشتید باگ‌های پروژه را پیدا کند، چند ابزار را پشت‌سرهم به‌کار بگیرد یا در دل یک کدبیس بزرگ راهش را گم نکند، معمولاً باید به‌سراغ مدل‌های گران‌تر و پرچم‌دار می‌رفتید. مدل‌های سریع‌تر و ارزان‌تر اغلب برای خلاصه‌سازی، ترجمه یا پاسخ‌های ساده‌تر ساخته شده بودند؛ نه برای کاری که نیاز به برنامه‌ریزی چندمرحله‌ای دارد.

حالا گوگل با معرفی Gemini 3.7 Flash می‌خواهد این مرز را کمی جابه‌جا کند. مدل جدید که تنها سه هفته بعد از Gemini 3.6 Flash از راه رسیده، همچنان در رده‌ی Flash قرار دارد؛ یعنی برای استفاده پرتکرار و مقیاس‌پذیر طراحی شده است. بااین‌حال، گوگل می‌گوید توانایی آن در کدنویسی، استفاده از ابزارها و انجام گردش‌کارهای عامل‌محور به‌طور محسوسی بهتر شده است.

در این مقاله، جمنای ۳٫۷ فلش را از زاویه‌ی مشخصات و عملکرد واقعی بررسی می‌کنیم، نتایج آن را در برابر نسل قبل و چند رقیب مهم می‌گذاریم و در نهایت می‌بینیم که آیا این مدل واقعاً می‌تواند جای مدل‌های گران‌تر را در پروژه‌های جدی بگیرد یا نه.

گوگل در ۱۳ آگوست ۲۰۲۶ (۲۲ مرداد) از Gemini 3.7 Flash رونمایی کرد؛ تنها حدود سه هفته پس از عرضه Gemini 3.6 Flash. نسخه جدید به‌عنوان مدل سریع و کاربردی خانواده Gemini 3 برای کدنویسی، توسعه نرم‌افزار، انجام وظایف چندمرحله‌ای و گردش‌کارهای مبتنی‌بر عامل‌های هوش مصنوعی معرفی شده است.

گوگل می‌گوید مدل جدید بر پایه‌ی جمنای ۳٫۶ فلش ساخته شده و با بهبودهای الگوریتمی در هسته‌ی استدلالش، بهتر می‌تواند از پس وظایف پیچیده و طولانی بربیاید. یکی از قابلیت‌های مهم آن، امکان تنظیم میزان reasoning یا استدلال مدل است؛ یعنی کاربر می‌تواند بسته به نیازش بین سرعت پاسخ، کیفیت نتیجه و هزینه تعادل برقرار کند.

Flash دیگر صرفا مترادف «مدل سریع و ارزان برای کارهای ساده» نیست

جمنای ۳٫۷ فلش ورودی تصویر، صدا و ویدئو را دریافت می‌کند و تا یک‌میلیون توکن را در کانتکست خود نگه می‌دارد. این رقم در عمل یعنی مدل می‌تواند انبوهی از اسناد، فایل‌های یک پروژه یا محتوای ویدئویی را در یک جلسه پردازش کند. خروجی مدل همچنان متنی است و سقف آن به ۶۴ هزار توکن می‌رسد.

چنین مشخصاتی به‌تنهایی مدل را به یک برنامه‌نویس خودمختار تبدیل نمی‌کند؛ اما نشان می‌دهد گوگل دیگر مدل‌های Flash را فقط برای درخواست‌های کوتاه و کم‌هزینه نمی‌بیند. این مدل قرار است در نقش موتور اصلی اپلیکیشن‌هایی ظاهر شود که باید بار زیادی را با هزینه‌ی کنترل‌شده پردازش کنند.

یکی از مهم‌ترین تغییرات جمنای ۳٫۷ فلش، تمرکز بیشتر آن بر کارهای چندمرحله‌ای و عامل‌محور است. گوگل می‌گوید مدل هنگام روبه‌روشدن با بن‌بست، بهتر مسیرش را اصلاح می‌کند، دستورها را با وفاداری بیشتری دنبال می‌کند و در فراخوانی ابزارها و برنامه‌ریزی چندمرحله‌ای، دقت بیشتری دارد.

در عمل، اگر این بهبودها در پروژه‌های واقعی هم تکرار شوند، می‌توانند تعداد رفت‌وبرگشت‌ها و اصلاحات دستی موردنیاز توسعه‌دهنده را کاهش دهند.

گوگل در نمونه‌های نمایشی خود، از ساخت بازی سه‌بعدی با یک پرامپت، تبدیل گزارش سالانه PDF به تجربه‌ای تعاملی و هماهنگ‌کردن زیربخش‌های مختلف در یک پروژه‌ی وب نام می‌برد. این نمونه‌ها جذاب‌اند، اما بهتر است آن‌ها را نمایش توانایی مدل بدانیم، نه تضمینی برای تکرار همان نتیجه در هر پروژه.

توسعه‌دهندگان می‌توانند جمنای ۳٫۷ فلش را از طریق API جمنای، Google AI Studio، Google Antigravity و اندروید استودیو آزمایش و در محصولاتشان به‌کار بگیرند. این مدل همچنین در Gemini Enterprise و Gemini Enterprise Agent Platform در دسترس مشتریان سازمانی قرار دارد.

برای کاربران عادی، جمنای ۳٫۷ فلش در Gemini Spark فعال شده است؛ ایجنتی شخصی که زیرنظر کاربر می‌تواند کارهایی مانند جمع‌آوری و سازمان‌دهی فایل‌ها، تهیه پیش‌نویس ایمیل و به‌روزرسانی اسناد وضعیت را انجام دهد. جمنای اسپارک به اشتراک گوگل AI پرو یا اولترا نیاز دارد.

جمنای ۳٫۷ فلش ازطریق گوگل AI استودیو و API جمنای در پلن رایگان نیز قابل آزمایش است؛ اما این پلن محدودیت استفاده دارد و محتوای آن ممکن است برای بهبود محصولات گوگل استفاده شود. برای استفاده جدی و دسترسی به سقف‌های بالاتر، باید از پلن پولی استفاده کرد.

به گفته‌ی گوگل، جمنای ۳٫۷ فلش بیش‌از هر چیز برای مهندسی نرم‌افزار، تولید کد و اتوماسیون ساخته شده است؛ به‌همین دلیل، برجسته‌ترین نتایج رسمی نیز همین حوزه‌ها را هدف می‌گیرند.

یکی از مهم‌ترین آزمون‌ها DeepSWE v1.1 است که عملکرد مدل‌ها را در وظایف مهندسی نرم‌افزار با افق بلندتر می‌سنجد. جمنای ۳٫۷ فلش در این آزمون به امتیاز ۶۵٫۳ درصد رسیده است؛ درحالی‌که 3.6 Flash امتیاز ۴۸٫۶ درصد داشت. به‌بیان دیگر، گوگل از جهشی نزدیک به ۱۷ واحد درصدی در کاری حرف می‌زند که صرفاً تولید چند خط کد نیست و حل مسئله در یک پروژه نرم‌افزاری را دربر می‌گیرد.

جمنای ۳٫۷ فلش بیش‌از هر چیز برای مهندسی نرم‌افزار، تولید کد و اتوماسیون ساخته شده است

در FrontierCode 1.1، که کیفیت کد تولیدی را ارزیابی می‌کند، امتیاز مدل از ۳۴٫۴ درصد در نسل قبل به ۴۳٫۶ درصد رسیده است. امتیاز ۱۵۸۸ Elo در Code Arena نیز نشان می‌دهد مدل تازه برای ساخت رابط‌های وب و اپلیکیشن‌های کامل‌تر، عملکرد بهتری از 3.6 Flash دارد.

در بخش عامل‌های هوش مصنوعی، فاصله دو نسل در AutomationBench چشمگیرتر به‌نظر می‌رسد: 3.7 Flash امتیاز ۳۰٫۴ درصد گرفته، درحالی‌که امتیاز نسخه‌ی قبلی ۱۷ درصد بوده است. گوگل همچنین از بهبود مدل در درک اسناد PDF تخصصی و کار با محیط‌های رایانه‌ای خبر می‌دهد.

جمنای ۳٫۷ فلش در شاخص هوش Artificial Analysis نیز امتیاز ۵۶ را ثبت کرده است؛ چهار امتیاز بالاتر از جمنای ۳٫۶ فلش. این شاخص چند ارزیابی مختلف را با هم ترکیب می‌کند و تصویری کلی‌تر از توانایی مدل ارائه می‌دهد؛ اما مانند هر بنچمارک و شاخص دیگری، جای آزمودن مدل در وظیفه‌ی واقعی را نمی‌گیرد.

اگر Gemini 3.6 Flash قرار بود نشان دهد یک مدل Flash چقدر می‌تواند سریع و کارآمد باشد، Gemini 3.7 Flash می‌خواهد نشان دهد یک مدل سریع و نسبتاً ارزان تا چه حد می‌تواند واقعاً کار انجام دهد.

همه‌ی این اعداد از ارزیابی‌های منتشرشده‌ی خود گوگل آمده‌اند. برخی از بنچمارک‌ها عمومی و برخی دیگر، مانند AutomationBench در جدول گوگل، خصوصی‌اند. بنابراین نتایج برای نشان‌دادن جهت پیشرفت مدل مفید هستند؛ اما معادل آزمون مستقل و تکرارپذیر در تمام سناریوهای واقعی نیستند.

یکی از اشتباهات رایج هنگام بررسی مدل‌های جدید، تبدیل برتری در یک بنچمارک به برتری کلی است. جمنای ۳٫۷ فلش نمونه خوبی از همین موضوع است.

برای مثال، جمنای ۳٫۷ فلش در آزمون Agent’s Last Exam به امتیاز ۲۶٫۳ درصد رسیده است؛ درحالی‌که Claude Sonnet 5 با ۳۳٫۳ درصد عملکرد بهتری دارد. از سوی دیگر، جمنای در OSWorld-2.0 امتیاز ۴۷٫۹ درصدی ثبت کرده که از ۳۳٫۸ درصد جمنای ۳٫۶ فلش بالاتر است؛ اما همچنان به امتیاز ۵۰٫۲ درصدی GPT-5.6 Terra نمی‌رسد.

این اختلاف‌ها نشان می‌دهند که «عملکرد ایجنت هوش مصنوعی» یک معیار واحد نیست. مدلی ممکن است در اجرای گردش‌کارهای مشخص، کدنویسی یا استفاده از ابزارها بسیار خوب عمل کند، اما در آزمونی دیگر که استدلال، کار با رایانه یا حل مسئله چندمرحله‌ای را می‌سنجد، نتیجه متفاوتی داشته باشد.

به‌همین دلیل، بهتر است جمنای ۳٫۷ فلش را یک مدل قدرتمند برای کدنویسی و اتوماسیون بدانیم، نه مدلی که تمام رقبا را در هر سناریویی پشت سر می‌گذارد.

مقایسه جمنای ۳٫۷ فلش با مهم‌ترین رقبا (براساس ارزیابی‌های منتشرشده از سوی گوگل)

البته جمنای ۳٫۷ فلش در چند آزمون هم دست بالا را دارد. برای مثال، در AutomationBench که اجرای گردش‌کارهای سازمانی چندمرحله‌ای را می‌سنجد، امتیاز ۳۰٫۴ درصدی جمنای از GPT-5.6 ترا با ۲۳٫۶ درصد و کلاد سونت ۵ با ۱۰٫۷ درصد بالاتر است. در FrontierCode 1.1 نیز جمنای با امتیاز ۴۳٫۶ درصد، اندکی از کلاد سونت ۵ با ۴۲٫۷ درصد و GPT-5.6 ترا با ۴۱٫۳ درصد پیشی می‌گیرد.

بااین‌حال، GPT-5.6 ترا در آزمون‌های مرتبط با مهندسی نرم‌افزار بلندمدت همچنان رقیب قدرتمندتری است. این مدل در DeepSWE v1.1 امتیاز ۶۹٫۶ درصدی کسب کرده؛ درحالی‌که امتیاز جمنای ۳٫۷ فلش ۶۵٫۳ درصد است. ترا در Terminal-Bench 2.1 نیز با امتیاز ۸۷٫۴ درصد، اندکی بالاتر از جمنای با ۸۵٫۸ درصد قرار می‌گیرد.

در کارهای دانشی نیز نتیجه یک‌طرفه نیست. کلاد سونت ۵ در GDPVal-AA v2 با امتیاز ۱۵۹۸ Elo و GPT-5.6 ترا با ۱۵۷۸ Elo، از امتیاز ۱۵۲۵ Elo جمنای بالاتر هستند. بااین‌حال، جمنای در درک PDF-های تخصصی عملکرد بهتری نشان داده و در GDP.pdf با امتیاز ۳۴ درصد، از کلاد با ۲۸ درصد و GPT با ۲۴٫۷ درصد جلو افتاده است.

نقطه‌ی قوت اصلی‌ جمنای ۳٫۷ فلش، ترکیب توانایی و هزینه است. مدلی در رده‌ی Flash که در برخی وظایف کدنویسی و اتوماسیون به مدل‌های گران‌تر نزدیک می‌شود.

نقطه‌ی قوت اصلی‌ جمنای ۳٫۷ فلش، ترکیب توانایی و هزینه است

برای تیم‌هایی که حجم بالایی از درخواست‌ها را پردازش می‌کنند، نزدیک‌شدن کیفیت مدل به رقبای گران‌تر می‌تواند هزینه‌ی عملیاتی را به‌طور محسوسی کاهش دهد؛ البته به‌شرطی که عملکرد آن در وظایف واقعی، پایدار و قابل‌اعتماد باشد.

گوگل برای جمنای ۳٫۷ فلش تا پایان سال ۲۰۲۶، قیمت مقدماتی تعیین کرده است. هزینه‌ی هر یک‌میلیون توکن ورودی ۰٫۷۵ دلار و هر یک‌میلیون توکن خروجی ۳٫۷۵ دلار است. این نرخ از اول ژانویه‌ی ۲۰۲۷ به‌ترتیب به ۱٫۵ و ۷٫۵ دلار افزایش پیدا می‌کند.

قیمت پایین فعلی یکی از مهم‌ترین برگ‌های برنده‌ی مدل است، اما نباید آن را هزینه‌ی دائمی به‌حساب آورد. اگر قصد دارید محصولی را برای ماه‌ها یا سال‌های بعد بسازید، بهتر است هزینه را با نرخ پس از پایان تخفیف محاسبه کنید.

قیمت اعلام‌شده برای Gemini 3.7 Flash قیمت دائمی مدل نیست

همچنین هزینه‌ی واقعی یک عامل هوش مصنوعی فقط از ضرب تعداد توکن در قیمت API به‌دست نمی‌آید. یک مدل ممکن است ارزان‌تر باشد، اما برای انجام همان کار به درخواست‌های بیشتر، تلاش مجدد یا بازبینی انسانی بیشتری نیاز داشته باشد. در چنین شرایطی، معیار مهم‌تر هزینه‌ی هر کار موفق است؛ نه صرفاً ارزان‌ترین قیمت هر یک‌میلیون توکن.

جمنای ۳٫۷ فلش با وجود پیشرفت‌هایش، همچنان یک مدل زبانی است و امکان تولید اطلاعات نادرست یا توهم در آن وجود دارد. گوگل در مدل‌کارت خود به کندی مقطعی و پایان زمان اجرا نیز اشاره کرده است. گوگل می‌گوید گوگل تاریخ برش دانش (Knowledge Cutoff) جمنای ۳٫۷ فلش را مارس ۲۰۲۶ اعلام کرده است؛ بااین‌حال، در بعضی حوزه‌ها اطلاعات مدل ممکن است به ژانویه ۲۰۲۵ محدود باشد.

همچنین نتایج بنچمارک‌ها نشان می‌دهند عملکرد مدل بسته به نوع تسک تغییر می‌کند. بنابراین نمی‌توان موفقیت آن در یک محیط مشخص را مستقیماً به تمام کاربردهای واقعی تعمیم داد. این مسئله برای ایجنت‌ها اهمیت بیشتری دارد؛ زیرا یک ایجنت‌ هوش مصنوعی ممکن است علاوه بر تولید پاسخ درست، مجبور باشد چندین مرحله را بدون خطا اجرا کند، ابزار مناسب را انتخاب کند، اشتباه خود را درست کند و در نهایت تسک را کامل تحویل دهد. در چنین سناریویی، یک بنچمارک به‌تنهایی نمی‌تواند کیفیت واقعی سیستم را مشخص کند.

به گفته گوگل 3.7 Flash برای کسانی که می‌خواهند ایجنت‌های کاملاً مستقل بسازند، می‌تواند وظایف منفرد کدنویسی را انجام دهد، اما هنوز استقلال لازم را برای زنجیره‌کردن آن‌ها در یک گردش‌کار پژوهشی سرتاسری و بدون دخالت انسان ندارد.

این نکته شاید در نگاه اول بدیهی باشد، اما تفاوت بزرگی میان ساختن یک دموی جذاب و سپردن تغییرات یک محصول واقعی به عامل وجود دارد. در کارهایی که با کدهای اصلی، داده‌های حساس، تراکنش‌های مالی یا تصمیم‌گیری برای کاربران سروکار دارند، نظارت انسانی و تعیین سطح دسترسی محدود برای ایجنت هوش مصنوعی همچنان ضروری است.

از عرضه جمنای ۳٫۷ فلش تنها چند روز می‌گذرد؛ بنابراین بازخوردهای فعلی بیشتر تجربه‌های شخصی کاربران هستند تا نتیجه ارزیابی‌های مستقل با روش یکسان. بااین‌حال، مرور بحث‌های اولیه در ردیت، به‌ویژه در انجمن Google Antigravity، تصویری نسبتاً روشن از نقاط قوت و ضعف مدل ارائه می‌دهد.

کاربران: «جمنای ۳٫۷ فلش نسبت به نسل‌های قبلی Flash در پروژه‌ها عملکرد قابل‌اعتمادتری داشته.»

بیشترین بازخوردهای مثبت به کدنویسی، پیروی از دستورها و سرعت انجام وظایف مربوط می‌شود. برخی کاربران گفته‌اند جمنای ۳٫۷ فلش نسبت به نسل‌های قبلی Flash در پروژه‌هایشان عملکرد قابل‌اعتمادتری داشته و نیازشان به جابه‌جایی میان مدل‌ها را کمتر کرده است. شماری از توسعه‌دهندگان نیز از عملکرد بهتر مدل در وظایف چندمرحله‌ای و کار با کانتکست‌های طولانی رضایت داشته‌اند.

بااین‌حال، تجربه همه کاربران یکسان نیست. بعضی توسعه‌دهندگان می‌گویند خروجی نهایی، با وجود کیفیت مناسب، همچنان به نظارت و اصلاح مداوم نیاز دارد. در برخی گزارش‌ها نیز به مصرف بالای توکن یا نیاز به تلاش‌های مجدد، حتی در بعضی وظایف ساده، اشاره شده است.

کاربران: «خروجی نهایی، با وجود کیفیت مناسب، همچنان به نظارت و اصلاح مداوم نیاز دارد.»

کاربرانی که روی کدبیس‌های بزرگ و پیچیده کار می‌کنند، محتاط‌تر به موضوع نگاه می‌کنند. از نظر آن‌ها، نتایج امیدوارکننده بنچمارک‌ها لزوماً به این معنا نیست که مدل در یک پروژه واقعی و طولانی‌مدت نیز همان‌قدر قابل‌اعتماد خواهد بود. در مقابل، برخی دیگر ترکیب جمنای ۳٫۷ فلش با مدل‌های دیگر را راهی مناسب برای ساخت گردش‌کارهای سریع‌تر و کم‌هزینه‌تر می‌دانند.

در مجموع، برداشت اولیه از جمنای ۳٫۷ فلش مثبت است. این مدل در کدنویسی، سرعت و اجرای وظایف عملی توجه کاربران را جلب کرده، اما هنوز برای همه سناریوها و پروژه‌های جدی به یک انتخاب بی‌چون‌وچرا تبدیل نشده است.

جمنای ۳٫۷ فلش یک ارتقای معنادار برای مدل‌های فلش گوگل محسوب می‌شود. بهبود آن در آزمون‌های کدنویسی، مهندسی نرم‌افزار و اتوماسیون نشان می‌دهد گوگل می‌خواهد مدل‌های سریع و کم‌هزینه را وارد کارهای جدی‌تری کند. اگر این نتایج در استفاده واقعی هم تکرار شوند، توسعه‌دهندگان می‌توانند بخش بزرگی از کارهای تکراری برنامه‌نویسی، تحلیل اسناد و اتوماسیون را با مدلی ارزان‌تر انجام دهند و مدل‌های پرچم‌دار را برای مرحله‌های دشوارتر نگه دارند.

این تغییر شاید برای کاربر عادی چندان ملموس نباشد، اما برای کسب‌وکارهایی که هر روز هزاران درخواست پردازش می‌کنند، اهمیت زیادی دارد. بااین‌حال، جمنای ۳٫۷ فلش هنوز به معنای رسیدن به عامل خودمختار نیست. این مدل می‌تواند دستیار فنی قدرتمندی باشد، نه جایگزینی بدون نظارت برای توسعه‌دهنده، تحلیلگر یا مدیر پروژه.

نظر شما در مورد مدل جدید گوگل چیست؟ آیا شما جمنای ۳٫۷ فلش را امتحان کرده‌اید؟ تجربه‌تان از عملکرد این مدل را در بخش دیدگاه‌ها با زومیت و دیگر کاربران به‌اشتراک بگذارید.

ارسال نظر