Gemini 4 Argon بهترین مدل گوگل است. هنوز نمیتوانید از آن استفاده کنید.
گوگل Gemini 4 Argon، مدل جدید و پیشرفته خود را معرفی کرد و فقط مدافعان سایبری مورد اعتماد میتوانند از آن استفاده کنند.
گوگل Gemini 4 Argon، مدل جدید و پیشرفته خود را معرفی کرد و فقط مدافعان سایبری مورد اعتماد میتوانند از آن استفاده کنند. در اینجا آنچه جدول بنچمارک 19 ردیفی خود گوگل نشان میدهد، آنچه که جدول رتبهبندی مستقل اندازهگیری کرده، و زمانی که توسعهدهندگان ممکن است آن را دریافت کنند. حکم: NEEDS REVIEW.
نسخه نوشتاری را بخوانید (انگلیسی) ↗
این ویدیو چه مواردی را پوشش میدهد
- Gemini 4 Argon: یک میلیون توکن خروجی، 2 دلار ورودی، و شما نمیتوانید از آن استفاده کنید
- داخل گوگل: عاملهای آرگون C++ را به Rust پورت میکنند
- جدول خود گوگل: آرگون در 13 از 19 ردیف اول است
- پیشنهاد سایبری: خودکار پچ میکند، بدون حفاظ برای مدافعان
- عدد خارجی: Artificial Analysis میگوید 53، Opus 5.5 دارای 58 است
رونوشت ترجمه شده
ترجمه شده از روایت اصلی انگلیسی. صوت و زیرنویسهای موجود توسط YouTube کنترل میشوند.
Gemini 4 Argon: یک میلیون توکن خروجی، 2 دلار ورودی، و شما نمیتوانید از آن استفاده کنید
0:00 شاید فکر کنید که یک راهاندازی به معنای دریافت مدل است. گوگل به تازگی Gemini 4 Argon را راهاندازی کرده، و مگر اینکه شما یک سایبری مورد اعتماد باشید، نمیتوانید به آن دست بزنید. در این ویدئو: جدول گوگل چه چیزی را نشان میدهد؟ آزمایشکنندگان خارجی چه چیزی را اندازهگیری کردند؟ و چه زمانی آن را دریافت میکنید؟ شما احتمالاً ویدئوهای تبلیغاتی را قبلاً دیدهاید. من در عوض جدول بنچمارک را خواندم، و دو ردیف از آن هرگز به متن
0:20 پست راه پیدا نکردند. در انتها به آنها خواهم پرداخت. امروز پنجشنبه، اول اکتبر است، و این The Daily Diff است. دو داستان امروز، و داستان بزرگ Gemini 4 Argon است، که گوگل آن را عصر بعدی هوش پیشرفته خود مینامد. یک پاسخ اکنون میتواند تا یک میلیون توکن را اجرا کند، از شصت و چهار هزار توکن، که چندین رمان در یک پاسخ واحد است. قیمت راهاندازی دو دلار برای هر میلیون توکن ورودی و ده دلار خروجی است. این دقیقاً همان چیزی است که OpenAI برای GPT 6.1 Sol دریافت میکند،
0:48 مدلی که دیروز پوشش دادم، و Sol مدلی است که شما واقعاً میتوانید آن را بخرید. در داخل گوگل، آن قبلاً در حال کار است.
داخل گوگل: عاملهای آرگون C++ را به Rust پورت میکنند
0:54 گوگل میگوید عاملهای آرگون در حال پورت کردن C و C++ به Rust در سراسر شرکت هستند، تا هشتصد هزار خط برای کرنل Fuchsia. در Hacker News، یک مهندس به یاد آورد که تیم C++ گوگل حتی Rust را در نظر نمیگرفت و به جای آن به Carbon نگاه میکرد. اکنون یک مدل مهاجرتی را انجام میدهد که آنها در موردش بحث میکردند.
جدول خود گوگل: آرگون در 13 از 19 ردیف اول است
1:12 حالا جدول. گوگل Argon را در کنار GPT 6 Astra، Claude Fable و Claude Opus در نوزده ردیف قرار میدهد، و Argon در سیزده مورد از آنها در صدر قرار میگیرد. عنوان اصلی DeepSWE است، یک بنچمارک طولانی کدنویسی، با هفتاد و هشت درصد، حدود چهار امتیاز بالاتر. عجیبترین برد، پیشنویس حقوقی است، جایی که Argon بیست درصد امتیاز میگیرد و بقیه در یک رقم باقی میمانند. این بهترین نمره در آزمایشی است که همه در آن مردود میشوند، و در بنچمارکهای
1:38 اسلاید-دک، که شکستناپذیرند، این مهم است.
پیشنهاد سایبری: خودکار پچ میکند، بدون حفاظ برای مدافعان
1:41 نکته اصلی، امنیت است. گوگل میگوید Argon میتواند آسیبپذیریهای حیاتی را به تنهایی پیدا، تأیید و پچ کند، و اینکه مدافعان مورد اعتماد آن را بدون محافظ سایبری دریافت میکنند. Wiz از آن برای یافتن یک حفره حیاتی در نرمافزار بیمارستان استفاده کرد که مدلهای قبلی آن را از دست داده بودند. یک جزئیات کوچک. Wiz از زمانی که یک معامله سی و دو میلیارد دلاری در ماه مارس بسته شد، متعلق به گوگل است. بنابراین، آزمایش هک جعبه سیاه در پست، یک شرکت گوگل است که به یک مدل گوگل نمره میدهد. و در جدول رتبهبندی رفع باگ، سه مدل شصت و هشت
2:10 درصد را به اشتراک میگذارند، و میله در سمت چپ متعلق به Grok است. پس آزمایشکنندگان خارجی چه چیزی را اندازهگیری کردند؟
عدد خارجی: Artificial Analysis میگوید 53، Opus 5.5 دارای 58 است
2:15 جدول رتبهبندی مستقلی که توانستم با Argon پیدا کنم، Artificial Analysis است. آن Argon را پنجاه و سه در شاخص هوش خود امتیاز میدهد، در تنظیمات بالا، که آن را با Astra و Fable برابر میکند. Claude Opus 5.5 پنج امتیاز جلوتر است. یک هفته پیش به شما گفتم Opus رتبه برتر را در آنجا گرفت، و هنوز هم آن را حفظ کرده است. بخش منصفانه برای گوگل، صورتحساب است. یک اجرای Argon در آن شاخص حدود دو دلار در هر وظیفه هزینه دارد، تقریباً یک سوم هزینه Opus.
چه زمانی آن را دریافت میکنید: "پس محکم نگه دارید"
2:42 و چه زمانی آن را دریافت میکنید؟ گوگل تاریخی را اعلام نمیکند. پست قول دسترسی برای توسعهدهندگان، شرکتها و مصرفکنندگان را در اسرع وقت میدهد، با اولویت برای مشتریان API پولی. پست ساندار پیچای در X میگوید: پس محکم نگه دارید. تا آن زمان، دسترسی از طریق Fairwind است، برنامهای که گوگل یک ماه پیش با Gemini 3.8 Flash Cyber آغاز کرد. این برنامه بیش از ششصد و پنجاه شریک دارد، و آنها ممکن است Argon را فقط به تیمهای امنیتی خود
3:05 بدهند و باید رصد کنند که چه کسی از آن استفاده میکند. Hacker News آن را خوب پذیرفت. یکی از کامنتگذارها نوشت: Gemini اتهامات مربوط به عدم انتشار مدل را شکست نمیدهد. دیگری پیشبینی کرد که مدلها به vaporware تبدیل میشوند، مجموعهای از اعداد در یک جدول. در همین حال، Netlify توابع لبه (Edge Functions) را بازسازی کرد، که حدود یک میلیارد
توابع لبه Netlify: ایزولههای V8 به microVMs، حدود 5 برابر سریعتر
3:23 بار در روز اجرا میشوند. آنها از ایزولههای V8 در یک سرویس میزبانی شده به microVMهای Firecracker در داخل شبکه خود Netlify منتقل شدند، و یک فراخوانی گرم از چهل میلیثانیه به حدود شش میلیثانیه کاهش یافت. Hacker News اشاره کرد که Cloudflare Workers نیز ایزولههای V8 هستند و بسیار سریعتر اجرا میشوند، بنابراین بیشتر برد به نظر میرسد که درخواست دیگر از ساختمان خارج نمیشود. یک کامنتگذار دیگر نگران snapshotها بود، زیرا microVMهای شبیهسازی شده میتوانند حالت اعداد تصادفی را به اشتراک بگذارند، که اینگونه است که دو UUID یکسان دریافت میکنید.
3:50 یک شروع سرد، زمانی که یک منطقه هرگز تابع شما را ندیده باشد، حدود یک درصد از فراخوانیها را شامل میشود و حدود نه میلیثانیه طول میکشد. و خود microVM Firecracker است، که آمازون برای Lambda ساخت، بنابراین یک کامنتگذار پیشنهاد میکند که دفعه بعد که AWS را لعنت میکنید این را به یاد داشته باشید.
دو ردیفی که پست گوگل هرگز اشاره نمیکند
4:06 حالا، آن دو ردیف. در FrontierSWE و Terminal-bench، دو آزمون کدنویسی که متن پست هرگز به آنها اشاره نمیکند، Argon در جدول خود گوگل از بین چهار مدل، آخر میآید. Terminal-bench یک عامل را در یک پوسته واقعی قرار میدهد، که اینگونه است که اکثر ما از آن استفاده میکنیم، و Opus با نه امتیاز از آن پیشی میگیرد. اگر ترجیح میدهید این را بخوانید تا اینکه از من بشنوید، diff هر روز صبح به ایمیل شما میرسد، رایگان در thedailydiff.dev، لینک در پایین.
حکم: NEEDS REVIEW، روزی که بتوانم آن را صدا کنم
4:29 پس، حکم امروز در مورد Gemini 4 Argon. NEEDS REVIEW. من آن را اینگونه مهر میکنم زیرا عدد مستقلی که پیدا کردم آن را همتراز با رتبه دوم نشان میدهد، و دو ردیف کدنویسی که برایم مهم هستند آن را آخر نشان میدهند، بنابراین روزی که بتوانم آن را صدا کنم، آن را به درستی بررسی خواهم کرد. اشتراکگذاری کنید، زنگ را بزنید، و در نظرات به من بگویید که آیا شما آن را متفاوت مهر میکردید. و این diff امروز است. من نیکو از Axrisi هستم. با مسئولیتپذیری ادغام کنید.
منابع
- Googleblog.google
- Hacker Newsnews.ycombinator.com
- Fairwind Programdeepmind.google
- Artificial Analysisartificialanalysis.ai
- Sundar Pichaix.com
- Demis Hassabisx.com
- Google completes acquisition of Wizcloud.google.com
- Netlifywww.netlify.com
- Hacker Newsnews.ycombinator.com



