+− THE DAILY DIFFdev & AI news
SHIP IT

Google ने नुकतेच एक हॅकिंग मॉडेल शिप केले आहे. हा फरक इथे दिला आहे.

Google ने Gemini 3.8 Flash ($0.75 इन / $3.75 आउट, किंमत 1 जानेवारीला दुप्पट होईल) आणि Gemini 3.8 Flash Cyber — एक असुरक्षितता शोधणारे मॉडेल जे ते फक्त 650 तपासलेल्या "विश्वसनीय संरक्षकांना" विकते — शिप केले आणि चार तासांनंतर मेटाने Muse Spark 1.3 शिप केले ज्यात $0.10-प्रति-दशलक्ष "योगदानकर्ता" स्तर आहे जिथे सवलत ही तुमची सत्र प्रतिलिपी आहे.

Google ने Gemini 3.8 Flash ($0.75 इन / $3.75 आउट, किंमत 1 जानेवारीला दुप्पट होईल) आणि Gemini 3.8 Flash Cyber — एक असुरक्षितता शोधणारे मॉडेल जे ते फक्त 650 तपासलेल्या "विश्वसनीय संरक्षकांना" विकते — शिप केले आणि चार तासांनंतर मेटाने Muse Spark 1.3 शिप केले ज्यात $0.10-प्रति-दशलक्ष "योगदानकर्ता" स्तर आहे जिथे सवलत ही तुमची सत्र प्रतिलिपी आहे. आम्ही दोन्हीची तपासणी एका बेंचमार्कवर करतो जो दोन्ही कंपन्यांनी लिहिला नाही. निकाल: SHIP IT.

या व्हिडिओमध्ये काय समाविष्ट आहे

  • Google Gemini 3.8 Flash + Flash Cyber (86.2% CyberGym, Fairwind Program) शिप करते
  • मेटा Muse Spark 1.3 शिप करते: $1.25/$4.25, किंवा $0.10/$0.20 जर मेटा त्यावर प्रशिक्षण देऊ शकते
  • तीन साइट्सने 215,128 बनावट "सर्वोत्तम सॉफ्टवेअर" पृष्ठे तयार केली; Perplexity त्यांचा उल्लेख करते

अनुवादित प्रतिलेख

मूळ इंग्रजी निवेदनातून अनुवादित. उपलब्ध ऑडिओ आणि मथळे YouTube द्वारे नियंत्रित आहेत.

0:00 Google ने आज सहा आठवड्यांत आपले तिसरे Flash मॉडेल शिप केले, त्यासोबत हॅक करण्यासाठी प्रशिक्षित केलेली एक आवृत्ती, आणि चार तासांनंतर मेटाने एक मॉडेल शिप केले जे तुम्ही झुकरबर्गला तुमचा कोड वाचू दिल्यास प्रति दशलक्ष टोकन्सला दहा सेंट्स लागतात, त्यामुळे AI किंमत युद्धात आता सायबरसुरक्षा विभाग आहे. आज बुधवार आहे, आणि फरक मोठा आहे. Gemini 3.8 Flash ने Hacker News वर अकराशे गुण मिळवले, Muse Spark 1.3 ने जवळजवळ सातशे अधिक गुण मिळवले, आणि यांच्या दरम्यान, एका संशोधन केंद्राने तीन वेबसाइट्स शोधल्या ज्यांनी दोन लाख पंधरा हजार

0:28 बनावट सर्वोत्तम-सॉफ्टवेअर पृष्ठे केवळ Perplexity ने त्यांचा उल्लेख करावा म्हणून प्रकाशित केली. आज अजून: Firefox सोबत राहण्यासाठी विनंती करणारी एक पोस्ट नऊशे अठ्ठ्याऐंशी गुण मिळाले, आणि Mistral च्या प्रशिक्षणातून बाहेर पडण्याच्या मदत पृष्ठाला जवळजवळ पाचशे गुण मिळाले, बहुतेक युरोपियन लोकांनी सार्वभौम पर्याय शोधताना तो तुमच्या प्रॉम्प्टवर डीफॉल्टनुसार प्रशिक्षण देतो हे पाहिले. या व्हिडिओमध्ये: Gemini 3.8 Flash ची वास्तविक किंमत काय आहे, Google चे हॅकिंग मॉडेल फक्त सहाशे पन्नास भागीदारांना विकले जाईल, मेटाचा दहा-सेंट स्तर आणि ते वास्तविक किती शुल्क आकारते, आणि एक बेंचमार्क जो कोणत्याही कंपनीने लिहिला नाही.

0:59 आज बुधवार, 2 सप्टेंबर आहे, आणि हे The Daily Diff आहे. Gemini 3.8 Flash हे प्रति दशलक्ष टोकन्ससाठी पंच्याहत्तर सेंट्स इनपुट आणि तीन पंच्याहत्तर आउटपुट आहे, जे तीन आठवड्यांपूर्वीच्या 3.7 Flash सारखेच आहे, एक टीप देऊन की 1 जानेवारीला किंमत दुप्पट होईल, जी अतिरिक्त चरणांसह एक विनामूल्य चाचणी आहे. स्लाइड-डेक बेंचमार्क्सवर, जे अपराजित आहेत, ते HLE-Verified वर 54.9 टक्के गुण मिळवते, X म्हणते की ते Terminal-Bench वर Sol आणि Opus 5 ला हरवते, आणि लोगन किल्पाट्रिकने DeepSWE वर 73.7 गुण पोस्ट केले, जो एकमेव दीर्घ-क्षितिज

1:29 कोडिंग बेंचमार्क आहे जो अद्याप लक्षात ठेवला गेलेला नाही, कथितपणे. सायमन विल्सनने त्याला HTML मध्ये एक छान गोष्ट बनवायला सांगितले आणि 1.8 सेंट्समध्ये तेरा सेकंदात एक कण सिमुलेशन मिळाले, साठ फ्रेम्स प्रति सेकंदात चालणारे, कारण साठ हे पृष्ठात हार्ड-कोडेड होते. Google ची स्वतःची पोस्ट 3.8 Flash या वाक्याने फायदे स्पष्ट करते: 3.8 Flash अधिक काम करते. ते अतिरिक्त तर्कशास्त्र चरणे कार्यान्वित करते, साधनांना पुनरावृत्तीने कॉल करते, आणि, कोट, अधिक टोकन्स वापरू शकते, जे मीटर वेगाने चालते यासाठी कॉर्पोरेट आहे. स्वतंत्र DeepSWE बोर्ड दोन्ही मुद्द्यांवर सहमत आहे: Flash चौऱ्याहत्तर

2:02 टक्के गुण मिळवते, Opus 5 च्या बरोबरीने, प्रति कार्यासाठी एक पंचमांश किमतीत, पण तेथे पोहोचण्यासाठी त्याला एकशे सहासष्ट चरणे आणि एक लाख त्रेचाळीस हजार आउटपुट टोकन्स लागले, जे Sol ने खर्च केलेल्या दुप्पटपेक्षा जास्त आहे. आर्टिफिशियल ॲनालिसिसने एकशे चाळीस दशलक्ष टोकन्स आणि एक हजार अठ्ठ्याहत्तर डॉलर्स फक्त त्याला ग्रेड देण्यासाठी खर्च केले. प्रति टोकन स्वस्त, प्रति कार्य बोलके, आणि पहिले टोकन बारा सेकंद विचार केल्यानंतर येते. नंतर मनोरंजक अर्धा भाग.

2:23 Gemini 3.8 Flash Cyber हेच मॉडेल आहे ज्यात सुरक्षितता रेल "विश्वसनीय संरक्षकांसाठी" शिथिल केली आहे, आणि सुंदर म्हणतो की ते CyberGym वर 86.2 टक्के गुण मिळवते, असुरक्षितता स्वायत्तपणे शोधण्यासाठीचा बेंचमार्क. ते पॅच देखील करते: CWE-Bench वर 47.2 टक्के, आघाडीच्या फ्रंटियर मॉडेलसाठी 47.8 च्या तुलनेत, Chrome टीम म्हणते की त्याने खूप मोठ्या व्यावसायिक मॉडेलपेक्षा 2.6 पट अधिक योग्य पॅच तयार केले, आणि Google च्या क्लाउड संशोधकांनी त्याचा वापर दोन तासांपेक्षा कमी वेळात एक गंभीर असुरक्षितता शोधण्यासाठी केला, एक काम ज्याला सामान्यतः महिने लागतात, किंवा एक प्रेरित किशोरवयीन मुलगा.

2:54 Google आग्रह धरते की त्यांनी शोषणाऐवजी दुरुस्तीला प्राधान्य दिले, जो सभ्य मार्ग आहे हे सांगण्याचा की मॉडेल नक्कीच छिद्रांमधून जाऊ शकते, त्यांनी फक्त त्याला न करण्यास सांगितले. त्यामुळे तुम्हाला ते मिळू शकत नाही. प्रवेश नवीन Fairwind Program द्वारे होतो: सरकारे, महत्वाची पायाभूत सुविधा, आणि सहाशे पन्नास तपासलेले भागीदार अनिवार्य टू-फॅक्टर. प्रत्येक फ्रंटियर लॅबकडे आता एक हॅकिंग मॉडेल आहे जे ते तुम्हाला विकणार नाहीत, आणि या आठवड्यात ते स्वस्त आहे.

3:16 चार तासांनंतर, मेटाने म्युझ स्पार्क 1.3 रिलीझ केले, आणि मार्क झुकरबर्गने त्याला फ्रंटियर परफॉर्मन्स म्हटले जे मोजण्यासाठी खूप स्वस्त आहे, आणि ते खरे आहे, मेन्लो पार्कच्या आकाराच्या एका ताऱ्यासहित. सामान्य एंडपॉइंटला आत येण्यासाठी $1.25 आणि बाहेर जाण्यासाठी $4.25 लागतात, जे जेमिनीपेक्षा जास्त आहे. योगदानकर्त्याच्या एंडपॉइंटला आत येण्यासाठी दहा सेंट आणि बाहेर जाण्यासाठी वीस सेंट लागतात, कॅशे वाचण्यासाठी एका सेंटचा पाचवा भाग लागतो, जो वीस पट स्वस्त आहे, आणि एकमेव फरक म्हणजे एक कॉलम ज्यावर 'आमची उत्पादने सुधारण्यासाठी वापरले' असे लिहिले आहे.

3:40 म्हणून, सूट म्हणजे तुमच्या सत्राचे प्रतिलेखन, आणि एकदाही कोणालाही लायसन्स वाचण्याची गरज नाही, कारण मेटाने लायसन्सला किंमत सूची म्हणून लिहिले आहे. शीर्ष टिप्पणी: माझे टोकन चोरणे किती किमतीचे आहे हे आता पूर्णपणे स्पष्ट झाले आहे. दुसरी टिप्पणी विचारते की योगदानकर्त्यांच्या प्रॉम्प्ट्सवर प्रशिक्षित केलेल्या मॉडेलमधून कोणीतरी AWS की कधी काढेल. योगदानकर्त्यांच्या प्रॉम्प्ट्सवर प्रशिक्षित केलेल्या मॉडेलमधून कोणीतरी AWS की कधी काढेल. मेटाच्या स्वतःच्या स्कोअरकार्डवर, स्पार्क 1.3 ला डीपएसडब्ल्यूईवर 75.4 गुण मिळतात, सोल आणि ओपस 5 पेक्षा जास्त, आणि मेटा म्हणते की ते 1.2 पेक्षा वीस टक्के कमी टूल कॉल्स

4:06 आणि पंचवीस टक्के कमी टोकन वापरते, जो Google च्या पूर्णपणे विरुद्ध अंदाज आहे, त्यामुळे आज पृथ्वीवरील दोन सर्वात मोठ्या जाहिरात कंपन्या बोलणे चांगले आहे की नाही यावर असहमत आहेत. बोलणे चांगले आहे की नाही यावर असहमत आहेत. दरम्यान ट्रेल्नर रिसर्चने पर्प्लेक्सिटीला तीनशे ऐंशी श्रेणींमध्ये सर्वोत्तम सॉफ्टवेअर विचारले आणि प्रत्येक संदर्भ वाचला: 59.8 टक्के संदर्भ शीर्ष एक लाख बाहेरील साइट्समधून आले, विकिपीडियाचा उल्लेख साडेसात हजार पैकी तीन वेळा केला गेला, आणि साडेसात हजार पैकी तीन वेळा केला गेला, आणि दोन लाख पंधरा हजार निर्माण केलेल्या खरेदी मार्गदर्शिकांसह तीन भगिनी साइट्स त्यांच्या मुख्यपृष्ठांना 'फॅक्ट्स अँड ग्राउंडिंग पेज' असे शीर्षक देतात,

4:34 त्यांच्या मुख्यपृष्ठांना 'फॅक्ट्स अँड ग्राउंडिंग पेज' असे शीर्षक देतात, जे क्रॉलरसाठी आहे, तुमच्यासाठी नाही. एआय एसईओ युद्ध सुरू झाले आहे, आणि त्याचे पहिले शस्त्र मार्केटिंग बजेटसह रेगेक्स आहे. एका बुधवारीसाठी हे खूप किमतीचे टॅग आहेत; जर तुम्हाला हे वाचायला आवडत असेल मी बोलण्याऐवजी, द डेली डिफ दररोज सकाळी तुमच्या इनबॉक्समध्ये येते — daily diff.dev वर मोफत, लिंक खाली आहे. तर, आजचा निर्णय: SHIP IT. जेमिनी 3.8 फ्लॅश ओपस 5 ला Google ने न लिहिलेल्या एका बोर्डवर बरोबरी करतो,

5:00 किंमतीच्या पाचव्या भागासाठी. फक्त टोकन बिल वाचा, आणि मेटाचे कॉलम हेडर वाचा. तो आजचा diff आहे. मी Axrisi मधून Niko आहे. जबाबदारीने विलीन करा.

स्रोत

  1. Introducing Gemini 3.8 Flash and 3.8 Flash Cyberblog.google
  2. Fairwind Programblog.google
  3. DeepSWE v1.1 leaderboarddeepswe.datacurve.ai
  4. Artificial Analysis: Gemini 3.8 Flashartificialanalysis.ai
  5. Muse Spark 1.3 pricingdeveloper.meta.com
  6. Introducing Muse Spark 1.3research.meta.ai
  7. Hang on to Your Firefoxwww.newsonaut.com
  8. Mistral: opting out of traininghelp.mistral.ai
  9. HN: Gemini 3.8 Flashnews.ycombinator.com
  10. HN: Muse Spark 1.3news.ycombinator.com
  11. HN: 215,128 "best software" pagesnews.ycombinator.com

संबंधित व्हिडिओ

daily · mr · १ ऑक्टो, २०२६

जेमिनी 4 आर्गॉन हे Google चे सर्वोत्तम मॉडेल आहे. तुम्ही ते अजून वापरू शकत नाही.

Google ने जेमिनी 4 आर्गॉन, त्याचे नवीन फ्रंटियर मॉडेल घोषित केले, आणि केवळ विश्वसनीय सायबर डिफेंडर्सच ते वापरू शकतात. Google च्या स्वतःच्या 19-पंक्तींच्या बेंचमार्क टेबलमध्ये काय दाखवले आहे, स्वतंत्र

4:53 ↗
daily · mr · २७ सप्टें, २०२६

Grok 4.7 ची किंमत तीच, पण बिल दुप्पट

Grok 4.7 ची प्रति टोकन किंमत Grok 4.6 इतकीच आहे, $2 इन आणि $6 आउट. मग प्रति कार्य स्वतंत्र बिल दुप्पट का झाले आणि ते खरोखरच "दुप्पट वेगाने" आहे का? एक आठवड्यानंतरचा फॉलो-अप. @therealhaas द्वारे विनंती

4:56 ↗
daily · mr · २२ सप्टें, २०२६

ऍमेझॉनने मेटाच्या म्यूझला आपल्या स्टोअरमधून बाहेर काढले. हा फरक आहे.

रविवार रात्रीपासून, मेटाच्या म्यूझ एजंटला amazon.com वर एक पॉपअप दिसतो आहे: “अनधिकृत एआय एजंटद्वारे सततचा प्रवेश ऍमेझॉनच्या वापराच्या अटींचे उल्लंघन करतो.” ऍमेझॉनने ऑगस्टमध्ये परप्लेक्सीटीच्या कॉमेट व

5:08 ↗
daily · mr · ३ ऑक्टो, २०२६

Apple ने AI एजंट्सवर ब्रेक लावला

Apple ने अतिरिक्त macOS फुल डिस्क ॲक्सेस नियंत्रणे योजना आखली आहे कारण स्वायत्त AI एजंट्समुळे मोठ्या डेटा ॲक्सेसचा धोका वाढतो. आम्ही सध्याची परवानगी, मेटाचा वादग्रस्त म्यूझ मेसेजेस केस आणि ऐतिहासिक एज

5:08 ↗