+− THE DAILY DIFFdev & AI news
SHIP IT

Google har precis lanserat en hackningsmodell. Här är skillnaden.

Google lanserade Gemini 3.8 Flash (0,75 USD in / 3,75 USD ut, priset fördubblas 1 januari) och Gemini 3.8 Flash Cyber – en sårbarhetssökande modell som de endast säljer till 650 granskade "betrodda försvarare" – och fyra timmar senare lanserade Meta Muse Spark 1.3 med en "bidragsgivare"-nivå på 0,10 USD per miljon där rabatten är din sessionsutskrift.

Google lanserade Gemini 3.8 Flash (0,75 USD in / 3,75 USD ut, priset fördubblas 1 januari) och Gemini 3.8 Flash Cyber – en sårbarhetssökande modell som de endast säljer till 650 granskade "betrodda försvarare" – och fyra timmar senare lanserade Meta Muse Spark 1.3 med en "bidragsgivare"-nivå på 0,10 USD per miljon där rabatten är din sessionsutskrift. Vi jämför båda mot det enda riktmärket som inget av företagen skrev. Bedömning: SHIP IT.

Vad den här videon täcker

  • Google lanserar Gemini 3.8 Flash + Flash Cyber (86,2 % CyberGym, Fairwind Program)
  • Meta lanserar Muse Spark 1.3: 1,25 USD/4,25 USD, eller 0,10 USD/0,20 USD om Meta får träna på den
  • Tre webbplatser skapade 215 128 falska "bästa programvara"-sidor; Perplexity citerar dem

Översatt transkription

Översatt från den ursprungliga engelska berättelsen. Tillgängligt ljud och undertexter styrs av YouTube.

0:00 Google lanserade sin tredje Flash-modell på sex veckor idag, plus en version tränad att hacka, och fyra timmar senare lanserade Meta en modell som kostar tio cent per miljon tokens om du låter Zuckerberg läsa din kod, så AI-priskriget har nu en cybersäkerhetsdivision. Det är onsdag, och skillnaden är lång. Gemini 3.8 Flash nådde elvahundra poäng på Hacker News, Muse Spark 1.3 tog nästan sjuhundra mer, och däremellan, hittade en forskningsverksamhet tre webbplatser som publicerade tvåhundrafemton tusen

0:28 falska bästa-programvara-sidor enbart för att Perplexity skulle citera dem. Också idag: ett inlägg som ber dig att hålla fast vid din Firefox fick niohundra åttioåtta poäng, och Mistrals hjälpsida om att avstå från träning fick nästan femhundra, mestadels från européer som upptäckte att det suveräna alternativet tränar på dina prompter som standard. I den här videon: vad Gemini 3.8 Flash faktiskt kostar, hackningsmodellen Google endast kommer att sälja till sexhundrafemtio partners, Metas tiocentsnivå och vad den verkligen debiterar, och det enda riktmärket som inget av företagen skrev.

0:59 Det är onsdag den 2 september, och detta är The Daily Diff. Gemini 3.8 Flash är sjuttiofem cent per miljon tokens in och tre sjuttiofem ut, samma som 3.7 Flash från tre veckor sedan, med en fotnot som säger att priset fördubblas den 1 januari, vilket är en gratis provperiod med extra steg. På slide-deck-riktmärkena, som är obesegrade, får den 54,9 procent på HLE-Verified, X säger att den slår Sol och Opus 5 på Terminal-Bench, och Logan Kilpatrick publicerade 73,7 på DeepSWE, det enda långa-horisonten

1:29 kodningsriktmärket som ännu inte har memorerats, påstås det. Simon Willison bad den att göra en cool sak i HTML och fick en partikelsimulering på tretton sekunder för 1,8 cent, körande i sextio bildrutor per sekund, eftersom de sextio var hårdkodade i sidan. Googles eget inlägg förklarar vinsterna med en mening jag skulle rama in: 3.8 Flash arbetar hårdare. Den utför extra resonemangssteg, anropar verktyg iterativt, och, citat, kan använda fler tokens, vilket är företagsspråk för att mätaren går snabbare. Den oberoende DeepSWE-styrelsen håller med på båda punkter: Flash får sjuttiofyra

2:02 procent, oavgjort med Opus 5 till en femtedel av kostnaden per uppgift, men den behövde etthundrasextiosex steg och etthundrafyrtiotretusen utdata-tokens för att komma dit, mer än dubbelt så mycket som Sol använde. Artificial Analysis brände etthundrafyrtio miljoner tokens och ettusen sjuttioåtta dollar bara för att betygsätta den. Billig per token, pratig per uppgift, och den första token anländer efter tolv sekunders tänkande. Sedan den intressanta halvan.

2:23 Gemini 3.8 Flash Cyber är samma modell med säkerhetsspärrarna lossade för, citat, betrodda försvarare, och Sundar säger att den når 86,2 procent på CyberGym, riktmärket för att autonomt hitta sårbarheter. Den patchar också: 47,2 procent på CWE-Bench mot 47,8 för en ledande gränsmodell, Chrome-teamet säger att den producerade 2,6 gånger fler korrekta patchar än mycket större kommersiella modeller, och Googles molnforskare använde den för att hitta en kritisk sårbarhet på under två timmar, ett jobb som vanligtvis tar månader, eller en motiverad tonåring.

2:54 Google insisterar på att de prioriterade fixar framför utnyttjande, vilket är det artiga sättet att säga att modellen absolut kan ta sig igenom hålen, de bad den bara att inte göra det. Så du kan inte få den. Åtkomst sker via ett nytt Fairwind Program: regeringar, kritisk infrastruktur och sexhundrafemtio granskade partners med obligatoriska tvåfaktors. Varje gränslaboratorium äger nu en hackningsmodell som de inte kommer att sälja dig, och den här veckan är det en billig sådan.

3:16 Fyra timmar senare släppte Meta Muse Spark 1.3, och Zuck kallade den för gränsöverskridande prestanda nästan för billig för att mäta, vilket är sant, med en asterisk lika stor som Menlo Park. Den normala slutpunkten är en dollar tjugofem in och fyra tjugofem ut, mer än Gemini. Bidragsgivarens slutpunkt är tio cent in, tjugo cent ut, cacheläsningar till en femtedel av ett cent, upp till tjugo gånger billigare, och den enda skillnaden är en kolumn som säger 'används för att förbättra våra produkter'.

3:40 Så rabatten är ditt sessionsutskrift, och för en gångs skull behöver ingen läsa licensen, eftersom Meta skrev licensen som en prislista. Toppkommentar: det är nu helt uppenbart hur mycket det är värt att stjäla mina tokens. Andra kommentaren undrar hur lång tid det dröjer innan någon extraherar en AWS-nyckel från en modell tränad på bidragsgivarprompter. På Metas egen resultattavla får Spark 1.3 75.4 på DeepSWE, över Sol och Opus 5, och Meta säger att den använder tjugo procent färre verktygsanrop

4:06 och tjugofem procent färre tokens än 1.2, det exakt motsatta vad Google satsade på, så idag är de två största annonsföretagen på jorden oense om huruvida att prata mer är bra. Samtidigt frågade Trellner Research Perplexity om den bästa programvaran i trehundra åttio kategorier och läste varje citat: 59.8 procent kom från webbplatser utanför topp hundra tusen, Wikipedia citerades tre gånger av sju och ett halvt tusen, och tre systerwebbplatser med tvåhundrafemton tusen genererade köpguider titulerar sina hemsidor Fakta och Grundningssida,

4:34 adresserade till sökroboten, inte till dig. AI SEO-kriget har börjat, och dess första vapen är regex med en marknadsföringsbudget. Det är många prislappar för en onsdag; om du hellre vill läsa detta än höra mig säga det, landar The Daily Diff i din inkorg varje morgon – gratis på thedailydiff.dev, länk nedan. Så, dagens dom: SHIP IT. Gemini 3.8 Flash ligger lika med Opus 5 på den enda tavlan som Google inte skrev, för en femtedel av priset. Läs bara tokenräkningen och Metas kolumnrubriker.

5:00 Det är dagens diff. Jag är Niko från Axrisi. Sammanfoga ansvarsfullt. REVERT. NEEDS REVIEW.

Källor

  1. Introducing Gemini 3.8 Flash and 3.8 Flash Cyberblog.google
  2. Fairwind Programblog.google
  3. DeepSWE v1.1 leaderboarddeepswe.datacurve.ai
  4. Artificial Analysis: Gemini 3.8 Flashartificialanalysis.ai
  5. Muse Spark 1.3 pricingdeveloper.meta.com
  6. Introducing Muse Spark 1.3research.meta.ai
  7. Hang on to Your Firefoxwww.newsonaut.com
  8. Mistral: opting out of traininghelp.mistral.ai
  9. HN: Gemini 3.8 Flashnews.ycombinator.com
  10. HN: Muse Spark 1.3news.ycombinator.com
  11. HN: 215,128 "best software" pagesnews.ycombinator.com

Relaterade videor