+− THE DAILY DIFFdev & AI news
NEEDS REVIEW

Gemini 4 Argon ist Googles bestes Modell. Sie können es noch nicht verwenden.

Google hat Gemini 4 Argon, sein neues Spitzenmodell, angekündigt, und nur vertrauenswürdige Cyber-Verteidiger können es nutzen.

Google hat Gemini 4 Argon, sein neues Spitzenmodell, angekündigt, und nur vertrauenswürdige Cyber-Verteidiger können es nutzen. Hier ist, was Googles eigene 19-zeilige Benchmark-Tabelle zeigt, was die unabhängige Bestenliste gemessen hat und wann Entwickler es erhalten könnten. Fazit: NEEDS REVIEW.

Die schriftliche Ausgabe lesen (Englisch) ↗

Was dieses Video behandelt

  • Gemini 4 Argon: eine Million Ausgabe-Tokens, 2 $ Eingabe, und Sie können es nicht verwenden
  • Innerhalb von Google: Argon-Agenten portieren C++ nach Rust
  • Googles eigene Tabelle: Argon führt 13 von 19 Zeilen an
  • Der Cyber-Pitch: Patches von selbst, keine Schutzmechanismen für Verteidiger
  • Die externe Zahl: Artificial Analysis sagt 53, Opus 5.5 hat 58

Übersetztes Transkript

Aus der englischen Originalerzählung übersetzt. Verfügbare Audio- und Untertitel werden von YouTube gesteuert.

Gemini 4 Argon: eine Million Ausgabe-Tokens, 2 $ Eingabe, und Sie können es nicht verwenden

0:00 Man würde meinen, ein Start bedeutet, dass man das Modell bekommt. Google hat gerade Gemini vier Argon gestartet, und es sei denn, Sie sind ein vertrauenswürdiger Cyber- Verteidiger, können Sie es nicht anfassen. In diesem Video: Was zeigt Googles Tabelle? Was haben externe Tester gemessen? Und wann bekommen Sie es? Sie haben wahrscheinlich schon die Hype-Videos gesehen. Ich habe stattdessen die Benchmark-Tabelle gelesen, und zwei Zeilen daraus haben es nie in den

0:20 Beitragstext geschafft. Ich werde am Ende darauf eingehen. Es ist Donnerstag, der erste Oktober, und dies ist The Daily Diff. Zwei Geschichten heute, und die große ist Gemini vier Argon, das Google als seine nächste Ära der Grenzintelligenz bezeichnet. Eine Antwort kann jetzt bis zu einer Million Tokens lang sein, von vierundsechzigtausend, was mehrere Romane in einer einzigen Antwort sind. Der Startpreis beträgt zwei Dollar pro Million Tokens rein und zehn Dollar raus. Das ist genau das, was OpenAI für GPT sechs Punkt eins Sol verlangt,

0:48 das Modell, das ich gestern behandelt habe, und Sol ist eines, das man tatsächlich kaufen kann. Innerhalb von Google ist es bereits im Einsatz.

Innerhalb von Google: Argon-Agenten portieren C++ nach Rust

0:54 Google sagt, Argon-Agenten portieren C und C++ zu Rust im gesamten Unternehmen, bis zu achthunderttausend Zeilen für den Fuchsia-Kernel. Auf Hacker News erinnerte sich ein Ingenieur, als Googles C++-Team Rust nicht einmal in Betracht ziehen wollte und stattdessen Carbon ansah. Jetzt führt ein Modell die Migration durch, über die sie gestritten haben.

Googles eigene Tabelle: Argon führt 13 von 19 Zeilen an

1:12 Nun zur Tabelle. Google platziert Argon neben GPT sechs Astra, Claude Fable und Claude Opus auf neunzehn Zeilen, und Argon liegt in dreizehn davon vorn. Die Schlagzeile ist DeepSWE, ein langer Codierungs-Benchmark, mit achtundsiebzig Prozent, etwa vier Punkte Vorsprung. Der merkwürdigste Sieg ist die juristische Ausarbeitung, wo Argon zwanzig Prozent erreicht und die anderen im einstelligen Bereich bleiben. Es ist die beste Note bei einem Test, den alle nicht bestehen, und bei den Slide-Deck-

1:38 Benchmarks, die ungeschlagen sind, zählt das.

Der Cyber-Pitch: Patches von selbst, keine Schutzmechanismen für Verteidiger

1:41 Der eigentliche Pitch ist Sicherheit. Google sagt, Argon kann kritische Schwachstellen selbst finden, validieren und patchen, und dass vertrauenswürdige Verteidiger es ohne Cyber-Schutzmechanismen erhalten. Wiz nutzte es, um ein kritisches Loch in Krankenhaussoftware zu finden, das frühere Modelle übersehen hatten. Ein kleines Detail. Wiz gehört Google, seit ein dreiunddreißig Milliarden Dollar schwerer Deal im März abgeschlossen wurde. Der Black-Box-Hacking-Test im Beitrag ist also ein Google-Unternehmen, das ein Google- Modell bewertet. Und auf der Bug-Fixing-Bestenliste teilen sich drei Modelle achtundsechzig

2:10 Prozent, und der Balken ganz links gehört Grok. Was haben also externe Tester gemessen?

Die externe Zahl: Artificial Analysis sagt 53, Opus 5.5 hat 58

2:15 Die unabhängige Bestenliste, die ich mit Argon finden konnte, ist Artificial Analysis. Sie bewertet Argon mit dreiundfünfzig auf ihrem Intelligenzindex, auf der hohen Einstellung, was es mit Astra und Fable gleichsetzt. Claude Opus fünf Punkt fünf liegt fünf Punkte voraus. Vor einer Woche sagte ich Ihnen, Opus hätte dort den Spitzenplatz eingenommen, und es hält ihn immer noch. Der faire Teil für Google ist die Rechnung. Ein Argon-Lauf kostet auf diesem Index etwa zwei Dollar pro Aufgabe, ungefähr ein Drittel dessen, was Opus kostet.

Wann bekommen Sie es: „Also halten Sie durch“

2:42 Und wann bekommen Sie es? Google nennt kein Datum. Der Beitrag verspricht Entwicklern, Unternehmen und Verbrauchern so bald wie möglich Zugang, zuerst für zahlende API-Kunden. Sundar Pichais Beitrag auf X sagt: „Also halten Sie durch.“ Bis dahin läuft der Zugang über Fairwind, das Programm, das Google vor einem Monat mit Gemini drei Punkt acht Flash Cyber gestartet hat. Es hat über sechshundertfünfzig Partner, und diese dürfen Argon nur ihren

3:05 Sicherheitsteams übergeben und müssen verfolgen, wer es benutzt. Hacker News nahm es gut auf. Ein Kommentator schrieb: „Gemini besiegt die Behauptungen, kein Modell veröffentlichen zu können, nicht.“ Ein anderer prophezeite, dass Modelle zu Vaporware werden, einer Reihe von Zahlen auf einer Tabelle. Inzwischen hat Netlify Edge Functions neu aufgebaut, die etwa eine Milliarde

Netlify Edge Functions: V8-Isolate zu Micro-VMs, etwa 5x schneller

3:23 Mal am Tag laufen. Sie wechselten von V8-Isolaten in einem gehosteten Dienst zu Firecracker-Micro-VMs im eigenen Netzwerk von Netlify, und ein warmer Aufruf sank von bis zu vierzig Millisekunden auf etwa sechs. Hacker News wies darauf hin, dass Cloudflare Workers ebenfalls V8-Isolate sind und viel schneller laufen, sodass der Großteil des Gewinns so aussieht, als würde die Anfrage das Gebäude nicht mehr verlassen. Ein anderer Kommentator machte sich Sorgen um die Snapshots, weil geklonte Micro-VMs den Zufallszahlenstatus teilen können, wodurch man zwei identische UUIDs erhält.

3:50 Ein Kaltstart, wenn eine Region Ihre Funktion noch nie gesehen hat, trifft etwa ein Prozent der Aufrufe und dauert etwa neun Millisekunden. Und die Micro-VM selbst ist Firecracker, das Amazon für Lambda gebaut hat, sodass ein Kommentator vorschlägt, sich das nächste Mal daran zu erinnern, wenn man AWS verflucht.

Die zwei Zeilen, die Googles Beitrag nie erwähnt

4:06 Nun, diese beiden Zeilen. Auf FrontierSWE und Terminal-bench, zwei Codierungstests, die der Text des Beitrags nie erwähnt, liegt Argon auf Googles eigener Tabelle als Letzter von vier. Terminal-bench platziert einen Agenten in einer echten Shell, was die meisten von uns nutzen würden, und Opus führt es um neun Punkte an. Wenn Sie dies lieber lesen als mich es sagen hören möchten, landet der Diff jeden Morgen kostenlos in Ihrem Posteingang unter the daily diff dot dev, Link unten.

Fazit: NEEDS REVIEW, am Tag, an dem ich es nennen kann

4:29 Also, das heutige Fazit zu Gemini vier Argon. NEEDS REVIEW. Ich würde es so stempeln, weil die unabhängige Zahl, die ich gefunden habe, es auf dem zweiten Platz sieht, und die beiden Codierungszeilen, die mir wichtig sind, es als Letztes sehen, also werde ich es richtig überprüfen, an dem Tag, an dem ich es nennen kann. Abonnieren Sie, drücken Sie die Glocke und sagen Sie mir in den Kommentaren, ob Sie es anders gestempelt hätten. Und das ist der Diff für heute. Ich bin Niko von Axrisi. Verantwortungsbewusst mergen.

Quellen

  1. Googleblog.google
  2. Hacker Newsnews.ycombinator.com
  3. Fairwind Programdeepmind.google
  4. Artificial Analysisartificialanalysis.ai
  5. Sundar Pichaix.com
  6. Demis Hassabisx.com
  7. Google completes acquisition of Wizcloud.google.com
  8. Netlifywww.netlify.com
  9. Hacker Newsnews.ycombinator.com

Ähnliche Videos