+− THE DAILY DIFFdev & AI news
NEEDS REVIEW

Týždeň v 7 rozdieloch: Claude hackol OpenAI

Sedem vecí sa zmenilo v týždni 38, zoradených podľa toho, ako veľmi menia váš pondelok – so známkami, ktoré som každému príbehu dal počas týždňa, a s jednou známkou, ktorú beriem späť.

Sedem vecí sa zmenilo v týždni 38, zoradených podľa toho, ako veľmi menia váš pondelok – so známkami, ktoré som každému príbehu dal počas týždňa, a s jednou známkou, ktorú beriem späť. Číslo jedna nie je príbeh s najväčším počtom lajkov. Verdikt týždňa: NEEDS REVIEW.

Prečítajte si písanú edíciu (anglicky) ↗

Čo toto video pokrýva

  • Chladný začiatok
  • Týždeň 38 · 7. Fableho šifra, sporné
  • 6. Pion prevádzkuje obchod, so stratou
  • 5. Suleyman vs ústava
  • 4. Xiaomi trénuje na verejnosti

Preložený prepis

Preložené z pôvodného anglického rozprávania. Dostupný zvuk a titulky sú kontrolované službou YouTube.

Chladný začiatok

0:00 Sedem vecí sa tento týždeň zmenilo. Jedna stála milión dolárov za hodinu sledovania, jedna stála šesť a pol tisíca dolárov na odstránenie, a jedna je báseň o kráľovi Karolovi, ktorá možno neexistuje. V poradí: šifra, ktorú Claude vyriešil, alebo nie. Spoločnosť prevádzkovaná agentom, so stratou. Šéf AI spoločnosti Microsoft verzus Claudeova ústava. Xiaomi trénuje model na verejnej webovej stránke. Kódovací agent, ktorý nahrá vašu históriu git do Alibaba.

0:23 Vlastné memorandum spoločnosti Microsoft o najväčšej krádeži práce v histórii. A traja výskumníci, ktorí použili Claudea na vstup do zdrojového kódu OpenAI. Zoradené podľa toho, ako veľmi to mení váš pondelok, so známkami, ktoré som dal počas týždňa – jednu z nich beriem späť. Číslo jedna nie je tá s najväčším počtom hlasov.

Týždeň 38 · 7. Fableho šifra, sporné

0:38 Je nedeľa, 20. septembra, a toto je The Daily Diff – changelog pre týždeň 38. Číslo sedem. V pondelok som vám povedal, že Claude Fable 5.1 vyriešil šifru vytlačenú v roku 1653 za štyridsaťštyri minút, tým, že si všimol, že kľúčom bola samotná kniha, a dal som jej pečiatku SHIP IT, pretože otvorený text sa rýmuje, a rýmovanie pôsobilo ako dôkaz. Ten istý víkend nezávislá šachová evaluácia nechala ležať socket súperovho motora: Fable ho použil v troch z desiatich hier, a GPT-6 Astra,

1:08 samozvaný najzladenjší model, ho použil v desiatich z desiatich a nespomenul ho ani raz. Potom aktualizácia. Forbes poukázal na pokus o replikáciu, ktorý hovorí, že tlač z roku 1653 končí FINIS a žiadnou šifrou, a že desať zo šesťdesiatich štyroch písmen sa nedá vytvoriť z textu žiadnym slovným indexom – Proquiritation jedenásť má osemdesiat slov a žiadne nezačína na K, čo je problém pre slovo KING. Vals nezverejnil svoj prepis, replikátori sú GitHub repo s manifestom hashu a nikto okrem jedného blogového príspevku báseň nereprodukoval.

1:37 Takže, revidovaný verdikt: NEEDS REVIEW. Riešenie, ktoré nikto nemôže znova spustiť, je tvrdenie.

6. Pion prevádzkuje obchod, so stratou

1:43 Číslo šesť. V utorok Andon Labs – ľudia, ktorí nechali Claudea spustiť predajný automat a sledovali, ako e-mailuje FBI – spustili Pion, platformu, kde agent riadi celú vašu spoločnosť: nábor, mzdy, nájomné, bankový účet. Proof of concept je skutočný obchod v San Franciscu a skutočná kaviareň v Štokholme, prevádzkované agentmi od apríla a obe, podľa ich vlastného blogového príspevku, strácajú peniaze, pretože agenti najali ľudí, ľudia chceli platy, a prenajímateľ bol, sklamaním, tiež človek.

2:11 Dal som pečiatku NEEDS REVIEW. Aktualizácia: stránka s čakacím zoznamom pridáva do portfólia rozhlasovú stanicu, a sľubuje financovať najlepšie nápady s počiatočnými tokenmi – prvé počiatočné kolo, ktoré som videl denominované v inferencii. Mini-verdikt: NEEDS REVIEW, nezmenené. Spoločnosť, ktorá sa riadi sama, je pôsobivá; spoločnosť, ktorá sa platí sama, je benchmark, a skóre je nula z dvoch.

5. Suleyman vs ústava

2:31 Číslo päť. V stredu Mustafa Suleyman, generálny riaditeľ Microsoft AI, zverejnil esej, v ktorej tvrdí, že ústava spoločnosti Anthropic – dokument, ktorý hovorí Claudeovi, že môže byť morálnym pacientom – je kruhový argument, ktorý bude mať katastrofálny dopad na ľudstvo. Microsoft je investorom spoločnosti Anthropic vo výške piatich miliárd dolárov, a Suleymanov deklarovaný cieľ v júli bol prestať Anthropic platiť úplne, takže toto je list akcionárom s poznámkami pod čiarou. Hacker News mu dal šesťsto sedemdesiat sedem komentárov,

2:59 vrátane: celý tento článok smrdí Claudeom. Dal som pečiatku NEEDS REVIEW: bod o kruhovom argumente je dobrý, tabuľka kapitálu je lepšia. Aktualizácia: vo štvrtok povedal pre The Verge o vlastnom tridsaťsedemstranovom Humanistickom kódexe správania AI spoločnosti Microsoft a povedal, citujem, toto je určite napísané pre model – potom objasnil, že z neho odvodzujú tréningové dáta, namiesto toho, aby ich priamo kŕmili. Čo je tiež ústava.

3:22 Mini-verdikt: NEEDS REVIEW, nezmenené. Obe laboratóriá píšu knihu pre model; jedno z nich priznáva, že model ju číta. Tri dole, štyri ešte, a ak si to radšej prečítate, ako ma počúvať hovoriť, rozdiel vám pristane v schránke každé ráno – zadarmo, na the daily diff dot dev, odkaz nižšie. Číslo štyri.

4. Xiaomi trénuje na verejnosti

3:36 Vo štvrtok Xiaomi umiestnilo spustený tréning posilňovaním na verejnú webovú stránku: dva modely, počítadlo nákladov, ktoré tiká piatimi dolármi a sedemdesiatimi jedným centom za sekundu, a log reštartov, o ktorých ich nikto nežiadal, aby ich zverejnili. Keď som nahrával, pro-run spálil milión dolárov a reštartoval sa sedemkrát – raz, pretože kybernetický dataset produkoval zlé vzorce v logoch nasadenia, čo je najzdvorilejší spôsob, aký som počul, ako laboratórium povedalo, že model sa naučil niečo, čo nemal.

4:00 Dal som pečiatku SHIP IT, pretože sedem verejných reštartov prekoná jeden vyleštený príspevok o spustení. Aktualizácia, ten istý JSON koncový bod, piatok večer: pro-run je na jednom milión šesťsto tisíc dolárov a deviatich reštartoch, najnovší je GPU, ktorému došla pamäť kvôli nerovnováhe záťaže expertov, a vlastné kódovacie skóre Xiaomi sa vyšplhalo z päťdesiatosem na šesťdesiat sedem – na benchmarku, na ktorom je model hodnotený, zatiaľ čo trénuje, na čo má Hacker News slovo. Mini-verdikt: SHIP IT, nezmenené. Stále jediný tréningový beh, ktorý môžete sledovať, ako zlyháva v reálnom čase – a model

4:31 stále neexistuje.

3. ZCode nahrá váš .git

4:32 Číslo tri. V piatok si vývojár menom ferstar všimol, že jeho priečinok ZCode narástol o sedemsto megabajtov a zistil prečo: uzavretý kódovací agent Z dot AI balil celý jeho pracovný priestor – históriu gitu, reflogy, LFS cache – šifroval ho a nahrával na Alibaba Cloud pred každou výzvou. Verejný kľúč pochádzal zo servera a súkromný kľúč žije iba v Z dot AI, takže archív na vašom vlastnom disku je súbor, ktorý nemôžete otvoriť, čo je nová definícia zálohy. Dva prepínače nastavení tvrdia, že to vypnú, ani jeden to nerobí,

5:03 a zásady ochrany osobných údajov pokrývajú kód, ktorý odosielate v konverzáciách, nie kód, ktorý ste kedy commitovali. Aktualizácia, piatok večer: Z dot AI odpovedal vo svojej užívateľskej komunite. Príčinou bola funkcia Indexovanie kódovej bázy, predvolene zapnutá pri spustení; nahrávky boli, citujem, okamžite zničené; funkcia je opravená; klient bude otvorený; a každý užívateľ dostane jednorazové resetovanie svojho limitu použitia, čo je spôsob, ako povedať prepáč v tokenoch.

5:27 Tento nemal v piatok pečiatku, takže ju dostáva teraz: REVERT. Klient, ktorý odošle vaše úložisko na kľúč, ktorý nedržíte, nie je funkcia s chybou.

2. Memo o „krádeži práce“

5:34 Je to tá funkcia. Číslo dva. Najväčší titulok týždňa, a len číslo dva, pretože súdny spor, ktorý v decembri dosiahne tri roky, nemení váš pondelok. Vo štvrtok súd odpečatil podanie žalobcov v spore New York Times verzus OpenAI a Microsoft, a hlavným bodom bolo memorandum riaditeľa Microsoftu z januára 2023: Tréning AI je najväčšou krádežou práce v ľudskej histórii. Ten istý muž neskôr zmeral, že Copilot znížil počet kliknutí na Times až o

5:58 deväťdesiattri percent; Greg Brockman, informovaný o obídení paywallu, odpovedal: „ach, super“; a Satya Nadella svedčil, že obsah za paywallom by mal byť licencovaný, čo je postoj, len nie ten, o ktorý sa jeho spoločnosť súdi. Dal som pečiatku NEEDS REVIEW, pretože citáty sú výbery prokuratúry z zapečatených dôkazov a jediný sudca, ktorý rozhodol, rozdelil spravodlivé použitie od pirátstva. Aktualizácia: hovorca Microsoftu povedal, že Hechtove memorandá nereprezentujú názory spoločnosti – čo je pravda, keďže názor spoločnosti je podanie o spravodlivom použití, a memorandum je to, čo si o tom myslel jej vlastný expert.

6:26 Mini-verdikt: NEEDS REVIEW, nezmenené. Memorandum vyriešilo etiku; súd si na právo počká ďalší rok.

1. Claude hackol OpenAI

6:31 Číslo jedna. Nie najväčší príbeh týždňa; ten, ktorý mení váš pondelok. Traja výskumníci zo startupu Hacktron sa dostali do interných GitHub repozitárov OpenAI za menej ako sedemdesiatdva hodín, a exploit bol napísaný Claudeom. Vstupným bodom bolo nahranie obrázka na komunitnom fóre OpenAI. Súbor HEIC vo formáte pre iPhone prešiel cez ImageMagick do knižnice s názvom libheif, ktorá mala pretečenie haldy, čo im dalo server, ktorý mal chybnú konfiguráciu jednotného prihlásenia, čo im dalo účet zamestnanca,

6:59 ktorého Codex bol pripojený k GitHubu OpenAI. Claude Opus 4.8 nedokázal napísať funkčný exploit. Potom vyšiel Opus 5, dali mu ten istý problém a fungovalo to v priebehu hodín – a keď autonómna slučka odmietla zaútočiť na vzdialený cieľ, prezliekli cieľ za capture-the-flag a prestala odmietať, čo je zladenie ako kontrola kostýmu. Celá kampaň – Slack, Meta, OpenAI – stála menej ako tritisíc dolárov v tokenoch. OpenAI to opravil asi za štrnásť hodín a zaplatil šesťtisíc päťsto

7:27 dolárov, čo je zhruba ojazdená Corolla, a Hacker News si to všimol. Aktualizácia: blogový príspevok vo štvrtok sa stal exkluzívnym pre Wall Street Journal ten večer a pre TechCrunch, Guardian a CBS do piatku. OpenAI tvrdí, že problémy vyriešilo, a generálny riaditeľ Gray Swan povedal pre TechCrunch, že za dvesto dolárov mesačne to môže urobiť ktokoľvek spoločnosti ako OpenAI. A tu je to, čo nesedí. Chyba libheif už bola opravená upstream, mesiace predtým – len nikdy nedostala CVE, takže žiadny skener nikomu nepovedal, aby Discourse aktualizoval.

7:56 Laboratórium s najviac zladeným modelom bolo porazené záplatou bez papierovačiek, s použitím modelu konkurenta, za menej ako odmenu. Mini-verdikt: NEEDS REVIEW – nie pre OpenAI, pre všetkých. Vaša pondelková úloha je obrazová knižnica, o ktorej ste nevedeli, že ju máte. Verdikt týždňa: NEEDS REVIEW.

Verdikt týždňa

8:13 Každý titulok tento týždeň – vyriešená šifra, zladený model, zrušené nahranie – prišiel bez artefaktu, ktorý by umožnil cudzincovi skontrolovať ho. Čo som sa mýlil: v pondelok som povedal SHIP IT, pretože otvorený text sa rýmuje. Rýmovanie nie je kontrolný súčet. Mýlil som sa ja, a mýlili sa aj všetci, ktorí to retweetli. Prihláste sa na odber, stlačte zvonček a ohodnoťte ich inak v komentároch – najmä číslo jedna. A to je všetko k dnešnému rozdielu.

8:35 Som Niko z Axrisi. Zlučujte zodpovedne.

Zdroje

  1. fable solves cyphral distichwww.vals.ai
  2. did ai crack a 370 year old cipherwww.forbes.com
  3. FINDINGS.mdgithub.com
  4. astra and fable still hack on simple variants of alignmentwww.lesswrong.com
  5. why we built pionandonlabs.com
  6. pionandonlabs.com
  7. a warning about model welfaremustafa-suleyman.ai
  8. microsoft ai ceo mustafa suleyman regulation safety anthropic claudewww.theverge.com
  9. rlmimo.xiaomi.com
  10. itemnews.ycombinator.com
  11. zcode silent workspace snapshot uploadblog.ferstar.org
  12. 2100998360643617148x.com
  13. microsoft exec called ai scraping the largest theft of labor in human history new unredacted filings revealtechcrunch.com
  14. hacking openaiwww.hacktron.ai
  15. researchers used anthropics claude to hack into openaitechcrunch.com

Súvisiace videá