+− THE DAILY DIFFdev & AI news
NEEDS REVIEW

ആഴത്തിലുള്ള പഠനം: ആവർത്തന സ്വയം-പുരോഗതി

ഗൂഗിൾ ഡീപ്‌മൈൻഡ് "ഡ്രീം-ആർഎസ്ഐ: വികസിക്കുന്ന ലോകങ്ങളിലൂടെയുള്ള ആവർത്തന സ്വയം-പുരോഗതി" പ്രസിദ്ധീകരിച്ചു — അതിലെ കോഡിംഗ് മോഡലിന് ഒരിക്കലും മാറ്റം വരുന്നില്ല.

ഗൂഗിൾ ഡീപ്‌മൈൻഡ് "ഡ്രീം-ആർഎസ്ഐ: വികസിക്കുന്ന ലോകങ്ങളിലൂടെയുള്ള ആവർത്തന സ്വയം-പുരോഗതി" പ്രസിദ്ധീകരിച്ചു — അതിലെ കോഡിംഗ് മോഡലിന് ഒരിക്കലും മാറ്റം വരുന്നില്ല. ആഴത്തിലുള്ള പഠനം: 60 വർഷമായി ഈ പദത്തിന്റെ അർത്ഥം എന്തായിരുന്നു, ഡ്രീം-ആർഎസ്ഐയിൽ യഥാർത്ഥത്തിൽ എന്താണ് ആവർത്തിക്കുന്നത് (റെക്കോർഡ് ചെയ്ത സെർച്ച് ട്രീകളിലൂടെ "സ്വപ്നം കാണുന്ന" ഒരു പൈത്തൺ എക്സ്പ്ലോറേഷൻ പോളിസി), 550 ഏജന്റ് കോളുകൾക്ക് പകരം 317 എണ്ണം ഒരു കിഴിവ് മാത്രമായിരിക്കുന്നത് എന്തുകൊണ്ട്, കുതിച്ചുചാട്ടമല്ലാത്തത് എന്തുകൊണ്ട്. വിധി: NEEDS REVIEW.

എഴുതിയ പതിപ്പ് വായിക്കുക (ഇംഗ്ലീഷ്) ↗

ഈ വീഡിയോയിൽ ഉൾപ്പെടുന്ന കാര്യങ്ങൾ

  • 1965 → 2008: ഐ. ജെ. ഗുഡിന്റെ "ഇന്റലിജൻസ് എക്സ്പ്ലോഷൻ", യുഡ്‌കോവ്സ്കിയുടെ സീഡ് AI — സ്വന്തം വെയിറ്റുകൾ തിരുത്തിയെഴുതുന്ന ഒരു യന്ത്രം
  • 2025: ആൽഫാഎവോൾവ് — 48-ഗുണന 4×4 മാട്രിക്സ് മൾട്ടിപ്ലൈ, ഗൂഗിളിന്റെ കമ്പ്യൂട്ടറിന്റെ 0.7% തിരിച്ചുപിടിച്ചു, ജെമിനി കെർണലുകൾക്ക് 23% വേഗത കൂടുതൽ
  • 2026: ഡ്രീം-ആർഎസ്ഐ — പോളിസി മെച്ചപ്പെടുന്നു, കോഡർ, ജഡ്ജ്, റീറൈറ്റർ എന്നിവയെല്ലാം സ്തംഭിപ്പിച്ചു; "ശാസ്ത്രീയമായ ദൗത്യം പരിഹരിക്കരുത്" എന്ന് പ്രോംപ്റ്റ് പറയുന്നു
  • എക്സ്: "ഗൂഗിൾ ആവർത്തന സ്വയം-പുരോഗതിയെ തകർത്തു" (819 ലൈക്കുകൾ) vs എച്ച്എൻ: "ഇതിനെ ആർഎസ്ഐ എന്ന് വിളിക്കുന്നത് തെറ്റിദ്ധാരണയുണ്ടാക്കുന്നതാണ്"
  • ഉപയോഗിച്ച നമ്പറുകൾ: §4.1 ലാസ്സോ 550 → 317 ഏജന്റ് കോളുകൾ, 3587 → 2931 ms; പട്ടിക 1 സർക്കിൾ പാക്കിംഗ് 2.635983 = ആൽഫാഎവോൾവ്വി2; §4.3 കെർണൽബെഞ്ച് 2.43× / 1.79× കുറഞ്ഞ തലമുറകൾ, 2.09× വരെ വേഗത കൂടുതൽ; അനുബന്ധം ബി.2 പ്രോംപ്റ്റ് (മുകളിൽ പറഞ്ഞ PDF-ൽ നിന്ന്)

വിവർത്തനം ചെയ്ത ട്രാൻസ്ക്രിപ്റ്റ്

യഥാർത്ഥ ഇംഗ്ലീഷ് ആഖ്യാനത്തിൽ നിന്ന് വിവർത്തനം ചെയ്തത്. ലഭ്യമായ ഓഡിയോയും അടിക്കുറിപ്പുകളും YouTube നിയന്ത്രിക്കുന്നു.

0:00 ഒരു AI സ്വയം കൂടുതൽ ബുദ്ധിമാനാക്കുന്നു എന്ന ആശയമാണ് ആവർത്തന സ്വയം-പുരോഗതി, പിന്നീട്, കൂടുതൽ ബുദ്ധിമാനായ സ്വയം ഉപയോഗിച്ച് അത് വീണ്ടും ചെയ്യുന്നു, ഈ ആഴ്ച ഗൂഗിൾ ഒരു പ്രബന്ധം പ്രസിദ്ധീകരിച്ചു, അതിൽ ആ രണ്ട് വാക്കുകൾ തലക്കെട്ടിലുണ്ടായിരുന്നു, അതിലെ മോഡലിന്റെ വെയിറ്റുകൾ ഒരിക്കലും മാറുന്നില്ല. മൂന്ന് നമ്പറുകൾ. ആന്ത്രോപിക് സിഇഒ പറയുന്നു, ഈ ലൂപ്പ് വേനൽക്കാലം മുതൽ പ്രവർത്തിക്കുന്നുണ്ടെന്ന്, അതാണ് മുഴുവൻ വ്യവസായത്തെയും മന്ദഗതിയിലാക്കാൻ അദ്ദേഹത്തിന്റെ കാരണം. ഗൂഗിൾ അത് തകർത്തു എന്ന് പ്രഖ്യാപിച്ച ട്വീറ്റിന് ഒരു ദിവസം കൊണ്ട് എണ്ണൂറ് ലൈക്കുകൾ ലഭിച്ചു ഒരു ദിവസം കൊണ്ട്.

0:24 പ്രബന്ധത്തിലെ പ്രധാന ഫലം 550 മോഡൽ കോളുകൾക്ക് പകരം 317 എണ്ണം എന്നതാണ്, ഇത് ഒരു കിഴിവാണ്, കുതിച്ചുചാട്ടമല്ല. മൂന്ന് മിനിറ്റിനുള്ളിൽ: ഈ വാചകം എവിടെ നിന്ന് വന്നു, ഡ്രീം-ആർഎസ്ഐയുടെ ഉള്ളിൽ യഥാർത്ഥത്തിൽ എന്താണ് ആവർത്തിക്കുന്നത്, കവറിൽ ആർഎസ്ഐ ഉള്ള അടുത്ത പ്രബന്ധം എങ്ങനെ വായിക്കണം. ഇത് ദി ഡെയ്‌ലി ഡിഫ്, ആഴത്തിലുള്ള പഠനം. 1965. ഐ. ജെ. ഗുഡ്, ട്യൂറിംഗിന് അടുത്ത് പ്രവർത്തിച്ച ബ്ലെച്ച്ലി പാർക്ക് സ്റ്റാറ്റിസ്റ്റിഷ്യൻ, ഒരു അൾട്രാഇന്റലിജന്റ് യന്ത്രത്തിന് ഇതിലും മികച്ച യന്ത്രങ്ങൾ രൂപകൽപ്പന ചെയ്യാൻ കഴിയുമെന്ന് എഴുതുന്നു,

0:52 അതിനെ ഒരു ഇന്റലിജൻസ് എക്സ്പ്ലോഷൻ എന്നും മനുഷ്യൻ ഇന്നേവരെ ഉണ്ടാക്കേണ്ടി വരുന്ന അവസാനത്തെ കണ്ടുപിടിത്തമെന്നും വിളിക്കുന്നു, യന്ത്രം അതിനെ എങ്ങനെ നിയന്ത്രിക്കണമെന്ന് നമ്മളോട് പറയാൻ വേണ്ടത്ര അനുസരണയുള്ളതാണെങ്കിൽ, വിരാമചിഹ്നത്തിന് ശേഷം ആളുകൾ വായിക്കുന്നത് നിർത്തുന്ന 'അനുസരണയുള്ളതാണെങ്കിൽ' എന്ന ഭാഗം. നാൽപ്പത് വർഷത്തോളം ഈ വാചകത്തിന് കൃത്യമായ അർത്ഥം അതായിരുന്നു: സ്വന്തം സോഴ്സ് അല്ലെങ്കിൽ വെയിറ്റുകൾ എഡിറ്റ് ചെയ്യുകയും ഓരോ പാസിലും കൂടുതൽ ബുദ്ധിമാനാവുകയും ചെയ്യുന്ന ഒരു സിസ്റ്റം. എലിയേസർ യുഡ്‌കോവ്സ്കിയുടെ 2008-ലെ ലേഖനം ഇതിനെ AI-യുടെ പ്രധാന വാക്കായി മാറ്റി സുരക്ഷയ്ക്ക്, ആർക്കും ഇത് പരീക്ഷിക്കാൻ ഒരു യന്ത്രം ഉണ്ടായിരുന്നില്ല, അത് ഒരു നിർവചനത്തിന് അനുയോജ്യമായ അവസ്ഥയാണ്. തുടർന്ന് 2025 മെയ് മാസത്തിൽ ഡീപ്‌മൈൻഡ് ആൽഫാഎവോൾവ് പുറത്തിറക്കി,

1:23 കോഡ് നിർദ്ദേശിക്കുകയും സ്കോർ ചെയ്യപ്പെടുകയും വിജയികളെ നിലനിർത്തുകയും വീണ്ടും മ്യൂട്ടേറ്റ് ചെയ്യുകയും ചെയ്യുന്ന ഒരു ജെമിനി ഏജന്റ്. ഇത് 48 ഘട്ടങ്ങളിൽ നാല്-ബൈ-നാല് കോംപ്ലക്സ് മാട്രിക്സുകൾ ഗുണിച്ചു, 1969-ൽ സ്ട്രാസ്സൻ സ്ഥാപിച്ച റെക്കോർഡ് തകർത്തു, ഗൂഗിളിന്റെ ലോകമെമ്പാടുമുള്ള കമ്പ്യൂട്ടറിന്റെ ഏകദേശം പൂജ്യം പോയിന്റ് ഏഴ് ശതമാനം ഇത് വീണ്ടെടുക്കുന്നു, ഇത് ഗൂഗിളിന്റെ വലുപ്പത്തിൽ ഒരു സോഫയുടെ അടിയിൽ കണ്ടെത്തിയ ഡാറ്റാ സെന്ററിന് തുല്യമാണ്. ജെമിനി ഇപ്പോൾ ജെമിനിയെ പരിശീലിപ്പിക്കാൻ സഹായിക്കുന്നു, ഈ വാചകം നിശബ്ദമായി സുരക്ഷാ ബ്ലോഗുകളിൽ നിന്ന് പത്രക്കുറിപ്പുകളിലേക്ക് മാറി. ഡ്രീം-ആർഎസ്ഐ ആ ലൂപ്പിന് മുകളിൽ ഒരു കൺട്രോളർ ഘടിപ്പിക്കുന്നു.

1:52 ഒരു പോളിസി, ഒരു യഥാർത്ഥ പൈത്തൺ പ്രോഗ്രാം, തീരുമാനിക്കുന്നു സെർച്ച് ട്രീയുടെ ഏത് ശാഖകളാണ് വികസിപ്പിക്കേണ്ടത്, എത്ര എണ്ണം സമാന്തരമായി, എപ്പോൾ ഉപേക്ഷിക്കണം എന്ന്. ജെമിനി കാൻഡിഡേറ്റ് കോഡ് എഴുതുന്നു, ഒരു നിശ്ചിത വിലയിരുത്തൽ അതിനെ സ്കോർ ചെയ്യുന്നു. ഓരോ റണ്ണും ശ്രമിച്ചതിന്റെയും സ്കോർ ചെയ്തതിന്റെയും ഒരു ട്രീ അവശേഷിപ്പിക്കുന്നു. ആ ട്രീ ഒരു റീപ്ലേ സിമുലേറ്ററായി മാറുന്നു: രണ്ടാമത്തെ, അതുപോലെ സ്തംഭിപ്പിച്ച ജെമിനി പോളിസി മാറ്റിയെഴുതുന്നു, പുതിയ പോളിസി യഥാർത്ഥ ജിപിയുക്കളിൽ അല്ലാതെ റെക്കോർഡ് ചെയ്ത ഫലങ്ങൾക്കെതിരെ പരീക്ഷിക്കപ്പെടുന്നു.

2:16 പ്രബന്ധം ഇതിനെ സ്വപ്നം കാണൽ എന്ന് വിളിക്കുന്നു, ഒരു യഥാർത്ഥ റൺ ആയിരക്കണക്കിന് സ്വപ്നം കണ്ടവയ്ക്ക് പൂജ്യം എക്സിക്യൂഷൻ ചെലവിൽ പണം നൽകുന്നു. വിജയി വീണ്ടും ഓൺലൈനിൽ വരുന്നു, റെക്കോർഡ് ചെയ്ത ലോകങ്ങളുടെ കൂട്ടം വളരുന്നു, ആവർത്തിക്കുക. അനുബന്ധം ബി.2-ലെ പ്രോംപ്റ്റ് സ്വയം മെച്ചപ്പെടുത്തുന്ന AI-യോട് എഴുതിക്കൊണ്ട് പറയുന്നു: ഈ ഒരു ഫയൽ മാത്രം എഡിറ്റ് ചെയ്യുക, ശാസ്ത്രീയമായ ദൗത്യം പരിഹരിക്കരുത്. അളന്നത്. ലാസ്സോ സോൾവർ ടാസ്ക്കിൽ, നിശ്ചിത എക്സ്പ്ലോറേഷൻ 3.6 സെക്കൻഡ് എത്താൻ 550 ജെമിനി കോളുകൾ ഉപയോഗിച്ചു, ഡ്രീം-ആർഎസ്ഐ 2.9 സെക്കൻഡ് എത്താൻ 317 ഉപയോഗിച്ചു, രണ്ടും സ്കിറ്റ്-ലേണിനെ മറികടന്നു.

2:46 കെർണൽബെഞ്ചിൽ ഏകദേശം 2.4 മടങ്ങ് കുറഞ്ഞ തലമുറകളോടെ അതേ കെർണൽ വേഗത കൈവരിച്ചു. സർക്കിൾ പാക്കിംഗിൽ അത് 2.635983 സ്കോർ ചെയ്തു, ഇത് കൃത്യമായി, ആറ് ദശാംശസ്ഥാനത്ത്, കഴിഞ്ഞ വർഷം ആൽഫാഎവോൾവ് പതിപ്പ് രണ്ട് സ്കോർ ചെയ്തതിന് തുല്യമാണ്. കഴിഞ്ഞ വർഷം. അതുകൊണ്ട് എക്സ് തലക്കെട്ട് വായിച്ചു: ഗൂഗിൾ ആവർത്തന സ്വയം-പുരോഗതി തകർത്തു. ഹാക്കർ ന്യൂസ് PDF വായിച്ചു: ഇതിനെ RSI എന്ന് വിളിക്കുന്നത് തെറ്റിദ്ധാരണയുണ്ടാക്കുന്നതാണ്. അതേ ആഴ്ച ഒരു എതിരാളിയുടെ സിഇഒ പറഞ്ഞു, ലൂപ്പ് വേനൽക്കാലം മുതൽ പ്രവർത്തിക്കുന്നുണ്ടെന്നും എല്ലാവരും വേഗത കുറയ്ക്കണമെന്നും.

3:13 മൂന്ന് വാചകങ്ങൾ, അതേ രണ്ട് വാക്കുകൾ, മൂന്ന് വ്യത്യസ്ത യന്ത്രങ്ങൾ. അതുകൊണ്ട്, തിങ്കളാഴ്ച, അടുത്ത RSI പേപ്പർ എങ്ങനെ വായിക്കണം. ഒന്ന്: ഏത് ഒബ്ജക്റ്റ് മാറുന്നു എന്ന് ചോദിക്കുക, വെയിറ്റുകൾ, കോഡ്, അതോ സെർച്ച് ക്രമീകരണങ്ങളോ; ഡ്രീം-ആർഎസ്ഐ മൂന്നാമത്തേത് മാറ്റുന്നു. രണ്ട്: ആരാണ് സ്തംഭിപ്പിച്ചത് എന്ന് ചോദിക്കുക; ഇവിടെ അത് കോഡർ, ജഡ്ജ്, റീറൈറ്റർ, മൂന്നുപേരും. മൂന്ന്: പ്രധാന നമ്പർ എന്തിന്റെ യൂണിറ്റാണ് എന്ന് ചോദിക്കുക. കമ്പ്യൂട്ട് ലാഭിച്ചത് ഒപ്റ്റിമൈസേഷനാണ്; മോഡലിന് മുമ്പ് എത്താൻ കഴിയാത്ത ഒരു ബെഞ്ച്മാർക്ക് കുതിച്ചുചാട്ടമാണ്, ആരും അത് ഇതുവരെ പ്രസിദ്ധീകരിച്ചിട്ടില്ല.

3:40 വിധി, ആഴത്തിലുള്ള പഠനം: NEEDS REVIEW. ലൂപ്പ് യഥാർത്ഥമാണ്, ലാഭങ്ങൾ അളന്നിട്ടുണ്ട്, കവറിലെ രണ്ട് വാക്കുകൾ പ്രബന്ധത്തിൽ ഇല്ലാത്ത ഒരു യന്ത്രത്തെ വിവരിക്കുന്നു. ഞാൻ ഇത് പറയുന്നത് കേൾക്കുന്നതിലും നല്ലത് വായിക്കാനാണെങ്കിൽ, എല്ലാ ദിവസവും രാവിലെ നിങ്ങളുടെ ഇൻബോക്സിൽ diff വരുന്നു, thedailydiff.dev-ൽ സൗജന്യമായി, ലിങ്ക് താഴെ. അടുത്തതായി എന്ത് തുറക്കണം എന്ന് കമന്റുകളിൽ പറയുക. ഇന്ന് ഇതാണ് ഡിഫ്. ഞാൻ ആക്സിസിയിൽ നിന്നുള്ള നിക്കോ.

4:00 ഷിപ്പ് ഇറ്റ്.

ഉറവിടങ്ങൾ

  1. Paper: Dream-RSI (Zheng et al., Google / Google DeepMind / UMD / UVA, 14 Sep 2026)arxiv.org
  2. Code (293 stars, no license) — https://github.com/zhengkid/Dream-RSI · project pagedream-rsi.com
  3. Hacker News thread (169 points)news.ycombinator.com
  4. Hugging Face papers (278 upvotes)huggingface.co
  5. I. J. Good, 1965, "Speculations Concerning the First Ultraintelligent Machine"en.wikipedia.org
  6. Eliezer Yudkowsky, "Recursive Self-Improvement", LessWrong, 1 Dec 2008www.lesswrong.com
  7. Google DeepMind, AlphaEvolve (14 May 2025): 0.7% compute, 48 multiplications, 23% kernel speed-updeepmind.google
  8. Dario Amodei, "We Must Pace the Frontier" (12 Sep 2026)darioamodei.com
  9. Tweetx.com

ബന്ധപ്പെട്ട വീഡിയോകൾ

under-the-hood · ml · 2026 സെപ്റ്റം 24

SAML, അണിയറയിൽ: കത്തിന്റെ ഉള്ളിലെ ഒപ്പ്

SAML മിക്കവാറും എല്ലാ വർക്ക് ആപ്പുകളിലേക്കും നിങ്ങളെ ലോഗിൻ ചെയ്യക്കുന്നു, അതിൻ്റെ ഒപ്പ് അത് ഒപ്പിടുന്ന XML-ൽ ഉൾക്കൊള്ളുന്നു. അണിയറയിൽ: ആപ്പ്, ബ്രൗസർ, ഐഡന്റിറ്റി പ്രൊവൈഡർ എന്നിവ തമ്മിലുള്ള ലോഗിൻ ഡാൻസ്,

3:02 ↗
under-the-hood · ml · 2026 സെപ്റ്റം 23

ഒരു മോഡൽ നശിക്കുമ്പോൾ, കാര്യങ്ങൾ നടക്കുന്നത്

ഒരു AI മോഡൽ നശിക്കുന്നില്ല - അതിന് ഒരു ഷട്ട്ഡൗൺ തീയതി ലഭിക്കുന്നു, അടുത്ത ദിവസം രാവിലെ, നിങ്ങളുടെ API കോൾ ഒരു 404 നൽകുന്നു: "മോഡൽ കാലഹരണപ്പെട്ടു, ഇവിടെ കൂടുതൽ അറിയുക." കാര്യങ്ങൾ നടക്കുന്നത്: നാല്-സ്റ്

3:15 ↗
under-the-hood · ml · 2026 സെപ്റ്റം 21

ക്ലോഡ് RSA-896 ഘടകങ്ങളാക്കി. യഥാർത്ഥത്തിൽ RSA തകരുന്നത് ഇങ്ങനെയാണ്

സെപ്റ്റംബർ 19-ന് ആന്ത്രോപിക്കിലെ ഒരു എഞ്ചിനീയർ RSA-896 — 270 അക്കങ്ങളുള്ള ഒരു ചലഞ്ച് നമ്പർ — ക്ലോഡ് ഉപയോഗിച്ച്, ഓപ്പൺ സോഴ്‌സ് CADO-NFS സീവിന്റെ ഒരു GPU പോർട്ടും, പത്ത് ദിവസത്തേക്ക് 2,048 ഉപയോഗിക്കാത്ത

3:39 ↗
under-the-hood · ml · 2026 സെപ്റ്റം 19

പാസ്കീകൾ, കാര്യങ്ങൾ സൂക്ഷ്മമായി പരിശോധിക്കുമ്പോൾ

ഒരു പാസ്കീ എന്നത് നിങ്ങളുടെ ഉപകരണം ഉണ്ടാക്കുന്ന ഒരു പാസ്‌വേഡാണ്, അത് നിങ്ങളെ ഒരിക്കലും കാണിക്കുന്നില്ല, നിങ്ങൾക്ക് ഉൾപ്പെടെ ആർക്കും കൈമാറാൻ വിസമ്മതിക്കുന്നു. കാര്യങ്ങൾ സൂക്ഷ്മമായി പരിശോധിക്കുമ്പോൾ: We

3:12 ↗