+− THE DAILY DIFFdev & AI news
SHIP IT

របៀបរកមើល Claude nerf (ជាមួយទិន្នន័យពិត)

មនុស្សនិយាយថា Claude កាន់តែល្ងង់ទៅៗពីរបីសប្តាហ៍បន្ទាប់ពីការចេញផ្សាយនីមួយៗ។

មនុស្សនិយាយថា Claude កាន់តែល្ងង់ទៅៗពីរបីសប្តាហ៍បន្ទាប់ពីការចេញផ្សាយនីមួយៗ។ អ្នកអភិវឌ្ឍន៍ម្នាក់បានដាក់ Claude Opus 5.5 លើនាឡិកា 30 ថ្ងៃចាប់ពីសប្តាហ៍នៃការចេញផ្សាយ ជាមួយនឹងសំណួរដែលបានកក Claude Code ដែលបានកំណត់ និងច្បាប់សាធារណៈ ហើយវាបង្ហាញថាហេតុអ្វីបានជាគ្មាននរណាម្នាក់អាចដឹងពីមុនមក ហើយហេតុអ្វីបានជាចំនួនថូខឹនរបស់អ្នកគឺជាអ្វីដែលត្រូវមើល។ សាលក្រម: SHIP IT។

អានបោះពុម្ពជាលាយលក្ខណ៍អក្សរ (អង់គ្លេស) ↗

អ្វីដែលវីដេអូនេះគ្របដណ្ដប់

  • Claude កាន់តែល្ងង់បន្ទាប់ពីការចេញផ្សាយ: ទ្រឹស្តីបានជួបនាឡិកាថ្ងៃសូន្យ
  • livenerf: នាឡិកា 30 ថ្ងៃនៅលើ Opus 5.5 ចាប់ពីសប្តាហ៍នៃការចេញផ្សាយ
  • របៀបចាប់យក nerf: 78 សំណួរដែលជួនកាលត្រឹមត្រូវ
  • អ្វីដែលវាអាចឃើញ: 7.5 ពិន្ទុ ហើយចំនួនថូខឹនផ្លាស់ទីមុន
  • ចំណុចងងឹត: ការប្តូរ Opus 5 និង 8 គន្លឹះចម្លើយខុស

កំណត់ត្រាដែលបានបកប្រែ

បកប្រែចេញពីការនិទានដើមជាភាសាអង់គ្លេស។ សំឡេង និងចំណងជើងរងដែលមានគឺស្ថិតនៅក្រោមការគ្រប់គ្រងរបស់ YouTube។

Claude កាន់តែល្ងង់បន្ទាប់ពីការចេញផ្សាយ: ទ្រឹស្តីបានជួបនាឡិកាថ្ងៃសូន្យ

0:00 អ្នក​រាល់​គ្នា​ដឹង​ថា Claude កាន់​តែ​ល្ងង់​ទៅៗ​ពីរ​បី​សប្ដាហ៍​ក្រោយ​ការ​ចេញ​ផ្សាយ។ ដូច្នេះ អ្នក​អភិវឌ្ឍន៍​ម្នាក់​បាន​ដាក់ Opus 5.5 លើ​នាឡិកា​ចាប់​ពី​សប្ដាហ៍​នៃ​ការ​ចេញ​ផ្សាយ ហើយ​នាឡិកា​និយាយ​ថា​គ្មាន​នរណា​អាច​ដឹង​បាន​ឡើយ។ ក្នុង​វីដេអូ​នេះ មាន​សំណួរ​បី។ តើ​អ្នក​ចាប់​យក nerf យ៉ាង​ដូចម្ដេច? តើ​ម៉ែត្រ​នេះ​អាច​មើល​ឃើញ​អ្វី? ហើយ​តើ Anthropic និយាយ​អ្វី? ហើយ​បន្ទាត់​មួយ​នៅ​ក្នុង​ឥណទាន​របស់ repo បាន​ធ្វើ​ឲ្យ​ខ្ញុំ​សើច​ខ្លាំង។

0:20 ខ្ញុំ​នឹង​និយាយ​ដល់​វា​នៅ​ចុង​បញ្ចប់។ វា​គឺ​ជា​ថ្ងៃ​ពុធ ទី 30 ខែ​កញ្ញា ហើយ​នេះ​គឺ The Daily Diff។ មាន​រឿង​បី​ថ្ងៃ​នេះ ហើយ​រឿង​ធំ​គឺ GitHub repo មួយ​ឈ្មោះ live nerf។

livenerf: នាឡិកា 30 ថ្ងៃនៅលើ Opus 5.5 ចាប់ពីសប្តាហ៍នៃការចេញផ្សាយ

0:30 អស់​ជាច្រើន​ខែ មនុស្ស​បាន​និយាយ​ថា Anthropic បាន​កែប្រែ​ម៉ូដែល​របស់​ខ្លួន​ដោយ​ស្ងៀមស្ងាត់​បន្ទាប់​ពី​ការ​ចេញ​ផ្សាយ។ ទ្រឹស្តី​ធម្មតា​គឺ​ម៉ូដែល​ដែល​បាន​ច្របាច់​ចូល ម៉ូដែល​តូច​ជាង​ក្រោម​ឈ្មោះ​ដូចគ្នា ឬ​គ្រាន់តែ​គិត​តិច។ repo ហៅ​រាល់​អំណះអំណាង​រហូត​មក​ដល់​ពេល​នេះ​ថា vibes ធៀប​នឹង vibes។ Opus 5.5 បាន​ចេញ​នៅ​ថ្ងៃ​ទី 22 ខែ​កញ្ញា ហើយ​មួយ​សប្ដាហ៍​មុន ខ្ញុំ​បាន​ប្រាប់​អ្នក​ថា​វា​បាន​ជាប់​ចំណាត់ថ្នាក់​កំពូល​នៃ​ក្រុមប្រឹក្សា​ឯករាជ្យ ខណៈ​ពេល​សរសេរ​ពាក្យ​បី​ដង ច្រើន​ជាង​ម៉ូដែល​មធ្យម។ ពីរ​ថ្ងៃ​កន្លះ​ក្រោយ​មក អ្នក​អភិវឌ្ឍន៍​ម្នាក់​ឈ្មោះ ninja hawk បាន​ចាប់​ផ្ដើម​នាឡិកា

0:59 ម្ដង​ក្នុង​មួយ​ថ្ងៃ​សម្រាប់​រយៈ​ពេល​សាមសិប​ថ្ងៃ ជាមួយ​នឹង​កំណត់ហេតុ​ដែល​គ្មាន​នរណា​អាច​កែប្រែ​បាន។ ខ្សែស្រឡាយ Hacker News បាន​ឡើង​ដល់​ជិត 800 ពិន្ទុ ហើយ​បំបែក​ដូច​ការ​ជជែក​ក្រុម។ អ្នក​បញ្ចេញ​មតិ​ម្នាក់​និយាយ​ថា ការ​កែប្រែ​ម៉ូដែល​មិន​ពិត​ទេ​ក្នុង​ករណី​ភាគច្រើន​ដែល​បាន​រាយការណ៍។ ម្នាក់​ទៀត​និយាយ​ថា មនុស្ស​គ្រាន់តែ​ស៊ាំ​នឹង​កម្រិត​ថ្មី​នៃ​ភាព​ឆ្លាតវៃ។ ហើយ​អ្នក​ប្រើ​ប្រាស់ Claude Code ដ៏​មាន​ឥទ្ធិពល​ម្នាក់​ឥឡូវ​បោះបង់​ការ​លេច​ឡើង rate-this-session រាល់​ពេល ព្រោះ​ការ​វាយតម្លៃ Claude ហាក់​ដូចជា​ធ្វើ​ឲ្យ​វា​កាន់តែ​អាក្រក់។ ការ​ត្រួតពិនិត្យ​ដោយ​មិត្តភ័ក្តិ។ ដូច្នេះ សំណួរ​ទីមួយ តើ​អ្នក​ចាប់​យក nerf យ៉ាង​ដូចម្ដេច?

របៀបចាប់យក nerf: 78 សំណួរដែលជួនកាលត្រឹមត្រូវ

1:27 អ្នក​ចាប់​ផ្ដើម​ដោយ​សំណួរ​ប្រឡង​ពិបាក​ប្រហែល 2300 ហើយ Opus ទទួល​បាន 93 ភាគរយ​ត្រឹមត្រូវ​ក្នុង​ការ​ព្យាយាម​ដំបូង ដែល​គ្មាន​ប្រយោជន៍​សម្រាប់​ឧបករណ៍​ចាប់​សញ្ញា ព្រោះ​សំណួរ​ដែល​វា​តែងតែ​ទទួល​បាន​ត្រឹមត្រូវ​មិន​អាច ធ្លាក់​ចុះ​បាន​ទេ។ 97 ភាគរយ​តែងតែ​ត្រឹមត្រូវ ឬ​តែងតែ​ខុស ហើយ 78 ដែល​វា​ជួនកាល​ទទួល​បាន​ត្រឹមត្រូវ​បាន​ក្លាយ​ជា​គណៈកម្មាធិការ។ សំណួរ​ដូចគ្នា គ្មាន​ឧបករណ៍ និង​ការ​វាយតម្លៃ​ការ​ផ្គូផ្គង​ត្រឹមត្រូវ​ដោយ​គ្មាន​ចៅក្រម AI ព្រោះ​ចៅក្រម​ក៏​នឹង​ផ្លាស់ប្ដូរ​ដែរ។ វា​ដំណើរការ​លើ​ការ​ជាវ Max តាមរយៈ headless Claude Code

1:55 ដោយសារ​កំណែ API មាន​តម្លៃ​ប្រហែល 1600 ដុល្លារ​ក្នុង​មួយ​ខែ។ ហើយ​កំណែ Claude Code ត្រូវ​បាន​កំណត់​ព្រោះ ក្នុង​ពាក្យ​របស់ repo ខ្សែ​ដែល​បាន​ផ្លាស់ប្ដូរ​មើល​ទៅ​ដូចគ្នា​នឹង​ម៉ូដែល​ដែល​បាន​ផ្លាស់ប្ដូរ។ ស្ថិតិ​បាន​មក​ពី​ក្រដាស​មួយ​ឈ្មោះ Adding Error Bars to Evals ដោយ Evan Miller នៅ Anthropic។ ដូច្នេះ គណិតវិទ្យា​របស់ Anthropic ឥឡូវ​កំពុង​ត្រួតពិនិត្យ Anthropic ដែល​ជា​កំណែ​សិក្សា នៃ​ការ​ដកស្រង់​លក្ខខណ្ឌ​នៃ​សេវាកម្ម​ទៅ​កាន់​ការ​គាំទ្រ​អតិថិជន។

អ្វីដែលវាអាចឃើញ: 7.5 ពិន្ទុ ហើយចំនួនថូខឹនផ្លាស់ទីមុន

2:19 សំណួរ​ទី​ពីរ តើ​វា​អាច​មើល​ឃើញ​អ្វី? ក្នុង​បង្អួច​ដប់​ថ្ងៃ ការ​ធ្លាក់​ចុះ​ប្រហែល 7.5 ពិន្ទុ។ ដើម្បី​បញ្ជាក់​ថា​ឧបករណ៍​នេះ​ដំណើរការ អ្នក​និពន្ធ​បាន​បន្ថយ​ការ​ខិតខំ​របស់ Claude ដោយ​ចេតនា។ ការ​ខិតខំ​មធ្យម​បាន​កាត់​បន្ថយ​ទិន្នផល​ប្រហែល​មួយ​ភាគ​បួន ហើយ​ពិន្ទុ​ត្រឹម​តែ 4 ពិន្ទុ។ ការ​ខិតខំ​ទាប​បាន​កាត់​បន្ថយ​ទិន្នផល​ជិត​ពីរ​ភាគ​បី សម្រាប់​ប្រាំបី​ពិន្ទុ។ នោះ​គឺ​ជា​ផ្នែក​ដែល​ត្រូវ​លួច។ ការ​គិត​តិច​បង្ហាញ​ឡើង​ក្នុង​ចំនួន​ថូខឹន​មុន​ពេល​វា​បង្ហាញ​ឡើង​ក្នុង​ចម្លើយ។

2:43 ដូច្នេះ កំណត់​កំណែ​ម៉ូដែល​របស់​អ្នក កត់ត្រា​ថូខឹន​ទិន្នផល​ក្នុង​មួយ​កិច្ចការ ហើយ​រក្សា​សំណួរ​ដែល​បាន​បង្កក​មួយ​ចំនួន​របស់​អ្នក​ផ្ទាល់។ ប្រសិន​បើ​ភ្នាក់ងារ​របស់​អ្នក​ស្រាប់តែ​សរសេរ​ខ្លី​ជាង សូម​ពិនិត្យ​កំណត់ហេតុ​របស់​អ្នក​មុន​ពេល​អ្នក​ពិនិត្យ Reddit។ ហើយ​នេះ​គឺ​ជា​ផ្នែក​ស្មោះត្រង់។

ចំណុចងងឹត: ការប្តូរ Opus 5 និង 8 គន្លឹះចម្លើយខុស

2:54 ការ​ប្ដូរ​ដោយ​ស្ងៀមស្ងាត់​ទៅ​ជា Opus 5 ចាស់​គឺ​ជា​ការ​ផ្លាស់ប្ដូរ​តូច​ពេក​សម្រាប់​ឧបករណ៍​ដើម្បី ហៅ​បាន ហើយ readme និយាយ​ដូច្នេះ​នៅ​ខាង​មុខ។ ការ​ត្រួតពិនិត្យ​ក៏​បាន​រក​ឃើញ​គន្លឹះ​ចម្លើយ​ប្រាំបី​ដែល​មើល​ទៅ​ខុស ដូច្នេះ​ឧបករណ៍​ចាប់​សញ្ញា nerf បាន​រក​ឃើញ​កំហុស​ក្នុង​ការ​វាស់វែង​មុន​ពេល​វា​រក​ឃើញ nerf។

Anthropic: យើងមិនដែលកាត់បន្ថយគុណភាពម៉ូដែលទេ

3:08 សំណួរ​ទី​បី តើ Anthropic និយាយ​អ្វី? កាល​ពី​ឆ្នាំ​មុន បន្ទាប់​ពី​មាន​ការ​ត្អូញត្អែរ​ជា​ច្រើន Anthropic បាន​បោះពុម្ព​ការ​វិភាគ​ក្រោយ​ហេតុការណ៍។ វា​និយាយ​ថា "យើង​មិន​ដែល​កាត់​បន្ថយ​គុណភាព​ម៉ូដែល​ដោយសារ​តម្រូវការ ពេលវេលា​នៃ​ថ្ងៃ ឬ​បន្ទុក​ម៉ាស៊ីន​មេ"។ ប្រកាស​ដូចគ្នា​នេះ​ទទួល​ស្គាល់​ថា​មាន​កំហុស​បី​បាន​ធ្វើ​ឲ្យ Claude ខូច​គុណភាព ហើយ​ជិត​មួយ​ភាគ​បី​នៃ អ្នក​ប្រើ Claude Code បាន​វាយ​ម៉ាស៊ីន​មេ​ខុស​យ៉ាង​ហោច​ណាស់​ម្ដង។ ដូច្នេះ​ការ​ត្អូញត្អែរ​គឺ​ពិត​ហើយ​មូលហេតុ​គឺ​កំហុស នោះ​ហើយ​ជា​មូលហេតុ​ដែល repo ព្រមាន​ថា​សប្ដាហ៍​នៃ​ការ​ចេញ​ផ្សាយ​អាច​ជា​សប្ដាហ៍​អាក្រក់​បំផុត។

3:35 ប្រាំមួយ​ក្នុង​ចំណោម 30 ថ្ងៃ​ត្រូវ​បាន​បញ្ចូល។ ការ​ហៅ​ទូរសព្ទ​ដំបូង​អាច​ធ្វើ​ទៅ​បាន​នៅ​ជុំវិញ​ថ្ងៃ​ទី 24 ខែ​តុលា ដូច្នេះ​ចម្លើយ​ស្មោះត្រង់​គឺ​ថា​គ្មាន​នរណា​ដឹង​ទេ រួម​ទាំង​អ្នក​រាល់​គ្នា​ដែល​ប្រាកដ។ និយាយ​ពី​លេខ​ដែល​គ្មាន​នរណា​បោះពុម្ព​ផ្សាយ។

មជ្ឈមណ្ឌលទិន្នន័យរក្សាទុកលេខរបស់ពួកគេជាការសម្ងាត់; Backblaze បោះពុម្ពផ្សាយ

3:46 Lighthouse Reports និង​កាសែត​ហូឡង់ Trouw បាន​រក​ឃើញ​ថា​មជ្ឈមណ្ឌល​ទិន្នន័យ​អឺរ៉ុប​ភាគច្រើន​បំផុត រក្សា​ការ​ប្រើប្រាស់​ថាមពល​និង​ទឹក​របស់​ពួក​គេ​ជា​ការ​សម្ងាត់ ទោះបីជា​ច្បាប់ EU បាន​តម្រូវ​ឲ្យ​រាយការណ៍​អស់​រយៈពេល​បី​ឆ្នាំ​ក៏ដោយ។ នៅ​ប្រទេស​ហូឡង់ មាន​តែ​តិច​ជាង​មួយ​ភាគ​បួន​ប៉ុណ្ណោះ​ដែល​បោះពុម្ព​ផ្សាយ។ មជ្ឈមណ្ឌល​ទិន្នន័យ Microsoft មួយ​តែ​ឯង​ប្រើប្រាស់​ប្រហែល 1 ភាគរយ​នៃ​អគ្គិសនី​ហូឡង់។ ទន្ទឹម​នឹង​នេះ Backblaze បាន​ធ្វើ​រឿង​គួរ​ឲ្យ​ធុញទ្រាន់​ម្ដង​ទៀត។ ស្ថិតិ​ដ្រាយវ៍​ប្រចាំ​ត្រីមាស​របស់​វា​គ្របដណ្តប់​ប្រហែល 350000 ថាស​រឹង ហើយ​អត្រា​បរាជ័យ​បាន​កើន​ឡើង​ដល់ 1.73 ភាគរយ

4:16 ដែល​ខ្ពស់​បំផុត​ក្នុង​រយៈពេល​មួយ​រយៈ។ ម៉ូដែល Seagate បី​គ្មាន​បរាជ័យ​ទេ។ នោះ​ហើយ​ជា​អ្វី​ដែល​មូលដ្ឋាន​សាធារណៈ​មើល​ទៅ​ដូចជា ត្រីមាស​បន្ទាប់​ពី​ត្រីមាស អស់​រយៈពេល 13 ឆ្នាំ។

បន្ទាត់ឥណទាន: Claude បានជួយបង្កើតម៉ែត្រ

4:25 ឥឡូវ​នេះ បន្ទាត់​ឥណទាន​នោះ។ readme ទទួល​ស្គាល់​ថា repo ភាគច្រើន​ត្រូវ​បាន​សរសេរ​ដោយ​មាន​ជំនួយ​ពី Claude ដែល​ជា​ម៉ូដែល​ដែល​ត្រូវ​បាន​វាស់វែង។ ដូច្នេះ Claude បាន​ជួយ​បង្កើត​ម៉ែត្រ​ដែល​ពិនិត្យ​មើល​ថា Claude កាន់តែ​ល្ងង់​ឬ​អត់។ នោះ​ហើយ​ជា​មូលហេតុ​ដែល​អ្នក​វាយតម្លៃ​គឺ​ជា​មុខងារ​ធម្មតា។ ក្នុង​ពាក្យ​របស់​អ្នក​និពន្ធ អ្នក​មិន​គួរ​ទុកចិត្ត​អ្នក​និពន្ធ​ឡើយ មនុស្ស​ឬ​ក៏​មិនមែន។ ប្រសិន​បើ​អ្នក​ចង់​អាន​នេះ​ជាង​ឮ​ខ្ញុំ​និយាយ​វា diff នឹង​ចូល​ក្នុង​ប្រអប់​សំបុត្រ​របស់​អ្នក

4:46 រាល់​ព្រឹក ឥតគិតថ្លៃ​នៅ the daily diff dot dev, តំណ​ភ្ជាប់​ខាងក្រោម។ ដូច្នេះ សាលក្រម​ថ្ងៃ​នេះ​លើ live nerf។

សាលក្រម: SHIP IT, ហើយកុំដកស្រង់វាមុនថ្ងៃទី 24 ខែតុលា

4:51 SHIP IT។ ខ្ញុំ​នឹង SHIP IT ព្រោះ​វា​ជា​អំណះអំណាង nerf ដំបូង​ដែល​ខ្ញុំ​បាន​ឃើញ​ជាមួយ​នឹង ពេលវេលា សៀវភៅ​ច្បាប់​សាធារណៈ និង​ចំណុច​ងងឹត​ដែល​បាន​បញ្ជាក់។ គ្រាន់តែ​កុំ​ដកស្រង់​វា​មុន​ថ្ងៃ​ទី 24 ខែ​តុលា។ ហើយ​នោះ​គឺ​ជា diff សម្រាប់​ថ្ងៃ​នេះ។ ខ្ញុំ​នីកូ​ពី Axrisi។ បញ្ចូល​ដោយ​ការ​ទទួល​ខុសត្រូវ។

ប្រភព

  1. livenerfgithub.com
  2. Validationgithub.com
  3. Hacker Newsnews.ycombinator.com
  4. Anthropic postmortem (Sep 2025)www.anthropic.com
  5. Adding Error Bars to Evals (Evan Miller)arxiv.org
  6. Inspect (UK AI Security Institute)inspect.aisi.org.uk
  7. NL Timesnltimes.nl
  8. Hacker Newsnews.ycombinator.com
  9. Backblaze Drive Stats Q2 2026www.backblaze.com
  10. Hacker Newsnews.ycombinator.com

វីដេអូដែលពាក់ព័ន្ធ

daily · km · 23 កញ្ញា 2026

Claude Opus 5.5 បានកាត់បន្ថយតម្លៃ។ OpenAI បានកាត់បន្ថយកាន់តែជ្រៅ។

Anthropic បានចេញផ្សាយ Claude Opus 5.5៖ កម្រិត Fable លើការងារភាគច្រើន ថយចុះមួយភាគប្រាំពីតម្លៃដើម និង 60% សម្រាប់ការអានឃ្លាំងសម្ងាត់។ ប្រហែលកៅសិបនាទីក្រោយមក OpenAI បានចេញផ្សាយ GPT-6 Sol និង Luna ក្នុងតម

5:12 ↗
daily · km · 1 តុលា 2026

Gemini 4 Argon គឺជាម៉ូដែលល្អបំផុតរបស់ Google។ អ្នកមិនទាន់អាចប្រើវាបានទេ។

Google បានប្រកាស Gemini 4 Argon ដែលជាម៉ូដែលថ្មីរបស់ខ្លួន ហើយមានតែអ្នកការពារអនឡាញដែលគួរឱ្យទុកចិត្តប៉ុណ្ណោះដែលអាចប្រើវាបាន។ នេះគឺជាអ្វីដែលតារាង Benchmark 19 ជួររបស់ Google ផ្ទាល់បង្ហាញ អ្វីដែលតារាងពិន្ទ

4:53 ↗
daily · km · 27 កញ្ញា 2026

ហេតុអ្វី OpenAI លុបសៀវភៅលួចចម្លងរបស់ខ្លួន?

ឯកសារដែលមិនត្រូវបានផ្សាភ្ជាប់បានដកស្រង់សម្តីអ្នកស្រាវជ្រាវ OpenAI ម្នាក់នៅឆ្នាំ 2019៖ ការព្រួយបារម្ភរបស់គាត់អំពីការបណ្តុះបណ្តាលលើគេហទំព័រសៀវភៅលួចចម្លងគឺសម្រាប់តែ "រូបភាព" នៅលើ Hacker News ប៉ុណ្ណោះ។ តើ

5:01 ↗
daily · km · 16 កញ្ញា 2026

ប្រធានផ្នែក AI របស់ក្រុមហ៊ុន Microsoft ទើបតែហៅរដ្ឋធម្មនុញ្ញរបស់ Claude ថាមានគ្រោះថ្នាក់។

Mustafa Suleyman, នាយកប្រតិបត្តិ Microsoft AI បានបោះពុម្ពអត្ថបទមួយដែលមាន 3,000 ពាក្យ ដោយលើកហេតុផលថារដ្ឋធម្មនុញ្ញរបស់ Claude របស់ Anthropic បណ្ដុះបណ្ដាលម៉ូដែលឱ្យគិតថាវា «អាចមានស្មារតី» និងសមនឹងទទួលបាន

5:19 ↗