+− THE DAILY DIFFdev & AI news
SHIP IT

ক্ল’ড নাৰ্ফ কেনেকৈ ধৰা পেলাব পাৰি (প্ৰকৃত তথ্যৰে সৈতে)

মানুহে কয় যে প্ৰতিটো মুকলিৰ কেইসপ্তাহমানৰ পিছত ক্ল’ড ক্ৰমান্বয়ে দুৰ্বল হৈ পৰে।

মানুহে কয় যে প্ৰতিটো মুকলিৰ কেইসপ্তাহমানৰ পিছত ক্ল’ড ক্ৰমান্বয়ে দুৰ্বল হৈ পৰে। এজন বিকাশকে ক্ল’ড ওপছ ৫.৫-ক মুকলি সপ্তাহৰ পৰা ৩০ দিনৰ ঘড়ীৰ ওপৰত ৰাখিছিল, য'ত নিৰ্দিষ্ট প্ৰশ্ন, পিন কৰা ক্ল’ড ক’ড আৰু ৰাজহুৱা নিয়ম আছিল, আৰু ই দেখুৱাইছে যে কিয় আগতে কোনেও নাজানিছিল, আৰু কিয় আপোনাৰ টোকেন গণনা নিৰীক্ষণ কৰিবলগীয়া বিষয়। ৰায়: SHIP IT.

লিখিত সংস্কৰণ পঢ়ক (ইংৰাজী) ↗

এই ভিডিঅ’টোত কি আছে

  • মুকলিৰ পিছত ক্ল’ড দুৰ্বল হৈ পৰে: তত্ত্বটো দিন-শূন্য ঘড়ীৰ সৈতে মিলে
  • লাইভনাৰ্ফ: মুকলি সপ্তাহৰ পৰা ওপছ ৫.৫-ত ৩০ দিনৰ ঘড়ী
  • নাৰ্ফ কেনেকৈ ধৰা পেলাব: ৭৮টা কেতিয়াবা সঠিক প্ৰশ্ন
  • ই কি দেখিব পাৰে: ৭.৫ পইণ্ট, আৰু টোকেন গণনা প্ৰথমে সলনি হয়
  • অন্ধ স্থান: ওপছ ৫ৰ সাল-সলনি আৰু ৮টা ভুল উত্তৰ কি'

অনূদিত ট্ৰান্সক্ৰিপ্ট

মূল ইংৰাজী বৰ্ণনাৰ পৰা অনুবাদ কৰা হৈছে। উপলব্ধ অডিঅ’ আৰু কেপচন ইউটিউবে নিয়ন্ত্ৰণ কৰে।

মুকলিৰ পিছত ক্ল’ড দুৰ্বল হৈ পৰে: তত্ত্বটো দিন-শূন্য ঘড়ীৰ সৈতে মিলে

0:00 সকলোৱে জানে যে মুকলিৰ কেইসপ্তাহমানৰ পিছত ক্ল’ড দুৰ্বল হৈ পৰে। গতিকে এজন বিকাশকে ওপছ ৫.৫-ক মুকলি সপ্তাহৰ পৰা ঘড়ীৰ ওপৰত ৰাখিছিল, আৰু ঘড়ীটোৱে কয় যে কোনেও এতিয়ালৈকে জনা নাছিল। এই ভিডিঅ'ত, তিনিটা প্ৰশ্ন। আপুনি নাৰ্ফ কেনেকৈ ধৰা পেলাব? এই মিটাৰটোৱে কি দেখিব পাৰে? আৰু এন্থ্ৰপিকে কি কয়? আৰু ৰেপ’ৰ ক্ৰেডিটৰ এটা লাইনে মোক হাঁহি তুলিছিল।

0:20 মই শেষত তালৈ যাম। আজি বুধবাৰ, ছেপ্টেম্বৰৰ ত্ৰিশ তাৰিখ, আৰু এইটো হৈছে The Daily Diff। আজি তিনিটা কাহিনী, আৰু ডাঙৰটো হৈছে এটা গিটহাব ৰেপ’ যাক লাইভ নাৰ্ফ বুলি কোৱা হয়।

লাইভনাৰ্ফ: মুকলি সপ্তাহৰ পৰা ওপছ ৫.৫-ত ৩০ দিনৰ ঘড়ী

0:30 কেইবামাহ ধৰি মানুহে কৈছে যে এন্থ্ৰপিকে মুকলিৰ পিছত নিজৰ মডেলসমূহক গোপনে নাৰ্ফ কৰে। সাধাৰণ তত্ত্বসমূহ হৈছে এটা সংকুচিত মডেল, একে নামৰ এটা সৰু মডেল বা কেৱল কম চিন্তা। ৰেপ’টোৱে এতিয়ালৈকে সকলো যুক্তি 'ভাইবস বনাম ভাইবস' বুলি কয়। ওপছ ৫.৫ ছেপ্টেম্বৰ বাইশ তাৰিখে শিপ কৰা হৈছিল, আৰু এসপ্তাহ আগতে মই আপোনাক কৈছিলোঁ যে ই স্বতন্ত্ৰ ব'ৰ্ডত শীৰ্ষস্থান লাভ কৰিছিল আন মডেলতকৈ তিনিগুণ বেছি শব্দ লিখি। আন মডেলতকৈ তিনিগুণ বেছি শব্দ লিখি। আঢ়ৈ দিনৰ ভিতৰত, ninja hawk নামৰ এজন বিকাশকে ঘড়ীটো আৰম্ভ কৰিছিল,

0:59 দিনে এবাৰ, ত্ৰিশ দিনৰ বাবে, এনে লগসমূহৰ সৈতে যিবোৰ কোনেও সম্পাদনা কৰিব নোৱাৰে। হ্যাকৰ নিউজ থ্ৰেডটোৱে প্ৰায় আঠশ পইণ্ট লাভ কৰিছিল আৰু এটা দলৰ দৰে বিভক্ত হৈছিল চাট। এজন মন্তব্যকাৰীয়ে কয় যে বেছিভাগ ক্ষেত্ৰত মডেল নাৰ্ফ কৰাটো বাস্তৱ নহয়। আন এজনে কয় যে মানুহে কেৱল নতুন স্তৰৰ বুদ্ধিমত্তাৰে অভ্যস্ত হৈছে। আৰু এজন ক্ল’ড ক’ড পাৱাৰ ব্যৱহাৰকাৰীয়ে এতিয়া 'এই অধিবেশনৰ ৰেট কৰক' পপ-আপটো প্ৰতিবাৰে বাতিল কৰে, কিয়নো ক্ল’ডক ৰেট কৰাটোৱে ইয়াক বেয়া কৰি তোলা যেন লাগিছিল। পিয়েৰ ৰিভিউ। গতিকে, প্ৰশ্ন এক, আপুনি নাৰ্ফ কেনেকৈ ধৰা পেলাব?

নাৰ্ফ কেনেকৈ ধৰা পেলাব: ৭৮টা কেতিয়াবা সঠিক প্ৰশ্ন

1:27 আপুনি প্ৰায় ২৩০০ কঠিন পৰীক্ষাৰ প্ৰশ্নৰে আৰম্ভ কৰে, আৰু ওপছে প্ৰথম প্ৰচেষ্টাত ৯৩ শতাংশ সঠিক উত্তৰ দিয়ে, যিটো এটা ডিটেক্টৰৰ বাবে মূল্যহীন, কিয়নো যি প্ৰশ্ন সদায় সঠিক হয় সেয়া হ্ৰাস পাব নোৱাৰে। ৯৭ শতাংশ সদায় সঠিক বা সদায় ভুল আছিল, আৰু ৭৮টা যিবোৰ কেৱল কেতিয়াবা সঠিক হৈছিল সেয়া প্যানেল হৈ পৰিছিল। একেটা প্ৰম্পট, কোনো সঁজুলি নাই, আৰু কোনো এআই বিচাৰক অবিহনে সঠিক-মিল গ্ৰেডিং, কিয়নো বিচাৰকো বিচ্যুত হ'ব পাৰে। ই হেডলেছ ক্ল’ড ক’ডৰ জৰিয়তে মেক্স ছাবস্ক্ৰিপচনত চলে,

1:55 কিয়নো API সংস্কৰণৰ মূল্য প্ৰতি মাহে প্ৰায় ১৬০০ ডলাৰ আছিল। আৰু ক্ল’ড ক’ড সংস্কৰণটো পিন কৰা হৈছে, কিয়নো, ৰেপ’ৰ কথাত, এটা সলনি হোৱা হাৰ্নেছ এটা সলনি হোৱা মডেলৰ দৰেই দেখায়। পৰিসংখ্যাসমূহ 'Adding Error Bars to Evals' নামৰ এটা গৱেষণা পত্ৰৰ পৰা আহিছে, এন্থ্ৰপিকৰ ইভান মিলাৰৰ দ্বাৰা। গতিকে এন্থ্ৰপিকৰ নিজৰ গণিত এতিয়া এন্থ্ৰপিকৰ অডিট কৰি আছে, যিটো হৈছে একাডেমিক সংস্কৰণ গ্ৰাহক সহায়ক সেৱাত সেৱাৰ চৰ্তসমূহ পুনৰ উদ্ধৃত কৰাৰ।

ই কি দেখিব পাৰে: ৭.৫ পইণ্ট, আৰু টোকেন গণনা প্ৰথমে সলনি হয়

2:19 প্ৰশ্ন দুই, ই কি দেখিব পাৰে? প্ৰতি দহ দিনৰ উইণ্ডোত, প্ৰায় সাত আৰু আধা পইণ্টৰ হ্ৰাস। ৰিগটোৱে কাম কৰে বুলি প্ৰমাণ কৰিবলৈ, লেখকে উদ্দেশ্যপ্ৰণোদিতভাৱে ক্ল’ডৰ প্ৰচেষ্টা কমাইছিল। মধ্যমীয়া প্ৰচেষ্টাই আউটপুট প্ৰায় এক চতুৰ্থাংশ হ্ৰাস কৰে, আৰু স্ক’ৰ কেৱল চাৰি পইণ্ট। কম প্ৰচেষ্টাই আউটপুট প্ৰায় দুই তৃতীয়াংশ হ্ৰাস কৰে, আঠ পইণ্টৰ বাবে। সেইটো চুৰ কৰিবলগীয়া অংশ। কম চিন্তা টোকেন গণনাত দেখুৱায় ই উত্তৰত দেখুৱাৰ আগতে।

2:43 গতিকে আপোনাৰ মডেল সংস্কৰণ পিন কৰক, প্ৰতিটো কামৰ বাবে আউটপুট টোকেন লগ কৰক, আৰু আপোনাৰ নিজৰ কেইটামান নিৰ্দিষ্ট প্ৰশ্ন ৰাখক। যদি আপোনাৰ এজেণ্টে হঠাৎ কম লিখে, ৰেডডিট পৰীক্ষা কৰাৰ আগতে আপোনাৰ লগসমূহ পৰীক্ষা কৰক। আৰু এইটো সৎ অংশ।

অন্ধ স্থান: ওপছ ৫ৰ সাল-সলনি আৰু ৮টা ভুল উত্তৰ কি'

2:54 পুৰণি ওপছ ৫-ত গোপনে সাল-সলনি কৰাটো ৰিগটোৰ বাবে ইমান সৰু পৰিৱৰ্তন আছিল যে ইয়াক ধৰিব নোৱাৰিছিল, আৰু readme-য়ে আগতেই সেইটো কয়। অডিটটোৱে আঠটা উত্তৰ কি’ও বিচাৰি পাইছিল যিবোৰ ভুল যেন লাগিছিল, গতিকে নাৰ্ফ ডিটেক্টৰটোৱে নাৰ্ফ বিচাৰি পোৱাৰ আগতে বেঞ্চমাৰ্কত বাগ বিচাৰি পাইছিল।

এন্থ্ৰপিক: আমি কেতিয়াও মডেলৰ মানদণ্ড হ্ৰাস নকৰোঁ

3:08 প্ৰশ্ন তিনি, এন্থ্ৰপিকে কি কয়? যোৱা বছৰ, অভিযোগৰ এটা ঢৌৰ পিছত, এন্থ্ৰপিকে এটা পোষ্টমৰ্টেম প্ৰকাশ কৰিছিল। ই কয়, উদ্ধৃতি, আমি কেতিয়াও চাহিদাৰ বাবে মডেলৰ মানদণ্ড হ্ৰাস নকৰোঁ, দিনৰ সময় বা চাৰ্ভাৰৰ লোডৰ বাবে। একেটা পোষ্টত তিনিওটা বাগে ক্ল’ডক ক্ষতিগ্ৰস্ত কৰিছিল বুলি স্বীকাৰ কৰা হৈছে, আৰু প্ৰায় এক তৃতীয়াংশ ক্ল’ড ক’ড ব্যৱহাৰকাৰীয়ে কমেও এবাৰ ভুল চাৰ্ভাৰত সোমাইছিল। গতিকে অভিযোগসমূহ বাস্তৱ আছিল আৰু কাৰণ আছিল বাগ, সেইবাবেই ৰেপ’টোৱে সতৰ্ক কৰি দিয়ে যে মুকলি সপ্তাহটো আটাইতকৈ বেয়া সপ্তাহ হ'ব পাৰে।

3:35 ত্ৰিশ দিনৰ ছয় দিন হৈ গৈছে। প্ৰথম সম্ভাৱ্য কলটো প্ৰায় ২৪ অক্টোবৰত আহিব, গতিকে সৎ উত্তৰটো হ'ল যে কোনেও নাজানে, নিশ্চিত হোৱা সকলোকে ধৰি। সংখ্যালৈ আহিছে যিবোৰ কোনেও প্ৰকাশ নকৰে।

তথ্য কেন্দ্ৰসমূহে তেওঁলোকৰ সংখ্যা গোপন ৰাখে; বেকব্লেজে প্ৰকাশ কৰে

3:46 লাইথহাউচ ৰিপ’ৰ্টছ আৰু ডাচ কাকত ট্ৰুৱে বিচাৰি পাইছে যে বেছিভাগ ইউৰোপীয় তথ্য কেন্দ্ৰসমূহে তেওঁলোকৰ শক্তি আৰু পানীৰ ব্যৱহাৰ গোপন ৰাখে, যদিও ইউৰোপীয় সংঘৰ এটা নিয়মে তিনি বছৰ ধৰি ৰিপ’ৰ্টিং বাধ্যতামূলক কৰিছে। নেদাৰলেণ্ডত, এক চতুৰ্থাংশতকৈ কম সংখ্যক প্ৰকাশ কৰে। এটা মাইক্ৰ’ছফ্ট তথ্য কেন্দ্ৰই অকলে নেদাৰলেণ্ডৰ বিদ্যুৎৰ প্ৰায় এক শতাংশ ব্যৱহাৰ কৰে। এই মাজতে, বেকব্লেজে পুনৰ নিৰস কামটো কৰিছিল। ইয়াৰ ত্ৰৈমাসিক ড্ৰাইভৰ পৰিসংখ্যাই প্ৰায় ৩ লাখ ৫০ হাজাৰ হাৰ্ড ড্ৰাইভ সামৰি লয়, আৰু বিফলতাৰ হাৰ ১.৭৩ শতাংশলৈ বৃদ্ধি পাইছিল,

4:16 কিছুদিনৰ ভিতৰত সৰ্বোচ্চ। তিনিটা ছীগেট মডেলৰ কোনো বিফলতা নাছিল। সেইটোৱেই এটা ৰাজহুৱা বেছলাইনৰ দৰে দেখায়, ত্ৰৈমাসিকৰ পিছত ত্ৰৈমাসিক, তেৰ বছৰ ধৰি।

ক্ৰেডিট লাইন: ক্ল’ডে মিটাৰটো নিৰ্মাণত সহায় কৰিছিল

4:25 এতিয়া, সেই ক্ৰেডিট লাইন। readme-য়ে স্বীকাৰ কৰে যে ৰেপ’টোৰ বহুখিনি ক্ল’ডৰ সহায়ত লিখা হৈছিল, যিটো মডেল জোখা হৈছে। গতিকে ক্ল’ডে সেই মিটাৰটো নিৰ্মাণত সহায় কৰিছিল যিয়ে পৰীক্ষা কৰে যে ক্ল’ড দুৰ্বল হৈছিল নে নাই। সেইবাবেই গ্ৰেডাৰসমূহ সাধাৰণ কাৰ্য্য। লেখকৰ কথাত, আপুনি লেখকক বিশ্বাস কৰিব নালাগে, মানৱ বা অন্যথা। যদি আপুনি মই কোৱাৰ পৰিৱৰ্তে এইটো পঢ়িব বিচাৰে, তেন্তে প্ৰতিটো পুৱা আপোনাৰ ইনবক্সত diff আহে,

4:46 The daily diff.dev-ত বিনামূলীয়াকৈ, তলত লিংক। গতিকে, আজিৰ লাইভ নাৰ্ফৰ ৰায়।

ৰায়: SHIP IT, আৰু ২৪ অক্টোবৰৰ আগতে উদ্ধৃত নকৰিব

4:51 SHIP IT. মই ইয়াক SHIP IT কৰিম কিয়নো এইটো প্ৰথম নাৰ্ফ যুক্তি যিটো মই দেখিছোঁ এটা টাইমষ্টাম্প, এটা ৰাজহুৱা নিয়মপুথি আৰু এটা নিৰ্দিষ্ট অন্ধ স্থানৰ সৈতে। কেৱল ২৪ অক্টোবৰৰ আগতে ইয়াক উদ্ধৃত নকৰিব। আৰু এয়াই আজিৰ বাবে diff। মই Axrisi-ৰ পৰা Niko। দায়িত্বশীলভাৱে একত্ৰিত কৰক।

উৎসসমূহ

  1. livenerfgithub.com
  2. Validationgithub.com
  3. Hacker Newsnews.ycombinator.com
  4. Anthropic postmortem (Sep 2025)www.anthropic.com
  5. Adding Error Bars to Evals (Evan Miller)arxiv.org
  6. Inspect (UK AI Security Institute)inspect.aisi.org.uk
  7. NL Timesnltimes.nl
  8. Hacker Newsnews.ycombinator.com
  9. Backblaze Drive Stats Q2 2026www.backblaze.com
  10. Hacker Newsnews.ycombinator.com

সম্পৰ্কিত ভিডিঅ’সমূহ

daily · as · ২৩-০৯-২০২৬

Claude Opus 5.5-এ মূল্য কমিল। OpenAI-এ আৰু বেছি কমিল।

এন্থ্ৰপিক (Anthropic)-এ ক্লড অপাছ 5.5 মুকলি কৰিলে: বেছিভাগ কামৰ বাবে ফেবল-স্তৰৰ, লেবেল মূল্যৰ এক-পঞ্চমাংশ হ্ৰাস আৰু কেছড ৰিডত ৬০% হ্ৰাস। প্ৰায় নবৈ মিনিটৰ পিছত OpenAI-এ GPT-6 ছ’ল আৰু লুনা মুকলি কৰিলে,

5:12 ↗
daily · as · ০১-১০-২০২৬

Gemini 4 Argon হৈছে Google-ৰ শ্ৰেষ্ঠ মডেল। আপুনি এতিয়াও ইয়াক ব্যৱহাৰ কৰিব নোৱাৰে।

Google-এ Gemini 4 Argon, ইয়াৰ নতুন ফ্ৰণ্টিয়াৰ মডেল ঘোষণা কৰিছে, আৰু কেৱল বিশ্বাসী চাইবাৰ ৰক্ষকসকলেহে ইয়াক ব্যৱহাৰ কৰিব পাৰে। ইয়াত Google-ৰ নিজৰ 19-শাৰীৰ বেঞ্চমাৰ্ক তালিকাই কি দেখুৱায়, স্বাধীন লিডা

4:53 ↗
daily · as · ২৭-০৯-২০২৬

OpenAI-এ কিয় ইয়াৰ পাইৰেটেড কিতাপবোৰ ডিলিট কৰিলে

২০১৯ চনত OpenAI-ৰ এজন গৱেষকৰ উক্তি অনুসৰি: পাইৰেটেড কিতাপৰ চাইটত ট্ৰেইনিং কৰা সম্পৰ্কে তেওঁৰ উদ্বেগ আছিল হেকাৰ নিউজলৈ "অপটিক্স"। OpenAI-এ কি জানিছিল, কোনে বিল গেটছক কৈছিল, ফাইলবোৰ কিয় ডিলিট কৰা হৈছিল

5:01 ↗
daily · as · ১৬-০৯-২০২৬

মাইক্ৰছফ্টৰ AI প্ৰধানে ক্লাউডৰ সংবিধানক বিপজ্জনক আখ্যা দিলে।

মাইক্ৰছফ্ট AI-ৰ CEO মুস্তাফা সুলেইমানে ৩,০০০ শব্দৰ এটা প্ৰবন্ধ প্ৰকাশ কৰি যুক্তি দিছিল যে এন্থ্ৰপিকৰ ক্লাউড সংবিধানে মডেলটোক এইদৰে ভাবিবলৈ প্ৰশিক্ষণ দিয়ে যে ই "সচেতন হ'ব পাৰে" আৰু "মডেল কল্যাণ"ৰ যোগ্

5:19 ↗