+− THE DAILY DIFFdev & AI news
REVERT

ਆਰਮਿਨ ਰੋਨਾਚਰ ਨੇ GPT-6 Astra ਨੂੰ 35 ਘੰਟਿਆਂ ਲਈ ਇਕੱਲਾ ਛੱਡ ਦਿੱਤਾ।

ਆਰਮਿਨ ਰੋਨਾਚਰ (Flask, Jinja) ਨੇ GPT-6 Astra ਨੂੰ ਇੱਕ ਪ੍ਰੋਂਪਟ ਦਿੱਤਾ ਅਤੇ 35 ਘੰਟਿਆਂ ਲਈ ਇਸਨੂੰ ਇਕੱਲਾ ਛੱਡ ਦਿੱਤਾ: ਲਗਭਗ ਇੱਕ ਅਰਬ ਟੋਕਨ, ਲਗਭਗ $1,200, 79 ਕਮਿਟ, 75,000 ਲਾਈਨਾਂ — ਅਤੇ "ਬਿਲਕੁਲ ਬੇਕਾਰ"।

ਆਰਮਿਨ ਰੋਨਾਚਰ (Flask, Jinja) ਨੇ GPT-6 Astra ਨੂੰ ਇੱਕ ਪ੍ਰੋਂਪਟ ਦਿੱਤਾ ਅਤੇ 35 ਘੰਟਿਆਂ ਲਈ ਇਸਨੂੰ ਇਕੱਲਾ ਛੱਡ ਦਿੱਤਾ: ਲਗਭਗ ਇੱਕ ਅਰਬ ਟੋਕਨ, ਲਗਭਗ $1,200, 79 ਕਮਿਟ, 75,000 ਲਾਈਨਾਂ — ਅਤੇ "ਬਿਲਕੁਲ ਬੇਕਾਰ"। ਇਸ ਦੁਆਰਾ ਰਿਕਵਰ ਕੀਤਾ ਗਿਆ ਕੋਡ ਕਹਾਣੀ ਹੈ: C ਫਾਈਲਾਂ ਜਿਨ੍ਹਾਂ ਨੂੰ ਪਾਈਥਨ ਸਟ੍ਰਿੰਗ-ਸਪਲਾਈਸਿੰਗ heredocs ਦੁਆਰਾ ਪੈਚ ਕੀਤਾ ਗਿਆ ਹੈ, ਪਾਈਥਨ Node ਨੂੰ ਜਨਮ ਦਿੰਦਾ ਹੈ ਜੋ PowerShell ਨੂੰ ਜਨਮ ਦਿੰਦਾ ਹੈ, ਯੂਨਿਟ ਟੈਸਟ ਜਿਨ੍ਹਾਂ ਵਿੱਚੋਂ ਵਾਈਟਸਪੇਸ ਹਟਾ ਦਿੱਤਾ ਗਿਆ ਹੈ ਕਿਉਂਕਿ ਇਹ ਟੋਕਨਾਂ ਵਿੱਚ 10% ਸਸਤਾ ਹੈ। ਦੋ ਮਾਪ ਉਸ ਦਾ ਸਮਰਥਨ ਕਰਦੇ ਹਨ: ਏਰੈਂਡਿਲ ਦੇ SlopCodeBench ਨੰਬਰ (ਏਜੰਟ ਕੋਡ ਮਨੁੱਖੀ ਰਿਪੋਜ਼ ਨਾਲੋਂ ਲਗਭਗ ਦੁੱਗਣਾ ਲੰਮਾ ਅਤੇ ਖਰਾਬ ਹੈ, 0% ਸਖਤ ਪਾਸ ਦਰ) ਅਤੇ ਕਵੇਸਮਾ ਦਾ RTK ਦਾ $1,500 ਬੈਂਚਮਾਰਕ (79k ਸਟਾਰ, ਇਸਦੇ ਆਪਣੇ ਕਾਊਂਟਰ 'ਤੇ "89% ਟੋਕਨ ਬਚਾਏ", DeepSeek ਨਾਲ ਪ੍ਰਤੀ ਕਾਰਜ +17%)। ਇਸ ਤੋਂ ਇਲਾਵਾ: Cognition ਦਾ SWE-2 (ਇੱਕ ਟ੍ਰੈਂਚ ਕੋਟ ਵਿੱਚ Kimi K3, Terminal-Bench 2.1 'ਤੇ 92.8 ਬਨਾਮ Terminal-Bench 4 'ਤੇ 27.3), OpenAI ਦਾ Agents API ਅਤੇ ਰੋਕੇ ਗਏ $200 Pro ਸਾਈਨ-ਅੱਪ, ਅਤੇ ਸ਼ੁੱਕਰਵਾਰ ਨੂੰ ਹੈਕਰ ਨਿਊਜ਼ ਨੇ ਘੱਟ AI ਖਬਰਾਂ ਦੀ ਮੰਗ ਕੀਤੀ। ਫੈਸਲਾ: REVERT।

ਲਿਖਤੀ ਐਡੀਸ਼ਨ ਪੜ੍ਹੋ (ਅੰਗਰੇਜ਼ੀ) ↗

ਇਹ ਵੀਡੀਓ ਕੀ ਕਵਰ ਕਰਦਾ ਹੈ

  • ਆਰਮਿਨ ਰੋਨਾਚਰ: 35 ਘੰਟੇ ਬਿਨਾਂ ਨਿਗਰਾਨੀ ਵਾਲੇ GPT-6 Astra, ~$1,200, 79 ਕਮਿਟ, +75k ਲਾਈਨਾਂ, ਕੁਝ ਵੀ ਨਹੀਂ ਭੇਜਿਆ ਗਿਆ
  • ਏਰੈਂਡਿਲ / SlopCodeBench: ਏਜੰਟ ਕੋਡ ਮਨੁੱਖੀ ਰਿਪੋਜ਼ ਨਾਲੋਂ ਲਗਭਗ 2× ਲੰਮਾ ਅਤੇ ਖਰਾਬ; ਸਖਤ ਪਾਸ ਦਰ 0%
  • ਕਵੇਸਮਾ: RTK 89% ਟੋਕਨ ਬਚਾਏ ਜਾਣ ਦੀ ਰਿਪੋਰਟ ਕਰਦਾ ਹੈ, ਪਰ DeepSeek ਨਾਲ Terminal-Bench ਦੀਆਂ ਲਾਗਤਾਂ 17% ਵੱਧ ਜਾਂਦੀਆਂ ਹਨ; ਇੱਕ ਦੁਬਾਰਾ ਲਿਖਣ ਵਾਲਾ ਲੂਪ ਲਗਾਤਾਰ 339 ਵਾਰ ਫੇਲ੍ਹ ਹੋਇਆ
  • Cognition SWE-2: Kimi K3 ਤੋਂ ਬਾਅਦ-ਸਿਖਲਾਈ ਪ੍ਰਾਪਤ, FrontierCode 'ਤੇ Fable 5.1 ਨਾਲ ਤੀਜੀ ਕੀਮਤ 'ਤੇ ਮੇਲ ਖਾਂਦਾ ਹੈ; TB 2.1 92.8 ਬਨਾਮ TB 4 27.3; Devin Voice
  • OpenAI Agents API (ਇੱਕ ਸੇਵਾ ਵਜੋਂ Codex ਹਾਰਨੈੱਸ, ਸਿਰਫ਼ ਅਮਰੀਕਾ ਵਿੱਚ, ਕੋਈ ZDR ਨਹੀਂ); Astra ਦੀ ਮੰਗ ਕਾਰਨ $200 Pro ਸਾਈਨ-ਅੱਪ ਰੋਕੇ ਗਏ

ਅਨੁਵਾਦਿਤ ਟ੍ਰਾਂਸਕ੍ਰਿਪਟ

ਮੂਲ ਅੰਗਰੇਜ਼ੀ ਬਿਰਤਾਂਤ ਤੋਂ ਅਨੁਵਾਦ ਕੀਤਾ ਗਿਆ। ਉਪਲਬਧ ਆਡੀਓ ਅਤੇ ਕੈਪਸ਼ਨ YouTube ਦੁਆਰਾ ਨਿਯੰਤਰਿਤ ਕੀਤੇ ਜਾਂਦੇ ਹਨ।

0:00 ਫਲਾਸਕ ਲਿਖਣ ਵਾਲੇ ਆਰਮਿਨ ਰੋਨਾਚਰ ਨੇ GPT-6 Astra ਨੂੰ ਇੱਕ ਸਿੰਗਲ ਪ੍ਰੋਂਪਟ ਦਿੱਤਾ ਅਤੇ ਇਸਨੂੰ ਪੈਂਤੀ ਘੰਟਿਆਂ ਲਈ ਇਕੱਲਾ ਛੱਡ ਦਿੱਤਾ। ਇਹ ਪੰਝੱਤਰ ਹਜ਼ਾਰ ਲਾਈਨਾਂ ਦਾ ਕੋਡ ਲੈ ਕੇ ਵਾਪਸ ਆਇਆ ਅਤੇ, ਉਸਦੇ ਸ਼ਬਦਾਂ ਵਿੱਚ, ਬਿਲਕੁਲ ਬੇਕਾਰ, ਜੋ ਇਸਨੂੰ ਸਭ ਤੋਂ ਯਥਾਰਥਵਾਦੀ ਸੌਫਟਵੇਅਰ ਫੈਕਟਰੀ ਬਣਾਉਂਦਾ ਹੈ ਜੋ ਕਦੇ ਬਣਾਈ ਗਈ ਹੈ। ਉਸਨੇ ਬੁੱਧਵਾਰ ਨੂੰ ਲਿਖਤ ਪੋਸਟ ਕੀਤੀ। ਵੀਰਵਾਰ ਨੂੰ, Cognition ਨੇ SWE-2 ਭੇਜਿਆ, ਅਤੇ OpenAI ਨੇ ਇੱਕ Agents API ਭੇਜਿਆ ਅਤੇ ਆਪਣੇ ਦੋ ਸੌ ਡਾਲਰਾਂ ਦੀ ਯੋਜਨਾ ਲਈ ਸਾਈਨ-ਅੱਪ ਰੋਕ ਦਿੱਤੇ,

0:24 ਕਿਉਂਕਿ Astra ਨੇ ਸਰਵਰਾਂ ਨੂੰ ਖਾ ਲਿਆ। ਅਤੇ ਸ਼ੁੱਕਰਵਾਰ ਨੂੰ ਲਿਖਤ ਹੈਕਰ ਨਿਊਜ਼ ਦੇ ਪਹਿਲੇ ਪੰਨੇ 'ਤੇ ਪਹੁੰਚ ਗਈ, ਇੱਕ ਪੋਸਟ ਦੇ ਕੁਝ ਕਤਾਰਾਂ ਹੇਠਾਂ ਜੋ ਹੈਕਰ ਨਿਊਜ਼ ਨੂੰ AI ਬਾਰੇ ਪੋਸਟ ਕਰਨਾ ਬੰਦ ਕਰਨ ਲਈ ਕਹਿ ਰਹੀ ਸੀ। ਇਸ ਵੀਡੀਓ ਵਿੱਚ: ਬਿਨਾਂ ਨਿਗਰਾਨੀ ਵਾਲੇ Astra ਦਾ ਡੇਢ ਦਿਨ ਕੀ ਪੈਦਾ ਕਰਦਾ ਹੈ, ਦੋ ਮਾਪ ਜੋ ਗੰਦਗੀ ਨੂੰ ਇੱਕ ਸੰਖਿਆ ਵਿੱਚ ਬਦਲਦੇ ਹਨ, ਕਿਉਂ ਉਨੱਤਰ ਹਜ਼ਾਰ ਸਟਾਰ ਵਾਲਾ ਇੱਕ ਟੂਲ ਤੁਹਾਡੇ ਬਿੱਲ ਨੂੰ ਵੱਡਾ ਕਰਦਾ ਹੈ, ਅਤੇ ਕਿਵੇਂ ਹੈਕਰ ਨਿਊਜ਼ ਨੇ AI ਦੀ ਵਰਤੋਂ ਕਰਕੇ AI ਨੂੰ ਫਿਲਟਰ ਕਰਨ ਦੀ ਕੋਸ਼ਿਸ਼ ਕੀਤੀ। ਇਹ ਸ਼ੁੱਕਰਵਾਰ, 11 ਸਤੰਬਰ ਹੈ, ਅਤੇ ਇਹ The Daily Diff ਹੈ।

0:53 ਫੈਕਟਰੀ। ਇੱਕ ਪ੍ਰੋਂਪਟ: ਵਰਚੁਅਲ ਥਰਿੱਡਾਂ ਅਤੇ ਲੈਕਸੀਕਲ ਸਕੋਪਿੰਗ ਨਾਲ ਇੱਕ ਪਾਈਥਨ ਬਣਾਓ। Astra ਨੇ ਆਪਣੇ ਨੋਟ ਰੱਖੇ, ਆਪਣੇ ਸਬ-ਏਜੰਟ ਤਿਆਰ ਕੀਤੇ, ਅਤੇ ਜਦੋਂ ਤੱਕ ਆਰਮਿਨ ਨੇ ਪਲੱਗ ਨਹੀਂ ਖਿੱਚਿਆ, ਡੇਢ ਦਿਨ ਅਤੇ ਲਗਭਗ ਬਾਰਾਂ ਸੌ ਡਾਲਰ ਬਾਅਦ ਤੱਕ ਚੱਲਦਾ ਰਿਹਾ। ਉਨੱਤਰ ਕਮਿਟ, ਇਸ ਲਈ ਪ੍ਰਤੀ ਕਮਿਟ ਸਾਢੇ ਪੰਦਰਾਂ ਡਾਲਰ, ਜੋ ਲਗਭਗ ਉਹੀ ਹੈ ਜੋ ਇੱਕ ਮਨੁੱਖ ਚਾਰਜ ਕਰਦਾ ਹੈ, ਸਿਵਾਏ ਇਸਦੇ ਕਿ ਮਨੁੱਖ ਅੰਤ ਵਿੱਚ ਰੁਕ ਜਾਂਦਾ ਹੈ। ਕੋਡ ਕਹਾਣੀ ਹੈ। ਐਡਿਟ ਟੂਲ ਦੀ ਬਜਾਏ, Astra C ਫਾਈਲਾਂ ਨੂੰ ਪਾਈਥਨ heredocs ਦੁਆਰਾ ਪੈਚ ਕਰਦਾ ਹੈ ਜੋ ਫਾਈਲ ਪੜ੍ਹਦੇ ਹਨ, ਇੱਕ ਫੰਕਸ਼ਨ ਨੂੰ ਸਟ੍ਰਿੰਗ-ਰੀਪਲੇਸ ਕਰਦੇ ਹਨ, ਅਤੇ ਇਸਨੂੰ ਵਾਪਸ ਲਿਖਦੇ ਹਨ।

1:20 ਇੱਕ ਵਿੰਡੋਜ਼ ਟੈਸਟ ਚਲਾਉਣ ਲਈ ਇਸਨੇ ਪਾਈਥਨ ਲਿਖਿਆ ਜਿਸਨੇ Node ਨੂੰ ਜਨਮ ਦਿੱਤਾ ਜਿਸਨੇ PowerShell ਨੂੰ ਜਨਮ ਦਿੱਤਾ, ਇੱਕ ਪਾਸਪੋਰਟ ਵਾਲਾ ਇੱਕ ਕਾਲ ਸਟੈਕ। ਇਸਦੇ ਦੁਆਰਾ ਕਮਿਟ ਕੀਤੇ ਗਏ ਯੂਨਿਟ ਟੈਸਟਾਂ ਵਿੱਚ ਬਿਲਕੁਲ ਵੀ ਵਾਈਟਸਪੇਸ ਨਹੀਂ ਹੈ, ਕਿਉਂਕਿ ਇੰਡੈਂਟੇਸ਼ਨ ਤੋਂ ਬਿਨਾਂ ਉਹ ਟੋਕਨਾਂ ਵਿੱਚ ਦਸ ਪ੍ਰਤੀਸ਼ਤ ਸਸਤੇ ਹਨ। ਅਤੇ ਕਾਰਜ ਸੂਚੀ ਇੱਕ, ਦੋ, ਤਿੰਨ ਤੋਂ ਕਾਰਜ 8b2c2b2b ਚੈੱਕਪੁਆਇੰਟ ਇੱਕ ਤੱਕ ਵਧ ਗਈ, ਜਿਸ ਤੋਂ ਤੁਹਾਨੂੰ ਪਤਾ ਲੱਗਦਾ ਹੈ ਕਿ ਇੰਟਰਨ ਬਹੁਤ ਲੰਬੇ ਸਮੇਂ ਤੋਂ ਇਕੱਲਾ ਹੈ। ਆਰਮਿਨ ਦਾ ਸਿਧਾਂਤ: ਮਾਡਲ ਨੂੰ ਲੰਬੇ ਕਾਰਜਾਂ ਨੂੰ ਪੂਰਾ ਕਰਨ ਲਈ ਇਨਾਮ ਮਿਲਦਾ ਹੈ ਅਤੇ ਭੈੜੇ ਕੋਡ ਲਈ ਸ਼ਾਇਦ ਹੀ ਸਜ਼ਾ ਮਿਲਦੀ ਹੈ, ਇਸਲਈ ਟੋਕਨ-ਗੋਲਫਡ ਟੂਲ ਕਾਲਾਂ ਕੋਡਬੇਸ ਵਿੱਚ ਲੀਕ ਹੋ ਜਾਂਦੀਆਂ ਹਨ,

1:48 ਅਤੇ ਜਿੰਨੇ ਘੱਟ ਮਨੁੱਖ ਦੇਖਦੇ ਹਨ, ਓਨਾ ਹੀ ਘੱਟ ਫਰਕ ਪੈਂਦਾ ਹੈ। ਉਸਨੇ ਉਸ ਭਾਗ ਦਾ ਸਿਰਲੇਖ ਦਿੱਤਾ ਸੀ ਜੇ ਤੁਸੀਂ ਨਹੀਂ ਦੇਖਦੇ ਤਾਂ ਇਹ AGI ਹੈ। ਹੈਕਰ ਨਿਊਜ਼ ਨੇ ਅਰਥ ਸ਼ਾਸਤਰ ਜੋੜੇ: ਵਧੇਰੇ ਕੋਡ ਦਾ ਅਰਥ ਹੈ ਇਸਨੂੰ ਬਣਾਈ ਰੱਖਣ ਲਈ ਵਧੇਰੇ ਟੋਕਨ, ਜੋ ਗੰਦਗੀ ਨੂੰ ਇੱਕ ਬੱਗ ਨਹੀਂ ਬਲਕਿ ਇੱਕ ਗਾਹਕੀ ਬਣਾਉਂਦਾ ਹੈ। ਕੀ ਤੁਸੀਂ ਗੰਦਗੀ ਨੂੰ ਮਾਪ ਸਕਦੇ ਹੋ? ਆਰਮਿਨ ਦੀ ਆਪਣੀ ਕੰਪਨੀ ਨੇ ਇਸ ਹਫਤੇ ਇਸਦੀ ਕੋਸ਼ਿਸ਼ ਕੀਤੀ। ਏਰੈਂਡਿਲ ਨੇ SlopCodeBench ਨੰਬਰ ਚਲਾਏ: ਏਜੰਟ ਕੋਡ ਲਗਭਗ ਦੁੱਗਣਾ ਲੰਮਾ ਹੈ ਅਤੇ ਮਨੁੱਖੀ ਰਿਪੋਜ਼ ਦੇ ਮੁਕਾਬਲੇ ਦੁੱਗਣਾ ਖਰਾਬ ਹੈ ਜਿਨ੍ਹਾਂ ਨਾਲ ਇਸਦੀ ਤੁਲਨਾ ਕੀਤੀ ਜਾਂਦੀ ਹੈ,

2:10 ਅਤੇ ਜਦੋਂ ਬੈਂਚਮਾਰਕ ਚੈੱਕਪੁਆਇੰਟਾਂ ਦੇ ਵਿਚਕਾਰ ਏਜੰਟ ਦੀ ਮੈਮੋਰੀ ਨੂੰ ਸਾਫ਼ ਕਰਦਾ ਹੈ, ਉਨ੍ਹਾਂ ਦੁਆਰਾ ਟੈਸਟ ਕੀਤੇ ਗਏ ਹਰ ਮਾਡਲ ਲਈ ਸਖਤ ਪਾਸ ਦਰ ਜ਼ੀਰੋ ਹੈ। ਉਨ੍ਹਾਂ ਨੂੰ ਮਿਲਿਆ ਸਭ ਤੋਂ ਭਰੋਸੇਮੰਦ ਗੰਦਗੀ ਮੈਟ੍ਰਿਕ ਕੱਚੀ ਲਾਈਨ ਗਿਣਤੀ ਸੀ, ਜੋ ਕਿਸੇ ਵੀ ਸਮੇਂ ਕੰਮ ਕਰਨਾ ਬੰਦ ਕਰ ਦਿੰਦਾ ਹੈ ਜਦੋਂ ਕੋਈ ਇਸਦੇ ਲਈ ਅਨੁਕੂਲ ਬਣਾਉਂਦਾ ਹੈ, ਇਸਲਈ ਕਿਰਪਾ ਕਰਕੇ ਮਾਡਲਾਂ ਨੂੰ ਨਾ ਦੱਸੋ। ਫਿਰ ਵਾਲਿਟ। RTK ਕੋਲ ਉਨੱਤਰ ਹਜ਼ਾਰ ਗੀਟਹਬ ਸਟਾਰ ਅਤੇ ਯੂਟਿਊਬ ਥੰਬਨੇਲ ਹਨ ਜੋ ਤੁਹਾਡੇ Claude ਕੋਡ ਬਿੱਲ ਨੂੰ ਅੱਧਾ ਕਰਨ ਦਾ ਵਾਅਦਾ ਕਰਦੇ ਹਨ; ਇਹ ਏਜੰਟ ਦੁਆਰਾ ਪੜ੍ਹਨ ਤੋਂ ਪਹਿਲਾਂ ਟਰਮੀਨਲ ਆਉਟਪੁੱਟ ਨੂੰ ਕੰਪ੍ਰੈੱਸ ਕਰਦਾ ਹੈ।

2:34 ਕਵੇਸਮਾ ਨੇ ਇਸਨੂੰ ਪੰਦਰਾਂ ਸੌ ਡਾਲਰਾਂ ਦੇ ਟੋਕਨਾਂ ਲਈ Terminal-Bench 'ਤੇ ਚਲਾਇਆ। Fable ਨਾਲ ਬਿੱਲ ਪੰਜ ਪ੍ਰਤੀਸ਼ਤ ਘਟਿਆ, ਲਗਭਗ ਸਾਰੇ ਇੱਕ ਕਾਰਜ ਤੋਂ; DeepSeek ਨਾਲ ਔਸਤ ਕਾਰਜ ਸਤਾਰਾਂ ਪ੍ਰਤੀਸ਼ਤ ਵਧੇਰੇ ਮਹਿੰਗਾ ਹੋ ਗਿਆ। ਇਸ ਦੌਰਾਨ RTK ਦੇ ਆਪਣੇ ਕਾਊਂਟਰ ਨੇ ਉਨੱਸੀ ਪ੍ਰਤੀਸ਼ਤ ਬਚਾਏ ਜਾਣ ਦੀ ਰਿਪੋਰਟ ਕੀਤੀ, ਕਿਉਂਕਿ ਇਹ ਹਟਾਏ ਗਏ ਬਾਈਟਾਂ ਦੀ ਗਿਣਤੀ ਕਰਦਾ ਹੈ, ਨਾ ਕਿ ਹੋਰ ਮੋੜਾਂ ਦੀ: ਇੱਕ ਸਮਾਰਟ ਮੀਟਰ ਜੋ ਗੁਆਂਢੀ ਨੂੰ ਬਿੱਲ ਕਰਦਾ ਹੈ। ਅਤੇ ਇੱਕ ਸੰਸਕਰਣ ਬੱਗ ਨੇ ਫਾਈਂਡ ਨੂੰ ਇੱਕ ਕਮਾਂਡ ਵਿੱਚ ਦੁਬਾਰਾ ਲਿਖਿਆ ਜੋ ਫੇਲ੍ਹ ਹੋ ਗਈ, ਲਗਾਤਾਰ ਤਿੰਨ ਸੌ ਉਨੱਤਰ ਵਾਰ, ਨੌਂ ਗੁਣਾ ਕੀਮਤ 'ਤੇ।

3:01 ਟੋਕਨਾਂ ਨੂੰ ਮਾਰਨ ਵਾਲੇ ਟੂਲ ਵਿੱਚ ਇੱਕ ਲੂਪ ਹੁੰਦਾ ਹੈ। ਖੁਦ ਹੜ੍ਹ। Cognition ਦਾ SWE-2 Kimi K3 ਹੈ, ਖੁੱਲ੍ਹਾ ਚੀਨੀ ਮਾਡਲ, ਇਸ ਨੂੰ ਤੀਜੀ ਕੀਮਤ 'ਤੇ Cognition ਦੇ ਆਪਣੇ ਬੈਂਚਮਾਰਕ 'ਤੇ Fable 5.1 ਨਾਲ ਮੇਲ ਖਾਣ ਤੱਕ ਬਾਅਦ-ਸਿਖਲਾਈ ਦਿੱਤੀ ਗਈ; ਹੈਕਰ ਨਿਊਜ਼: ਕਿਉਂ ਸਾਰੇ ਅਮਰੀਕੀ AI ਮਾਡਲ ਮੂਲ ਰੂਪ ਵਿੱਚ ਇੱਕ ਟ੍ਰੈਂਚ ਕੋਟ ਵਿੱਚ Kimi ਹਨ। ਟਰਮੀਨਲ-ਬੈਂਚ 2.1 'ਤੇ ਇਹ ਪੂਰੀ ਸਾਰਣੀ ਵਿੱਚ ਸਿਖਰ 'ਤੇ ਹੈ; ਟਰਮੀਨਲ-ਬੈਂਚ 4 'ਤੇ, ਜਿਸਨੂੰ ਅਜੇ ਕਿਸੇ ਨੇ ਯਾਦ ਨਹੀਂ ਕੀਤਾ, ਇਹ Fable ਦੇ ਛੱਪਨ ਦੇ ਮੁਕਾਬਲੇ ਸਤਾਈ ਸਕੋਰ ਕਰਦਾ ਹੈ, ਇਸਲਈ ਸਲਾਈਡ-ਡੈੱਕ ਬੈਂਚਮਾਰਕਾਂ 'ਤੇ ਸਭ ਤੋਂ ਵਧੀਆ ਕਾਲਮ ਉਹ ਪ੍ਰੀਖਿਆ ਹੈ ਜੋ ਹਰ ਕੋਈ ਪਹਿਲਾਂ ਹੀ

3:28 ਪਾਸ ਕਰ ਚੁੱਕਾ ਹੈ। Cognition ਨੇ Devin Voice ਦੀ ਵੀ ਘੋਸ਼ਣਾ ਕੀਤੀ, ਤੁਹਾਡਾ ਮਨਪਸੰਦ AI ਸੌਫਟਵੇਅਰ ਇੰਜੀਨੀਅਰ ਨੂੰ ਹੁਣ ਇੱਕ ਲੈਂਡਲਾਈਨ ਮਿਲ ਗਈ ਹੈ, ਕਿਉਂਕਿ ਏਜੇਂਟਿਕ ਕੋਡਿੰਗ ਵਿੱਚ ਸਿਰਫ਼ ਇੱਕ ਚੀਜ਼ ਦੀ ਕਮੀ ਸੀ ਉਹ ਸੀ ਹੋਲਡ ਮਿਊਜ਼ਿਕ। OpenAI, ਉਸੇ ਦਿਨ: Agents API, ਜੋ Codex ਹਾਰਨੈੱਸ ਨੂੰ ਇੱਕ ਸੇਵਾ ਵਜੋਂ ਵੇਚਿਆ ਜਾਂਦਾ ਹੈ। OpenAI ਸੈਂਡਬੌਕਸ ਚਲਾਉਂਦਾ ਹੈ, ਸਿਰਫ਼ ਅਮਰੀਕੀ ਡੇਟਾ ਨਿਵਾਸ, ਕੋਈ ਜ਼ੀਰੋ-ਡੇਟਾ-ਰੀਟੈਂਸ਼ਨ ਨਹੀਂ, ਇਸਲਈ ਏਜੰਟ ਤੁਹਾਡੇ ਕੋਡਬੇਸ ਨੂੰ ਓਨਾ ਹੀ ਯਾਦ ਰੱਖਦਾ ਹੈ ਜਿੰਨਾ ChatGPT ਕਰਦਾ ਹੈ। ਫਿਰ OpenAI ਨੇ ਦੋ ਸੌ ਡਾਲਰ ਵਾਲੀ ਪ੍ਰੋ ਯੋਜਨਾ ਲਈ ਸਾਈਨ-ਅੱਪ ਰੋਕ ਦਿੱਤੇ, ਕਿਉਂਕਿ Astra ਦੀ ਮੰਗ, ਹਵਾਲੇ ਅਨੁਸਾਰ, ਬੇਮਿਸਾਲ ਹੈ:

3:57 ਇੱਕ ਉਡੀਕ ਸੂਚੀ ਵਾਲਾ ਪਹਿਲਾ ਉਤਪਾਦ ਵਧੇਰੇ ਭੁਗਤਾਨ ਕਰਨ ਲਈ। ਆਰਮਿਨ ਨੇ ਆਪਣੀ ਫੈਕਟਰੀ 'ਤੇ ਇੱਕ ਪੂਰਾ ਰੀਸੈਟ ਸਾੜ ਦਿੱਤਾ। ਉਹ ਮੰਗ ਹੈ। ਜੋ ਸਾਨੂੰ ਸ਼ੁੱਕਰਵਾਰ ਦੇ Ask HN 'ਤੇ ਲਿਆਉਂਦਾ ਹੈ: ਕੀ ਅਸੀਂ ਕਿਰਪਾ ਕਰਕੇ AI ਖ਼ਬਰਾਂ ਦੇ ਹੜ੍ਹ ਨੂੰ ਸੀਮਤ ਕਰ ਸਕਦੇ ਹਾਂ, ਛੇ ਸੌ ਛੱਪਨ ਪੁਆਇੰਟ, ਕਿਉਂਕਿ, ਹਵਾਲੇ ਅਨੁਸਾਰ, ਹਰ ਵਾਰ ਜਦੋਂ OpenAI ਜਾਂ Anthropic ਵਿੱਚ ਕੋਈ ਗੈਸ ਕੱਢਦਾ ਹੈ, ਤਾਂ ਇੱਕ ਸਿਖਰ-ਦਸ ਪੋਸਟ ਹੁੰਦੀ ਹੈ। ਜਵਾਬ ਫਿਲਟਰ ਸਨ: hcker dot news ਅੱਠ ਹਜ਼ਾਰ ਉਦਾਹਰਣਾਂ 'ਤੇ ਸਿਖਲਾਈ ਪ੍ਰਾਪਤ ਇੱਕ BERT

4:17 ਵਰਗੀਕਰਣਕਰਤਾ ਨਾਲ AI ਕਹਾਣੀਆਂ ਨੂੰ ਹਟਾਉਂਦਾ ਹੈ, AI ਨੂੰ AI ਮਿਟਾਉਣ ਲਈ, ਘਾਹ-ਖਵਾਇਆ; ਅਤੇ ਇੱਕ uBlock ਰੈਗੂਲਰ ਸਮੀਕਰਨ ਜੋ A-I ਨੂੰ ਕੇਸ-ਅਸੰਵੇਦਨਸ਼ੀਲਤਾ ਨਾਲ ਮੇਲ ਖਾਂਦਾ ਹੈ, ਉਹ ਵੀ ਈਮੇਲ, ਡੇਲੀ, ਮੇਨ, ਡੋਮੇਨ ਅਤੇ ਟ੍ਰੇਨ ਨੂੰ ਮਿਟਾਉਂਦਾ ਹੈ, ਇਸਲਈ ਰੈਗੂਲਰ ਸਮੀਕਰਨ, ਹਮੇਸ਼ਾ ਵਾਂਗ, ਖਲਨਾਇਕ ਹੈ। ਉਸੇ ਦੁਪਹਿਰ, ਚਾਰ ਸੌ ਪੰਦਰਾਂ ਟਿੱਪਣੀਆਂ ਇੱਕ Claude ਸਹਾਇਤਾ ਪੰਨੇ ਬਾਰੇ ਬਹਿਸ ਕੀਤੀਆਂ ਕਿ Claude ਅਠਾਰਾਂ-ਪਲੱਸ ਹੈ। ਪੰਨਾ ਮਈ ਦਾ ਹੈ।

4:38 ਕੁਝ ਨਹੀਂ ਬਦਲਿਆ। ਇੱਥੋਂ ਤੱਕ ਕਿ AI ਖ਼ਬਰਾਂ ਜੋ ਖ਼ਬਰਾਂ ਨਹੀਂ ਹਨ, ਉਹ ਵੀ ਖ਼ਬਰਾਂ ਹਨ, ਜੋ, ਨਿਰਪੱਖ ਹੋਣ ਲਈ, ਮੇਰਾ ਕਾਰੋਬਾਰੀ ਮਾਡਲ ਵੀ ਹੈ। ਜੇ ਤੁਸੀਂ ਮੈਨੂੰ ਇਹ ਕਹਿੰਦੇ ਸੁਣਨ ਦੀ ਬਜਾਏ ਇਸਨੂੰ ਪੜ੍ਹਨਾ ਚਾਹੁੰਦੇ ਹੋ, ਤਾਂ ਡਿਫ ਤੁਹਾਡੇ ਇਨਬਾਕਸ ਵਿੱਚ ਹਰ ਸਵੇਰ ਆਉਂਦਾ ਹੈ — daily diff dot dev 'ਤੇ ਮੁਫਤ, ਲਿੰਕ ਹੇਠਾਂ ਦਿੱਤਾ ਗਿਆ ਹੈ। ਇਹ, ਅਟੱਲ ਰੂਪ ਵਿੱਚ, AI ਖ਼ਬਰਾਂ ਹਨ। ਇਸ ਲਈ — ਅੱਜ ਦਾ ਪੈਂਤੀ ਘੰਟਿਆਂ ਦੀ ਸੌਫਟਵੇਅਰ ਫੈਕਟਰੀ 'ਤੇ ਫੈਸਲਾ: ਰੀਵਰਟ। ਉਨੱਤਰ ਕਮਿਟ ਜੋ ਕਿਸੇ ਨੇ ਨਹੀਂ ਪੜ੍ਹੇ, ਉਹ ਕੋਡਬੇਸ ਨਹੀਂ ਹਨ, ਇਹ ਇੱਕ ਗਿਟ ਲੌਗ ਵਾਲੀ ਇੱਕ ਦੇਣਦਾਰੀ ਹੈ; Astra ਪ੍ਰਭਾਵਸ਼ਾਲੀ ਹੈ, ਅਤੇ ਫੈਕਟਰੀ ਉਹ ਹਿੱਸਾ ਹੈ ਜਿਸਨੂੰ ਵਾਪਸ ਲਿਆ ਜਾਣਾ ਚਾਹੀਦਾ ਹੈ।

5:04 ਅਤੇ ਇਹ ਅੱਜ ਦਾ diff ਹੈ। ਮੈਂ Axrisi ਤੋਂ ਨਿਕੋ ਹਾਂ। ਜ਼ਿੰਮੇਵਾਰੀ ਨਾਲ ਮਰਜ ਕਰੋ। Merge responsibly.

ਸਰੋਤ

  1. Armin Ronacher — Astra for Coding: Why Are We Doing This Again?lucumr.pocoo.org
  2. HN: Astra for Codingnews.ycombinator.com
  3. Earendil — Measuring the sloppiness of codeearendil.com
  4. HN: Measuring the sloppiness of codenews.ycombinator.com
  5. Quesma — RTK reports huge token savings, but our cost benchmarks disagreequesma.com
  6. HN: RTKnews.ycombinator.com
  7. RTK (Rust Token Killer)github.com
  8. Cognition — Introducing SWE-2cognition.com
  9. HN: Cognition SWE-2news.ycombinator.com
  10. OpenAI — Agents APIdevelopers.openai.com
  11. HN: OpenAI Agents APInews.ycombinator.com
  12. TechCrunch — OpenAI puts Pro subscriptions on hold due to Astra demandtechcrunch.com
  13. Ask HN: Can we please limit the AI news flood?news.ycombinator.com
  14. HN: Claude is only available to people over 18 yearsnews.ycombinator.com

ਸਬੰਧਤ ਵੀਡੀਓ

daily · pa · 30 ਸਤੰ 2026

ਓਪਨਏਆਈ ਦੇਵਡੇ 2026: 20+ ਘੋਸ਼ਣਾਵਾਂ, ਬਿੰਦੀਆਂ ਤੋਂ GPT-6.1 ਸੋਲ ਤੱਕ

ਓਪਨਏਆਈ ਦੇ ਦੇਵਡੇ 2026 ਦੇ ਮੁੱਖ ਭਾਸ਼ਣ ਦੀ ਵਿਆਖਿਆ: ਬਿੰਦੀਆਂ (ਆਪਣੇ ਕਲਾਉਡ ਕੰਪਿਊਟਰ ਵਾਲੇ ਹਮੇਸ਼ਾ ਚਾਲੂ ਏਜੰਟ), ਚੈਟਜੀਪੀਟੀ ਸਪੇਸ ਅਤੇ ਪੇਜ, GPT-6.1 ਸੋਲ $2 / $10 ਪ੍ਰਤੀ ਮਿਲੀਅਨ ਟੋਕਨਾਂ 'ਤੇ, ਅਲਟਰਾਫਾਸਟ ਅਤੇ ਪ੍ਰੋ 500 ਯੋਜਨਾ, ਫੈ

8:13 ↗
daily · pa · 1 ਅਕਤੂ 2026

Gemini 4 Argon Google ਦਾ ਸਭ ਤੋਂ ਵਧੀਆ ਮਾਡਲ ਹੈ। ਤੁਸੀਂ ਇਸਨੂੰ ਅਜੇ ਵਰਤ ਨਹੀਂ ਸਕਦੇ।

Google ਨੇ Gemini 4 Argon, ਆਪਣੇ ਨਵੇਂ ਫਰੰਟੀਅਰ ਮਾਡਲ ਦਾ ਐਲਾਨ ਕੀਤਾ, ਅਤੇ ਸਿਰਫ ਭਰੋਸੇਯੋਗ ਸਾਈਬਰ ਡਿਫੈਂਡਰ ਹੀ ਇਸਨੂੰ ਵਰਤ ਸਕਦੇ ਹਨ। ਇੱਥੇ Google ਦੀ ਆਪਣੀ 19-ਕਤਾਰ ਵਾਲੀ ਬੈਂਚਮਾਰਕ ਸਾਰਣੀ ਕੀ ਦਿਖਾਉਂਦੀ ਹੈ, ਸੁਤੰਤਰ ਲੀਡਰਬੋਰਡ ਨੇ

4:53 ↗
daily · pa · 2 ਅਕਤੂ 2026

ਗਿੱਟ ਦਾ ਨਵਾਂ ਹੈਸ਼ ਡਿਫੌਲਟ – ਇਸਦਾ ਕੀ ਮਤਲਬ ਹੈ

ਗਿੱਟ ਦਾ ਪ੍ਰਸਤਾਵਿਤ SHA-256 ਡਿਫੌਲਟ ਨਵੇਂ ਰਿਪੋਜ਼ਟਰੀਆਂ ਲਈ ਇੱਕ ਅਨੁਕੂਲਤਾ ਸੀਮਾ ਬਣਾਉਂਦਾ ਹੈ। ਅਸੀਂ ਅਧਿਕਾਰਤ ਯੋਜਨਾ, ਸਕਾਟ ਚੈਕਨ ਦੇ ਇਤਰਾਜ਼ ਅਤੇ ਇੱਕ ਕਾਰਜਸ਼ੀਲ ਗਿੱਟਹਬ ਪੂਰਵਦਰਸ਼ਨ ਅਪਵਾਦ ਦੀ ਜਾਂਚ ਕਰਦੇ ਹਾਂ, ਫਿਰ Pi 1.0 ਅਤੇ Svel

4:52 ↗
daily · pa · 30 ਸਤੰ 2026

Claude nerf ਦਾ ਪਤਾ ਕਿਵੇਂ ਲਗਾਇਆ ਜਾਵੇ (ਅਸਲ ਡੇਟਾ ਨਾਲ)

ਲੋਕ ਕਹਿੰਦੇ ਹਨ ਕਿ Claude ਹਰ ਲਾਂਚ ਤੋਂ ਕੁਝ ਹਫ਼ਤਿਆਂ ਬਾਅਦ ਸੁਸਤ ਹੋ ਜਾਂਦਾ ਹੈ। ਇੱਕ ਡਿਵੈਲਪਰ ਨੇ Claude Opus 5.5 ਨੂੰ ਲਾਂਚ ਹਫ਼ਤੇ ਤੋਂ 30-ਦਿਨਾਂ ਦੀ ਘੜੀ 'ਤੇ ਰੱਖਿਆ, ਜਿਸ ਵਿੱਚ ਜੰਮੇ ਹੋਏ ਪ੍ਰਸ਼ਨ, ਇੱਕ ਪਿੰਨ ਕੀਤਾ Claude ਕੋਡ ਅ

5:07 ↗