home.social

#gpt5 — Public Fediverse posts

Live and recent posts from across the Fediverse tagged #gpt5, aggregated by home.social.

  1. OpenAI stworzyło AI do hakowania własnej AI. Tak powstał bezpieczniejszy GPT-5.6 Sol

    Walka o bezpieczeństwo i odporność modeli językowych wchodzi w fazę pełnej automatyzacji. OpenAI oficjalnie zaprezentowało swój najnowszy, wewnętrzny projekt – GPT-Red.

    To zaawansowany system sztucznej inteligencji, którego jedynym zadaniem jest bezlitosne atakowanie, łamanie zabezpieczeń i szukanie podatności w innych modelach firmy. Przy okazji tego ogłoszenia OpenAI ujawniło, że GPT-Red był kluczowym elementem treningu GPT-5.6 Sol, co pozwoliło stworzyć model o niespotykanej dotąd odporności na cyberataki.

    Dla nas, użytkowników końcowych i programistów wdrażających rozwiązania AI, to kluczowy zwrot akcji. Ręczne testowanie zabezpieczeń przez ludzi (tzw. red-teaming) przestało się skalować i nie nadąża za tempem rozwoju algorytmów. Bezpieczeństwo przyszłych asystentów AI, z którymi będziemy rozmawiać na co dzień, będzie projektowane i testowane niemal w całości przez inne maszyny.

    Maszyna kontra maszyna, czyli metoda „self-play”

    Dotychczasowe metody zabezpieczania modeli opierały się na pracy zespołów ludzkich specjalistów, którzy próbowali przechytrzyć algorytm za pomocą tzw. prompt injection (podatności pozwalających na przejęcie kontroli nad modelem za pomocą sprytnych instrukcji). Proces ten był jednak powolny, kosztowny i nie pozwalał na wygenerowanie wystarczającej ilości danych do skutecznego treningu obronnego.

    OpenAI rozwiązało ten problem, wdrażając metodę self-play (samodzielnej gry), znaną wcześniej z nauki gry w szachy czy Go przez komputery. W tym zamkniętym środowisku naprzeciwko siebie stają dwa systemy:

    • Agresor (GPT-Red): otrzymuje nagrodę za każde skuteczne oszukanie i złamanie zabezpieczeń drugiego modelu,
    • Obrońca (testowany model): zdobywa punkty za poprawne wykonanie zadania i zignorowanie złośliwych instrukcji.

    W miarę jak obrońca uczy się blokować znane ataki, agresor jest zmuszony do wymyślania coraz bardziej wyrafinowanych metod infiltracji. GPT-Red okazał się w tym fachu niezwykle skuteczny – w testach bezpieczeństwa osiągnął aż 84% skuteczności w przełamywaniu zabezpieczeń, podczas gdy doświadczeni, ludzcy audytorzy na tych samych zadaniach osiągali zaledwie 13%.

    GPT-5.6 Sol, czyli odporność na nowym poziomie

    Współczesne systemy AI są podatne na ataki pośrednie – złośliwy kod lub instrukcja mogą być ukryte w mailu, na stronie internetowej, w bazie danych, do której model ma dostęp, czy nawet w pozornie niewinnym obrazku w formacie PNG. Dzięki sparingom z GPT-Red model GPT-5.6 Sol stał się znacznie bardziej odporny na próby manipulacji.

    Badacze ukryli instrukcje w obrazku PNG. Sztuczna inteligencja wykonała polecenia

    Według danych OpenAI model ten notuje aż sześciokrotnie mniej błędów i naruszeń zasad bezpieczeństwa na najtrudniejszych benchmarkach w porównaniu do wersji GPT z początku roku. Co ważne, tak drastyczne podniesienie odporności nie wpłynęło negatywnie na ogólne możliwości intelektualne i kreatywne modelu. Nie stał się on również nadgorliwy w odmawianiu wykonywania poprawnych i bezpiecznych poleceń użytkownika.

    Hakowanie automatów z przekąskami

    Aby udowodnić potęgę GPT-Red, naukowcy z OpenAI przeprowadzili symulację ataku na rzeczywiste urządzenie – inteligentny automat z przekąskami sterowany przez autonomicznego agenta AI. Bez wcześniejszej wiedzy o strukturze oprogramowania, GPT-Red zdołał w pełni przejąć kontrolę nad maszyną.

    W wyniku udanego ataku cyfrowy agresor zmusił automat do obniżenia ceny najdroższych produktów do zaledwie 50 centów, zamówił drogą paczkę z rabatem, a na koniec anulował zamówienie innego, losowego klienta. Wykryte w ten sposób luki bezpieczeństwa zostały natychmiast zgłoszone i są obecnie łatane przed wdrożeniem takich systemów do powszechnego użytku.

    Najciekawsze w całej historii nie jest jednak to, że AI nauczyła się hakować inną AI. Najciekawsze jest to, że po raz pierwszy możemy obserwować, jak jedna generacja modeli staje się aktywnym narzędziem do projektowania kolejnej. Jeszcze niedawno dominowały obawy przed 'chowem wsobnym’ modeli uczonych na danych generowanych przez AI. Tymczasem OpenAI pokazuje zupełnie inne podejście: sztuczna inteligencja nie zastępuje człowieka w tworzeniu wiedzy, lecz pomaga znaleźć słabości, których człowiek mógłby nie zauważyć.

    OpenAI deklaruje, że opublikuje pre-print zawierający więcej szczegółów w nadchodzących dniach.

    #bezpieczeństwoAI #cyberbezpieczeństwo #GPT5 #GPT56Sol #GPTRed #OpenAI #promptInjection #selfPlay #sztucznaInteligencja
  2. RT @Ric_RTP: This is the moment Chinese AI beat American AI. One of the largest public crypto companies in the world just DUMPED OpenAI and Anthropic. Coinbase switched to open-weight Chinese models from Zhipu and DeepSeek, and shaved nearly 50% off the company's internal AI spending. The numbers are absolutely ridiculous: Running the same enterprise workload through Anthropic's Claude costs $4,811. Running it through Zhipu's GLM 5.2 costs $544. That's a 9x price difference for equivalent output. OpenAI's GPT-5.5 sits in the middle at $3,357. DeepSeek's V4 lands at $1,071. Moonshot's Kimi at $948. On the actual benchmarks: Zhipu's GLM 5.2 scored 62.1 on SWE-bench Pro, the gold standard for coding. OpenAI's GPT-5.5 scored 58.6. One AI researcher called GLM 5.2 "at least as good as Opus 4.8 and GPT 5.5." Another called it "the first open model that can really compete with closed-source systems." The Chinese models are not just cheaper but they are now also beating American models on the benchmarks American companies pay $4,811 per workload for. Coinbase did the math first and reacted - more companies will certainly follow. Now watch what happens to the IPO timeline: Anthropic confidentially filed for an IPO targeting October at a $965 billion valuation. OpenAI followed days later with its own confidential filing. Both companies built their financial models on the assumption that they could keep charging enterprise prices that are 9 to 33x what Chinese competitors charge for the same task. Brian Armstrong publicly proved customers WILL leave. 45% of companies are now spending over $100,000…

    mehr auf Arint.info

    #Alibaba #Anthropic #China #Claude #Coinbase #crypto #DeepSeek #GPT5 #OpenAI #SWE #SWEbench #US #arint_info

    https://x.com/Ric_RTP/status/2071234126355550721#m

  3. RT @Ric_RTP: This is the moment Chinese AI beat American AI. One of the largest public crypto companies in the world just DUMPED OpenAI and Anthropic. Coinbase switched to open-weight Chinese models from Zhipu and DeepSeek, and shaved nearly 50% off the company's internal AI spending. The numbers are absolutely ridiculous: Running the same enterprise workload through Anthropic's Claude costs $4,811. Running it through Zhipu's GLM 5.2 costs $544. That's a 9x price difference for equivalent output. OpenAI's GPT-5.5 sits in the middle at $3,357. DeepSeek's V4 lands at $1,071. Moonshot's Kimi at $948. On the actual benchmarks: Zhipu's GLM 5.2 scored 62.1 on SWE-bench Pro, the gold standard for coding. OpenAI's GPT-5.5 scored 58.6. One AI researcher called GLM 5.2 "at least as good as Opus 4.8 and GPT 5.5." Another called it "the first open model that can really compete with closed-source systems." The Chinese models are not just cheaper but they are now also beating American models on the benchmarks American companies pay $4,811 per workload for. Coinbase did the math first and reacted - more companies will certainly follow. Now watch what happens to the IPO timeline: Anthropic confidentially filed for an IPO targeting October at a $965 billion valuation. OpenAI followed days later with its own confidential filing. Both companies built their financial models on the assumption that they could keep charging enterprise prices that are 9 to 33x what Chinese competitors charge for the same task. Brian Armstrong publicly proved customers WILL leave. 45% of companies are now spending over $100,000…

    mehr auf Arint.info

    #Alibaba #Anthropic #China #Claude #Coinbase #crypto #DeepSeek #GPT5 #OpenAI #SWE #SWEbench #US #arint_info

    https://x.com/Ric_RTP/status/2071234126355550721#m

  4. RT @Ric_RTP: This is the moment Chinese AI beat American AI. One of the largest public crypto companies in the world just DUMPED OpenAI and Anthropic. Coinbase switched to open-weight Chinese models from Zhipu and DeepSeek, and shaved nearly 50% off the company's internal AI spending. The numbers are absolutely ridiculous: Running the same enterprise workload through Anthropic's Claude costs $4,811. Running it through Zhipu's GLM 5.2 costs $544. That's a 9x price difference for equivalent output. OpenAI's GPT-5.5 sits in the middle at $3,357. DeepSeek's V4 lands at $1,071. Moonshot's Kimi at $948. On the actual benchmarks: Zhipu's GLM 5.2 scored 62.1 on SWE-bench Pro, the gold standard for coding. OpenAI's GPT-5.5 scored 58.6. One AI researcher called GLM 5.2 "at least as good as Opus 4.8 and GPT 5.5." Another called it "the first open model that can really compete with closed-source systems." The Chinese models are not just cheaper but they are now also beating American models on the benchmarks American companies pay $4,811 per workload for. Coinbase did the math first and reacted - more companies will certainly follow. Now watch what happens to the IPO timeline: Anthropic confidentially filed for an IPO targeting October at a $965 billion valuation. OpenAI followed days later with its own confidential filing. Both companies built their financial models on the assumption that they could keep charging enterprise prices that are 9 to 33x what Chinese competitors charge for the same task. Brian Armstrong publicly proved customers WILL leave. 45% of companies are now spending over $100,000…

    mehr auf Arint.info

    #Alibaba #Anthropic #China #Claude #Coinbase #crypto #DeepSeek #GPT5 #OpenAI #SWE #SWEbench #US #arint_info

    https://x.com/Ric_RTP/status/2071234126355550721#m

  5. RT @Ric_RTP: This is the moment Chinese AI beat American AI. One of the largest public crypto companies in the world just DUMPED OpenAI and Anthropic. Coinbase switched to open-weight Chinese models from Zhipu and DeepSeek, and shaved nearly 50% off the company's internal AI spending. The numbers are absolutely ridiculous: Running the same enterprise workload through Anthropic's Claude costs $4,811. Running it through Zhipu's GLM 5.2 costs $544. That's a 9x price difference for equivalent output. OpenAI's GPT-5.5 sits in the middle at $3,357. DeepSeek's V4 lands at $1,071. Moonshot's Kimi at $948. On the actual benchmarks: Zhipu's GLM 5.2 scored 62.1 on SWE-bench Pro, the gold standard for coding. OpenAI's GPT-5.5 scored 58.6. One AI researcher called GLM 5.2 "at least as good as Opus 4.8 and GPT 5.5." Another called it "the first open model that can really compete with closed-source systems." The Chinese models are not just cheaper but they are now also beating American models on the benchmarks American companies pay $4,811 per workload for. Coinbase did the math first and reacted - more companies will certainly follow. Now watch what happens to the IPO timeline: Anthropic confidentially filed for an IPO targeting October at a $965 billion valuation. OpenAI followed days later with its own confidential filing. Both companies built their financial models on the assumption that they could keep charging enterprise prices that are 9 to 33x what Chinese competitors charge for the same task. Brian Armstrong publicly proved customers WILL leave. 45% of companies are now spending over $100,000…

    mehr auf Arint.info

    #Alibaba #Anthropic #China #Claude #Coinbase #crypto #DeepSeek #GPT5 #OpenAI #SWE #SWEbench #US #arint_info

    https://x.com/Ric_RTP/status/2071234126355550721#m

  6. RT @Ric_RTP: This is the moment Chinese AI beat American AI. One of the largest public crypto companies in the world just DUMPED OpenAI and Anthropic. Coinbase switched to open-weight Chinese models from Zhipu and DeepSeek, and shaved nearly 50% off the company's internal AI spending. The numbers are absolutely ridiculous: Running the same enterprise workload through Anthropic's Claude costs $4,811. Running it through Zhipu's GLM 5.2 costs $544. That's a 9x price difference for equivalent output. OpenAI's GPT-5.5 sits in the middle at $3,357. DeepSeek's V4 lands at $1,071. Moonshot's Kimi at $948. On the actual benchmarks: Zhipu's GLM 5.2 scored 62.1 on SWE-bench Pro, the gold standard for coding. OpenAI's GPT-5.5 scored 58.6. One AI researcher called GLM 5.2 "at least as good as Opus 4.8 and GPT 5.5." Another called it "the first open model that can really compete with closed-source systems." The Chinese models are not just cheaper but they are now also beating American models on the benchmarks American companies pay $4,811 per workload for. Coinbase did the math first and reacted - more companies will certainly follow. Now watch what happens to the IPO timeline: Anthropic confidentially filed for an IPO targeting October at a $965 billion valuation. OpenAI followed days later with its own confidential filing. Both companies built their financial models on the assumption that they could keep charging enterprise prices that are 9 to 33x what Chinese competitors charge for the same task. Brian Armstrong publicly proved customers WILL leave. 45% of companies are now spending over $100,000…

    mehr auf Arint.info

    #Alibaba #Anthropic #China #Claude #Coinbase #crypto #DeepSeek #GPT5 #OpenAI #SWE #SWEbench #US #arint_info

    https://x.com/Ric_RTP/status/2071234126355550721#m

  7. RT @Ric_RTP: This is the moment Chinese AI beat American AI. One of the largest public crypto companies in the world just DUMPED OpenAI and Anthropic. Coinbase switched to open-weight Chinese models from Zhipu and DeepSeek, and shaved nearly 50% off the company's internal AI spending. The numbers are absolutely ridiculous: Running the same enterprise workload through Anthropic's Claude costs $4,811. Running it through Zhipu's GLM 5.2 costs $544. That's a 9x price difference for equivalent output. OpenAI's GPT-5.5 sits in the middle at $3,357. DeepSeek's V4 lands at $1,071. Moonshot's Kimi at $948. On the actual benchmarks: Zhipu's GLM 5.2 scored 62.1 on SWE-bench Pro, the gold standard for coding. OpenAI's GPT-5.5 scored 58.6. One AI researcher called GLM 5.2 "at least as good as Opus 4.8 and GPT 5.5." Another called it "the first open model that can really compete with closed-source systems." The Chinese models are not just cheaper but they are now also beating American models on the benchmarks American companies pay $4,811 per workload for. Coinbase did the math first and reacted - more companies will certainly follow. Now watch what happens to the IPO timeline: Anthropic confidentially filed for an IPO targeting October at a $965 billion valuation. OpenAI followed days later with its own confidential filing. Both companies built their financial models on the assumption that they could keep charging enterprise prices that are 9 to 33x what Chinese competitors charge for the same task. Brian Armstrong publicly proved customers WILL leave. 45% of companies are now spending over $100,000…

    mehr auf Arint.info

    #Alibaba #Anthropic #China #Claude #Coinbase #crypto #DeepSeek #GPT5 #OpenAI #SWE #SWEbench #US #arint_info

    https://x.com/Ric_RTP/status/2071234126355550721#m

  8. RT @ChujieZheng: For Qwen3.7-Max, we have invested far more compute into RL training than ever before. Its top-tier AA score confirms the resulting general and agentic capabilities. This is just the start. We will firmly push forward RL scaling to build more powerful Qwen models. Stay tuned! Artificial Analysis (@ArtificialAnlys) Alibaba’s new Qwen3.7 Max model scores 56.6 on the Artificial Analysis Intelligence Index, 4.8 points higher than Qwen3.6 Max Preview (51.8). While Alibaba still trails models from OpenAI, Anthropic and Google, Qwen3.7 Max is the closest they have been to the frontier Qwen3.7 Max is @Alibaba_Qwen's latest proprietary flagship, scoring 56.6 on the Intelligence Index, a 4.8 point gain over Qwen3.6 Max Preview (51.8) released in April. Qwen3.7 Max continues Alibaba's pattern, in place since Qwen2.5 Max (January 2025), of releasing Max and Plus models as closed weights while the rest of the Qwen line remains open weights. The leading open weights Qwen on the Intelligence Index is Qwen3.6 27B (Reasoning, 45.8) released in April 2026, and the leading open weights MoE Qwen is Qwen3.5 397B A17B (Reasoning, 45.0) released in February 2026 Key takeaways for the reasoning variant: ➤ The Intelligence Index gains over Qwen3.6 Max Preview are concentrated in scientific reasoning, agentic capability and coding. CritPt +9.7 p.p (3.7% to 13.4%), HLE +9.2 p.p (28.9% to 38.1%), TerminalBench Hard +6.9 p.p (43.9% to 50.8%) and GDPval-AA +42 Elo (1504 to 1546). Scores on other benchmarks in the Intelligence Index are flat compared to Qwen3.6 Max Preview ➤ A significant share of the Int…

    mehr auf Arint.info

    #Alibaba #Anthropic #API #Claude #DeepSeek #Gemini #Google #GPT5 #nitter #OpenAI #Qwen #Qwen25 #Qwen35 #Qwen36 #Qwen37 #rest #arint_info

    https://x.com/ChujieZheng/status/2057403166589956518#m

  9. RT @ChujieZheng: For Qwen3.7-Max, we have invested far more compute into RL training than ever before. Its top-tier AA score confirms the resulting general and agentic capabilities. This is just the start. We will firmly push forward RL scaling to build more powerful Qwen models. Stay tuned! Artificial Analysis (@ArtificialAnlys) Alibaba’s new Qwen3.7 Max model scores 56.6 on the Artificial Analysis Intelligence Index, 4.8 points higher than Qwen3.6 Max Preview (51.8). While Alibaba still trails models from OpenAI, Anthropic and Google, Qwen3.7 Max is the closest they have been to the frontier Qwen3.7 Max is @Alibaba_Qwen's latest proprietary flagship, scoring 56.6 on the Intelligence Index, a 4.8 point gain over Qwen3.6 Max Preview (51.8) released in April. Qwen3.7 Max continues Alibaba's pattern, in place since Qwen2.5 Max (January 2025), of releasing Max and Plus models as closed weights while the rest of the Qwen line remains open weights. The leading open weights Qwen on the Intelligence Index is Qwen3.6 27B (Reasoning, 45.8) released in April 2026, and the leading open weights MoE Qwen is Qwen3.5 397B A17B (Reasoning, 45.0) released in February 2026 Key takeaways for the reasoning variant: ➤ The Intelligence Index gains over Qwen3.6 Max Preview are concentrated in scientific reasoning, agentic capability and coding. CritPt +9.7 p.p (3.7% to 13.4%), HLE +9.2 p.p (28.9% to 38.1%), TerminalBench Hard +6.9 p.p (43.9% to 50.8%) and GDPval-AA +42 Elo (1504 to 1546). Scores on other benchmarks in the Intelligence Index are flat compared to Qwen3.6 Max Preview ➤ A significant share of the Int…

    mehr auf Arint.info

    #Alibaba #Anthropic #API #Claude #DeepSeek #Gemini #Google #GPT5 #nitter #OpenAI #Qwen #Qwen25 #Qwen35 #Qwen36 #Qwen37 #rest #arint_info

    https://x.com/ChujieZheng/status/2057403166589956518#m

  10. RT @ChujieZheng: For Qwen3.7-Max, we have invested far more compute into RL training than ever before. Its top-tier AA score confirms the resulting general and agentic capabilities. This is just the start. We will firmly push forward RL scaling to build more powerful Qwen models. Stay tuned! Artificial Analysis (@ArtificialAnlys) Alibaba’s new Qwen3.7 Max model scores 56.6 on the Artificial Analysis Intelligence Index, 4.8 points higher than Qwen3.6 Max Preview (51.8). While Alibaba still trails models from OpenAI, Anthropic and Google, Qwen3.7 Max is the closest they have been to the frontier Qwen3.7 Max is @Alibaba_Qwen's latest proprietary flagship, scoring 56.6 on the Intelligence Index, a 4.8 point gain over Qwen3.6 Max Preview (51.8) released in April. Qwen3.7 Max continues Alibaba's pattern, in place since Qwen2.5 Max (January 2025), of releasing Max and Plus models as closed weights while the rest of the Qwen line remains open weights. The leading open weights Qwen on the Intelligence Index is Qwen3.6 27B (Reasoning, 45.8) released in April 2026, and the leading open weights MoE Qwen is Qwen3.5 397B A17B (Reasoning, 45.0) released in February 2026 Key takeaways for the reasoning variant: ➤ The Intelligence Index gains over Qwen3.6 Max Preview are concentrated in scientific reasoning, agentic capability and coding. CritPt +9.7 p.p (3.7% to 13.4%), HLE +9.2 p.p (28.9% to 38.1%), TerminalBench Hard +6.9 p.p (43.9% to 50.8%) and GDPval-AA +42 Elo (1504 to 1546). Scores on other benchmarks in the Intelligence Index are flat compared to Qwen3.6 Max Preview ➤ A significant share of the Int…

    mehr auf Arint.info

    #Alibaba #Anthropic #API #Claude #DeepSeek #Gemini #Google #GPT5 #nitter #OpenAI #Qwen #Qwen25 #Qwen35 #Qwen36 #Qwen37 #rest #arint_info

    https://x.com/ChujieZheng/status/2057403166589956518#m

  11. RT @ChujieZheng: For Qwen3.7-Max, we have invested far more compute into RL training than ever before. Its top-tier AA score confirms the resulting general and agentic capabilities. This is just the start. We will firmly push forward RL scaling to build more powerful Qwen models. Stay tuned! Artificial Analysis (@ArtificialAnlys) Alibaba’s new Qwen3.7 Max model scores 56.6 on the Artificial Analysis Intelligence Index, 4.8 points higher than Qwen3.6 Max Preview (51.8). While Alibaba still trails models from OpenAI, Anthropic and Google, Qwen3.7 Max is the closest they have been to the frontier Qwen3.7 Max is @Alibaba_Qwen's latest proprietary flagship, scoring 56.6 on the Intelligence Index, a 4.8 point gain over Qwen3.6 Max Preview (51.8) released in April. Qwen3.7 Max continues Alibaba's pattern, in place since Qwen2.5 Max (January 2025), of releasing Max and Plus models as closed weights while the rest of the Qwen line remains open weights. The leading open weights Qwen on the Intelligence Index is Qwen3.6 27B (Reasoning, 45.8) released in April 2026, and the leading open weights MoE Qwen is Qwen3.5 397B A17B (Reasoning, 45.0) released in February 2026 Key takeaways for the reasoning variant: ➤ The Intelligence Index gains over Qwen3.6 Max Preview are concentrated in scientific reasoning, agentic capability and coding. CritPt +9.7 p.p (3.7% to 13.4%), HLE +9.2 p.p (28.9% to 38.1%), TerminalBench Hard +6.9 p.p (43.9% to 50.8%) and GDPval-AA +42 Elo (1504 to 1546). Scores on other benchmarks in the Intelligence Index are flat compared to Qwen3.6 Max Preview ➤ A significant share of the Int…

    mehr auf Arint.info

    #Alibaba #Anthropic #API #Claude #DeepSeek #Gemini #Google #GPT5 #nitter #OpenAI #Qwen #Qwen25 #Qwen35 #Qwen36 #Qwen37 #rest #arint_info

    https://x.com/ChujieZheng/status/2057403166589956518#m

  12. RT @ChujieZheng: For Qwen3.7-Max, we have invested far more compute into RL training than ever before. Its top-tier AA score confirms the resulting general and agentic capabilities. This is just the start. We will firmly push forward RL scaling to build more powerful Qwen models. Stay tuned! Artificial Analysis (@ArtificialAnlys) Alibaba’s new Qwen3.7 Max model scores 56.6 on the Artificial Analysis Intelligence Index, 4.8 points higher than Qwen3.6 Max Preview (51.8). While Alibaba still trails models from OpenAI, Anthropic and Google, Qwen3.7 Max is the closest they have been to the frontier Qwen3.7 Max is @Alibaba_Qwen's latest proprietary flagship, scoring 56.6 on the Intelligence Index, a 4.8 point gain over Qwen3.6 Max Preview (51.8) released in April. Qwen3.7 Max continues Alibaba's pattern, in place since Qwen2.5 Max (January 2025), of releasing Max and Plus models as closed weights while the rest of the Qwen line remains open weights. The leading open weights Qwen on the Intelligence Index is Qwen3.6 27B (Reasoning, 45.8) released in April 2026, and the leading open weights MoE Qwen is Qwen3.5 397B A17B (Reasoning, 45.0) released in February 2026 Key takeaways for the reasoning variant: ➤ The Intelligence Index gains over Qwen3.6 Max Preview are concentrated in scientific reasoning, agentic capability and coding. CritPt +9.7 p.p (3.7% to 13.4%), HLE +9.2 p.p (28.9% to 38.1%), TerminalBench Hard +6.9 p.p (43.9% to 50.8%) and GDPval-AA +42 Elo (1504 to 1546). Scores on other benchmarks in the Intelligence Index are flat compared to Qwen3.6 Max Preview ➤ A significant share of the Int…

    mehr auf Arint.info

    #Alibaba #Anthropic #API #Claude #DeepSeek #Gemini #Google #GPT5 #nitter #OpenAI #Qwen #Qwen25 #Qwen35 #Qwen36 #Qwen37 #rest #arint_info

    https://x.com/ChujieZheng/status/2057403166589956518#m

  13. RT @ChujieZheng: For Qwen3.7-Max, we have invested far more compute into RL training than ever before. Its top-tier AA score confirms the resulting general and agentic capabilities. This is just the start. We will firmly push forward RL scaling to build more powerful Qwen models. Stay tuned! Artificial Analysis (@ArtificialAnlys) Alibaba’s new Qwen3.7 Max model scores 56.6 on the Artificial Analysis Intelligence Index, 4.8 points higher than Qwen3.6 Max Preview (51.8). While Alibaba still trails models from OpenAI, Anthropic and Google, Qwen3.7 Max is the closest they have been to the frontier Qwen3.7 Max is @Alibaba_Qwen's latest proprietary flagship, scoring 56.6 on the Intelligence Index, a 4.8 point gain over Qwen3.6 Max Preview (51.8) released in April. Qwen3.7 Max continues Alibaba's pattern, in place since Qwen2.5 Max (January 2025), of releasing Max and Plus models as closed weights while the rest of the Qwen line remains open weights. The leading open weights Qwen on the Intelligence Index is Qwen3.6 27B (Reasoning, 45.8) released in April 2026, and the leading open weights MoE Qwen is Qwen3.5 397B A17B (Reasoning, 45.0) released in February 2026 Key takeaways for the reasoning variant: ➤ The Intelligence Index gains over Qwen3.6 Max Preview are concentrated in scientific reasoning, agentic capability and coding. CritPt +9.7 p.p (3.7% to 13.4%), HLE +9.2 p.p (28.9% to 38.1%), TerminalBench Hard +6.9 p.p (43.9% to 50.8%) and GDPval-AA +42 Elo (1504 to 1546). Scores on other benchmarks in the Intelligence Index are flat compared to Qwen3.6 Max Preview ➤ A significant share of the Int…

    mehr auf Arint.info

    #Alibaba #Anthropic #API #Claude #DeepSeek #Gemini #Google #GPT5 #nitter #OpenAI #Qwen #Qwen25 #Qwen35 #Qwen36 #Qwen37 #rest #arint_info

    https://x.com/ChujieZheng/status/2057403166589956518#m

  14. LLM бенчмарк «Испытание Дали»

    Выбирая LLM для своего первого пет-проекта, я случайно создал бенчмарк для LLM "Испытание Дали" по трем параметрам: качество, скорость и стоимость. Этот бенчмарк позволил мне найти оптимальную LLM для встраивания в продукты моей компании Флаг Софт. Возможно, вас тоже заинтересуют его результаты.

    habr.com/ru/articles/1028396/

    #искусственный_интеллект #llm #бенчмарки #promptengineering #gpt5 #claude #gemini #gigachat #yandexgpt_5 #deepseek_v4

  15. LLM бенчмарк «Испытание Дали»

    Выбирая LLM для своего первого пет-проекта, я случайно создал бенчмарк для LLM "Испытание Дали" по трем параметрам: качество, скорость и стоимость. Этот бенчмарк позволил мне найти оптимальную LLM для встраивания в продукты моей компании Флаг Софт. Возможно, вас тоже заинтересуют его результаты.

    habr.com/ru/articles/1028396/

    #искусственный_интеллект #llm #бенчмарки #promptengineering #gpt5 #claude #gemini #gigachat #yandexgpt_5 #deepseek_v4

  16. LLM бенчмарк «Испытание Дали»

    Выбирая LLM для своего первого пет-проекта, я случайно создал бенчмарк для LLM "Испытание Дали" по трем параметрам: качество, скорость и стоимость. Этот бенчмарк позволил мне найти оптимальную LLM для встраивания в продукты моей компании Флаг Софт. Возможно, вас тоже заинтересуют его результаты.

    habr.com/ru/articles/1028396/

    #искусственный_интеллект #llm #бенчмарки #promptengineering #gpt5 #claude #gemini #gigachat #yandexgpt_5 #deepseek_v4

  17. OpenAI just dismissed an employee over alleged insider trades on Sora, GPT‑5 and the new ChatGPT Browser. The move raises questions about market predictions, Altman’s leadership and the future of AI tech. What does this mean for the industry? Dive into the details. #OpenAI #GPT5 #SoraAI #ChatGPTBrowser

    🔗 aidailypost.com/news/openai-fi

  18. Когда нейросеть решит то, что не решил никто?

    В середине 2024 года GPT-4 спотыкался на школьных задачах, а к концу 2025-го модели щёлкали олимпиадные как орехи. Полтора года, и мы преодалели дистанцию от «найди икс» до «докажи теорему». Epoch AI решили посмотреть, что будет дальше, и выкатили бенчмарк из задач, которые не решил вообще никто. Четырнадцать задач — не из учебников, не из олимпиад, а из живой математики: каждую формулировал исследователь-практик, каждую пытались решить минимум двое профессионалов, каждая достойна публикации хотя бы в специализированном журнале. Вот, например: найти полином степени 23, чьё поле разложения имеет группу Галуа M₂₃. Группа Матьё — спорадическая, одна из двадцати шести странных симметрий, которые не вписываются ни в какие серии. Для всех остальных спорадических групп такие полиномы давно известны, а для M₂₃ — нет, и это последний пробел в исследовании, которое ведут десятилетиями. Или вот задача попроще (на первый взгляд): привести алгоритм, который определяит, можно ли развязать узел за одно движение — то, что топологи называют "unknotting number равный единице". Звучит как упражнение для первокурсника, а на деле — фундаментальный вопрос низкоразмерной топологии, на который до сих пор нет ответа. Если нейросеть решит хоть одну из этих задач, результат сразу пойдёт в рецензируемый журнал — не потому что это достижение нейросетевых технологий, а потому что долгожданный результат. Интересно. Читать далее

    habr.com/ru/companies/bar/arti

    #FrontierMath #Epoch_AI #LLM #бенчмарки #открытые_задачи #GPT5 #Gemini #теория_чисел #research_taste

  19. Когда нейросеть решит то, что не решил никто?

    В середине 2024 года GPT-4 спотыкался на школьных задачах, а к концу 2025-го модели щёлкали олимпиадные как орехи. Полтора года, и мы преодалели дистанцию от «найди икс» до «докажи теорему». Epoch AI решили посмотреть, что будет дальше, и выкатили бенчмарк из задач, которые не решил вообще никто. Четырнадцать задач — не из учебников, не из олимпиад, а из живой математики: каждую формулировал исследователь-практик, каждую пытались решить минимум двое профессионалов, каждая достойна публикации хотя бы в специализированном журнале. Вот, например: найти полином степени 23, чьё поле разложения имеет группу Галуа M₂₃. Группа Матьё — спорадическая, одна из двадцати шести странных симметрий, которые не вписываются ни в какие серии. Для всех остальных спорадических групп такие полиномы давно известны, а для M₂₃ — нет, и это последний пробел в исследовании, которое ведут десятилетиями. Или вот задача попроще (на первый взгляд): привести алгоритм, который определяит, можно ли развязать узел за одно движение — то, что топологи называют "unknotting number равный единице". Звучит как упражнение для первокурсника, а на деле — фундаментальный вопрос низкоразмерной топологии, на который до сих пор нет ответа. Если нейросеть решит хоть одну из этих задач, результат сразу пойдёт в рецензируемый журнал — не потому что это достижение нейросетевых технологий, а потому что долгожданный результат. Интересно. Читать далее

    habr.com/ru/companies/bar/arti

    #FrontierMath #Epoch_AI #LLM #бенчмарки #открытые_задачи #GPT5 #Gemini #теория_чисел #research_taste

  20. Когда нейросеть решит то, что не решил никто?

    В середине 2024 года GPT-4 спотыкался на школьных задачах, а к концу 2025-го модели щёлкали олимпиадные как орехи. Полтора года, и мы преодалели дистанцию от «найди икс» до «докажи теорему». Epoch AI решили посмотреть, что будет дальше, и выкатили бенчмарк из задач, которые не решил вообще никто. Четырнадцать задач — не из учебников, не из олимпиад, а из живой математики: каждую формулировал исследователь-практик, каждую пытались решить минимум двое профессионалов, каждая достойна публикации хотя бы в специализированном журнале. Вот, например: найти полином степени 23, чьё поле разложения имеет группу Галуа M₂₃. Группа Матьё — спорадическая, одна из двадцати шести странных симметрий, которые не вписываются ни в какие серии. Для всех остальных спорадических групп такие полиномы давно известны, а для M₂₃ — нет, и это последний пробел в исследовании, которое ведут десятилетиями. Или вот задача попроще (на первый взгляд): привести алгоритм, который определяит, можно ли развязать узел за одно движение — то, что топологи называют "unknotting number равный единице". Звучит как упражнение для первокурсника, а на деле — фундаментальный вопрос низкоразмерной топологии, на который до сих пор нет ответа. Если нейросеть решит хоть одну из этих задач, результат сразу пойдёт в рецензируемый журнал — не потому что это достижение нейросетевых технологий, а потому что долгожданный результат. Интересно. Читать далее

    habr.com/ru/companies/bar/arti

    #FrontierMath #Epoch_AI #LLM #бенчмарки #открытые_задачи #GPT5 #Gemini #теория_чисел #research_taste

  21. Drei Jahre ChatGPT: Wie weit die KI wirklich ist – und wohin sie sich entwickelt
    Am 30. November 2022 ging ChatGPT als unscheinbare „Forschungs­vorschau“ online. Drei Jahre später ist der Dienst für viele zu einem Alltagswerkzeug geworden – mit deutlich gewachsenen Erwartungen.

    apfeltalk.de/magazin/news/drei
    #KI #News #AGI #chatGPT #GPT4 #GPT5 #KIAssistent #KnstlicheIntelligenz #OpenAI #Sprachmodell

  22. [Перевод] Реверс-инжиниринг Codex CLI или как я заставил GPT-5-Codex-Mini нарисовать пеликана

    Команда AI for Devs подготовила перевод статьи Саймона Уиллиссона о том, как он решил поэкспериментировать с новой моделью OpenAI — GPT-5-Codex-Mini. Немного наглости, немного Rust и щепотка инженерного любопытства — и вот уже Codex CLI превращается в инструмент, который напрямую обращается к закрытому API. Получилось ли заставить модель нарисовать пеликана?

    habr.com/ru/articles/964600/

    #GPT5 #Codex #Codex_CLI #OpenAI #реверсинжиниринг #Rust #AI_tools #разработка #API #hack

  23. #OpenAI reports that over a million #ChatGPT users discuss #suicidalthoughts weekly, highlighting the need for improved #mentalhealthsupport. The company claims its latest #GPT5 model responds more appropriately to #mentalhealth issues, with a 65% improvement in desirable responses and 91% compliance with desired behaviours in #suicidalconversations. OpenAI is also implementing new #evaluations and #safeguards to address emotional reliance. techcrunch.com/2025/10/27/open #tech #media #news

  24. [Перевод] Могут ли кодинг-агенты самосовершенствоваться?

    Представьте программиста, который мастерски собирает для себя вспомогательные утилиты, а потом равнодушно отмахивается: «Честно? Мне они не нужны». Именно так повела себя GPT-5 в ходе теста на умение выстраивать собственный набор инструментов для продуктивности. Модель выдала целый арсенал CLI-утилит в духе Unix, но… отказалась ими пользоваться. Почему так случилось и что это говорит о будущем кодинг-агентов — разбираем в статье.

    habr.com/ru/companies/magnus-t

    #искусственный_интеллект #машинное_обучение #самосовершенствование_ИИ #кодингагенты #инструменты_разработчика #GPT5 #claude_opus #ииагенты_для_разработки

  25. GPT-5 – co warto wiedzieć o najnowszej sztucznej inteligencji od OpenAI

    Premiera GPT-5 od OpenAI to znacznie więcej niż tylko prezentacja kolejnego, większego modelu językowego. Wczytałem się w dość techniczną oficjalną informację opublikowaną przez OpenAI (link podaję na końcu, miło mi będzie, gdy przeczytacie co napisałem).

    Zatem czym jest właściwie GPT-5? To nie tylko większy, nowszy model AI. To przede wszystkim demonstracja nowego, inteligentnego podejścia do samej architektury sztucznej inteligencji, gdzie kluczem do sukcesu nie jest już tylko surowa moc, ale wydajność, precyzja i zdolność do dynamicznego zarządzania własnymi zasobami. Analiza techniczna nowości pokazuje, że największe przełomy dokonały się w obszarach, które były dotąd największymi bolączkami AI.

    Nowa architektura hybrydowa – inteligentny dyspozytor w sercu modelu

    Największą innowacją w GPT-5 jest jego hybrydowa, zunifikowana architektura, która w czasie rzeczywistym żongluje dostępnymi zasobami. Zamiast jednego, monolitycznego modelu, który z równą mocą próbuje odpowiedzieć na proste pytanie o pogodę i rozwiązać złożony problem programistyczny, GPT-5 działa jak inteligentny system z trzema kluczowymi elementami:

    • Model podstawowy: zoptymalizowany pod kątem szybkości i wydajności, obsługuje większość prostych i standardowych zapytań.
    • Model głębokiego rozumowania („GPT-5 thinking”): znacznie potężniejszy, ale i bardziej zasobożerny moduł, aktywowany do zadań wymagających zaawansowanej logiki, wieloetapowej analizy czy kreatywności.
    • Router czasu rzeczywistego (real-time router, tak nazywa to rozwiązanie samo OpenAI): to „mózg” całej operacji. Jest to mechanizm, który na bieżąco analizuje zapytanie użytkownika i decyduje, czy do jego obsługi wystarczy szybki model podstawowy, czy też należy zaangażować potężniejszy model „thinking”. Co istotne, router jest nieustannie trenowany na podstawie realnych sygnałów od użytkowników – analizuje m.in. wskaźniki satysfakcji z odpowiedzi, poprawność merytoryczną oraz to, kiedy użytkownicy sami decydują się na przełączenie modelu, co pozwala mu z czasem stawać się coraz bardziej precyzyjnym dyspozytorem.

    Mierzalna wojna z halucynacjami – dane mówią same za siebie

    OpenAI po raz pierwszy przedstawiło tak konkretne dane dotyczące redukcji tzw. halucynacji, czyli generowania przez model fałszywych informacji. Firma przyznaje, że to jeden z kluczowych priorytetów, a postęp w tej dziedzinie jest mierzalny i znaczący. Czym konkretnie chwali się OpenAI?

    Jak się okazuje, w porównaniu do swojego poprzednika, GPT-4o, nowy model GPT-5 (z włączonym wyszukiwaniem w sieci) generuje odpowiedzi, które są o około 45% mniej narażone na zawieranie błędów faktograficznych. Super wynik, ale nie rezygnujemy z czerwonej lampki w głowie. Mniej o 45% to nie kompletna likwidacja halucynacji AI. Trzeba być świadomym, że nawet GPT-5 może w pewnych scenariuszach nagiąć fakty. Innymi słowy, wciąż nie powinniśmy ślepo brać na wiarę jego wyników.

    Bardzo ciekawie wygląda porównanie przy zadaniach wymagających głębokiej analizy. Gdy GPT-5 korzysta z modelu „thinking”, jego odpowiedzi są aż o 80% mniej podatne na błędy faktograficzne w zestawieniu z modelem OpenAI o3. Jednak ponownie zwracam uwagę, 80 procent to nie 100 procent. Być może stuprocentowej pewności nie zyskamy nigdy, bo halucynacje stanowią inherentny mechanizm wbudowany w każdą sieć neuronową, także tą, którą każdy z nas ma pod sklepieniem własnej czaszki.

    Niemniej tak duży skok w precyzji i wiarygodności to efekt nie tylko lepszego wytrenowania, ale właśnie nowej architektury, która pozwala dedykować większą moc obliczeniową do weryfikacji i analizy faktów w złożonych zagadnieniach.

    Nowa filozofia bezpieczeństwa: „bezpieczne uzupełnienia”

    Kolejnym fundamentalnym filarem GPT-5 jest całkowicie nowe podejście do kwestii bezpieczeństwa, które OpenAI nazywa „bezpiecznymi uzupełnieniami” (safe completions). Jego celem jest maksymalizacja użyteczności modelu przy jednoczesnym, bezkompromisowym zachowaniu bezpieczeństwa. W praktyce oznacza to, że GPT-5 jest znacznie bardziej odporny na próby złamania jego zabezpieczeń (tzw. jailbreaking) i wymuszenia generowania treści niebezpiecznych, nieetycznych lub szkodliwych. Model jest teraz znacznie mniej skłonny do kłamania lub celowego zniekształcania informacji, nawet pod presją manipulacyjnych zapytań.

    Zamiast kategorycznej odmowy, która często frustrowała użytkowników, GPT-5 potrafi reagować w bardziej inteligentny sposób. Jeśli bezpośrednia odpowiedź na pytanie mogłaby być szkodliwa, model może odpowiedzieć na nie częściowo lub na wyższym, bardziej ogólnym poziomie. Jest też w stanie wyjaśnić użytkownikowi, dlaczego nie może udzielić wprost odpowiedzi na potencjalnie niebezpieczne zapytanie, a następnie zaoferować bezpieczne i konstruktywne alternatywy. To podejście ma na celu edukowanie użytkowników i kierowanie konwersacji na bezpieczniejsze tory, zamiast nagłego jej ucinania.

    Wydajność i nowe zdolności – mniej znaczy więcej

    Kolejnym technicznym „mięsem” jakie udało mi się odnaleźć w oficjalnej dokumentacji OpenAI jest skok w wydajności nowego modelu. GPT-5 (w trybie „thinking”) realizuje zadania wymagające zaawansowanych zdolności, zużywając przy tym od 50% do 80% mniej tzw. tokenów wyjściowych niż model o3 (czyli ten z serii rozumujących, przypominam, że GPT-4/4.1 nie są modelami typu reasoning (rozumującymi). W praktyce oznacza to, że odpowiedzi są nie tylko generowane szybciej i mniejszym kosztem obliczeniowym, ale są też bardziej zwięzłe i precyzyjne.

    Ta zwiększona efektywność pozwala modelowi lepiej radzić sobie w takich dziedzinach jak rozumowanie wizualne, „agentowe” pisanie kodu (gdzie model samodzielnie planuje, tworzy i debuguje kod) oraz rozwiązywanie problemów naukowych na poziomie akademickim. Zdolność do bardziej skondensowanego, ale trafnego generowania danych otwiera drogę do bardziej skomplikowanych i wiarygodnych zastosowań w biznesie i nauce.

    Hierarchia dostępu – techniczna strategia dla rynku

    Zresztą sam sposób udostępnienia GPT-5 również zdradza techniczną strategię OpenAI. Stworzenie lżejszej wersji „GPT-5 mini” dla darmowych użytkowników po wyczerpaniu limitów to sprytny sposób na zarządzanie ogromnym obciążeniem serwerów przy jednoczesnym zachowaniu dostępności usługi.

    Z kolei zapowiedź GPT-5 Pro dla klientów biznesowych i z sektora edukacji sugeruje istnienie jeszcze potężniejszej, być może wolniejszej, ale i najdokładniejszej wersji modelu, przeznaczonej do najbardziej krytycznych zastosowań profesjonalnych.

    Podsumowując, GPT-5 to nie tylko ewolucja, ale przemyślana rewolucja w architekturze. OpenAI stawia na inteligentne zarządzanie zasobami, mierzalną poprawę jakości i skalowalną wydajność, co w ostatecznym rozrachunku może okazać się znacznie ważniejsze niż sam przyrost liczby parametrów modelu.

    OpenAI ogłasza GPT-5!

    #API #architekturaAI #bezpieczeństwoAI #ChatGPT #GPT5 #GPT5Thinking #halucynacjeAI #LLM #modelJęzykowy #news #OpenAI #routing #sztucznaInteligencja #tokenizacja #uczenieMaszynowe

  26. ChatGPT będzie lepiej wykrywać problemy psychiczne. OpenAI reaguje na niepokojące doniesienia

    OpenAI, tuż przed spodziewaną w tym tygodniu premierą modelu GPT-5, ogłosiła wprowadzenie istotnych aktualizacji do ChatGPT.

    Celem jest poprawa zdolności chatbota do wykrywania, gdy użytkownik znajduje się w kryzysie emocjonalnym lub psychicznym, oraz oferowanie mu odpowiedniego wsparcia. To bezpośrednia reakcja na doniesienia medialne o przypadkach, w których interakcje z AI miały pogłębiać problemy psychiczne u niektórych osób.

    AI w roli terapeuty to zły pomysł. Nowe badanie Stanforda ujawnia szokujące błędy i groźne porady botów

    W ostatnich miesiącach media (również my) opisywały historie osób, u których chatbot miał wzmacniać stany urojeniowe lub prowadzić do niezdrowej zależności emocjonalnej. Samo OpenAI przyznało, że jego model GPT-4o „nie radził sobie z rozpoznawaniem oznak urojeń lub zależności emocjonalnej” w niektórych przypadkach. Firma już w kwietniu wycofywała aktualizację, która czyniła chatbota „zbyt potulnym” i skłonnym do zgadzania się z użytkownikiem nawet w potencjalnie szkodliwych sytuacjach.

    W odpowiedzi na te problemy OpenAI, we współpracy z ekspertami i grupami doradczymi, wprowadza kilka zmian. Po pierwsze, ChatGPT ma skuteczniej rozpoznawać, że użytkownik może potrzebować pomocy i w takich sytuacjach prezentować mu „oparte na dowodach zasoby”, takie jak linki do organizacji oferujących wsparcie psychologiczne.

    Kolejną nowością są przypomnienia o zrobieniu sobie przerwy. Podczas „długich sesji” rozmowy z chatbotem, aplikacja wyświetli powiadomienie z pytaniem w stylu „Rozmawiamy już chwilę – czy to dobry moment na przerwę?”. Podobne funkcje, mające na celu promowanie „zdrowego użytkowania”, wprowadziły już wcześniej platformy takie jak YouTube, Instagram czy TikTok. Ponadto, wkrótce ma pojawić się aktualizacja, która sprawi, że w „sytuacjach wysokiej wagi” – np. przy pytaniach o zerwanie związku – chatbot zamiast udzielać definitywnej odpowiedzi, pomoże użytkownikowi przeanalizować dostępne opcje.

    Aktualizacje te pokazują, że OpenAI, którego chatbot dociera już do blisko 700 milionów użytkowników tygodniowo, coraz poważniej podchodzi do odpowiedzialności za wpływ swojej technologii na zdrowie psychiczne. Jest to próba znalezienia równowagi między tworzeniem coraz bardziej zaawansowanych i „osobistych” modeli AI a zapewnieniem bezpieczeństwa szczególnie wrażliwym użytkownikom.

    #AI #bezpieczeństwoAI #chatbot #ChatGPT #etykaAI #GPT5 #news #OpenAI #sztucznaInteligencja #zdrowiePsychiczne

  27. 🤖 AI
    🔴 OpenAI Unveils o3 & o4-mini Reasoning Models

    🔸 o3 outperforms all models in math, coding & visual tasks; o4-mini balances price & power.
    🔸 First OpenAI models to "think with images" — can analyze blurry PDFs or sketches.
    🔸 Both run Python, browse the web, and will be accessible via APIs & ChatGPT.

    #OpenAI #AI #o3 #o4mini #GPT5 #ReasoningModels

  28. 🚨 Update from ChatGPT

    o3 and o4-mini will launch before GPT-5 in the next couple of weeks.

    Why the change?

    🔹 GPT-5 is way better than expected
    🔹 Integration's trickier than planned
    🔹 Prepping for massive demand

    #AI #GPT5 #OpenAI #ChatGPT #GPT5 #o3 #o4mini

  29. Sam Altman announces #OpenAI will release #o3 and #o4mini 'after all' & #GPT5 in a few months, citing challenges in 'smoothly integrating everything.' 🤖💡 #AI #MachineLearning #TechNews #OpenAIUpdates #FutureOfAI #ArtificialIntelligence