home.social

#macbook-air — Public Fediverse posts

Live and recent posts from across the Fediverse tagged #macbook-air, aggregated by home.social.

fetched live
  1. Local LLM Arena #7
    Na początku GPT-OSS-20B zrobił na mnie bardzo dobre wrażenie. W benchmarku codingowym zremisował z Qwenem, a przy tym działał około 5 razy szybciej. Dlatego chciałem sprawdzić, jak poradzi sobie nie z krótkimi zadaniami, ale z normalną pracą nad kodem.
    Przygotowałem 5 praktycznych zadań, w których model musiał sam znaleźć problem w projekcie, zmienić kod i przejść testy.
    Wynik końcowy: 0/5.
    Sprawdziłem to jeszcze osobnym audytem, bo po wcześniejszych problemach z samym środowiskiem nie chciałem niesprawiedliwie obwiniać modelu. Tym razem jednak test przebiegł prawidłowo i wynik się potwierdził.
    Model może wyglądać bardzo dobrze w benchmarku, a znacznie gorzej radzić sobie wtedy, gdy musi przez dłuższą chwilę samodzielnie pracować nad prawdziwym projektem.
    GPT-OSS nadal jest szybki i ciekawy, ale jako lokalny zamiennik narzędzi, których używam do codziennego programowania, na razie mnie nie przekonał.
    Kolejnych modeli nie będę już testował. Czekają na mnie następne projekty, więc na razie zostaję przy Codex i Antigravity.
    #LocalLLM #LLM #AI #AppleSilicon #MacBookAir #M4 #LMStudio #GPTOSS #Coding #OpenSourceAI

  2. Local LLM Arena #7
    Na początku GPT-OSS-20B zrobił na mnie bardzo dobre wrażenie. W benchmarku codingowym zremisował z Qwenem, a przy tym działał około 5 razy szybciej. Dlatego chciałem sprawdzić, jak poradzi sobie nie z krótkimi zadaniami, ale z normalną pracą nad kodem.
    Przygotowałem 5 praktycznych zadań, w których model musiał sam znaleźć problem w projekcie, zmienić kod i przejść testy.
    Wynik końcowy: 0/5.
    Sprawdziłem to jeszcze osobnym audytem, bo po wcześniejszych problemach z samym środowiskiem nie chciałem niesprawiedliwie obwiniać modelu. Tym razem jednak test przebiegł prawidłowo i wynik się potwierdził.
    Model może wyglądać bardzo dobrze w benchmarku, a znacznie gorzej radzić sobie wtedy, gdy musi przez dłuższą chwilę samodzielnie pracować nad prawdziwym projektem.
    GPT-OSS nadal jest szybki i ciekawy, ale jako lokalny zamiennik narzędzi, których używam do codziennego programowania, na razie mnie nie przekonał.
    Kolejnych modeli nie będę już testował. Czekają na mnie następne projekty, więc na razie zostaję przy Codex i Antigravity.
    #LocalLLM #LLM #AI #AppleSilicon #MacBookAir #M4 #LMStudio #GPTOSS #Coding #OpenSourceAI

  3. Local LLM Arena #7
    Na początku GPT-OSS-20B zrobił na mnie bardzo dobre wrażenie. W benchmarku codingowym zremisował z Qwenem, a przy tym działał około 5 razy szybciej. Dlatego chciałem sprawdzić, jak poradzi sobie nie z krótkimi zadaniami, ale z normalną pracą nad kodem.
    Przygotowałem 5 praktycznych zadań, w których model musiał sam znaleźć problem w projekcie, zmienić kod i przejść testy.
    Wynik końcowy: 0/5.
    Sprawdziłem to jeszcze osobnym audytem, bo po wcześniejszych problemach z samym środowiskiem nie chciałem niesprawiedliwie obwiniać modelu. Tym razem jednak test przebiegł prawidłowo i wynik się potwierdził.
    Model może wyglądać bardzo dobrze w benchmarku, a znacznie gorzej radzić sobie wtedy, gdy musi przez dłuższą chwilę samodzielnie pracować nad prawdziwym projektem.
    GPT-OSS nadal jest szybki i ciekawy, ale jako lokalny zamiennik narzędzi, których używam do codziennego programowania, na razie mnie nie przekonał.
    Kolejnych modeli nie będę już testował. Czekają na mnie następne projekty, więc na razie zostaję przy Codex i Antigravity.
    #LocalLLM #LLM #AI #AppleSilicon #MacBookAir #M4 #LMStudio #GPTOSS #Coding #OpenSourceAI

  4. Local LLM Arena #7
    Na początku GPT-OSS-20B zrobił na mnie bardzo dobre wrażenie. W benchmarku codingowym zremisował z Qwenem, a przy tym działał około 5 razy szybciej. Dlatego chciałem sprawdzić, jak poradzi sobie nie z krótkimi zadaniami, ale z normalną pracą nad kodem.
    Przygotowałem 5 praktycznych zadań, w których model musiał sam znaleźć problem w projekcie, zmienić kod i przejść testy.
    Wynik końcowy: 0/5.
    Sprawdziłem to jeszcze osobnym audytem, bo po wcześniejszych problemach z samym środowiskiem nie chciałem niesprawiedliwie obwiniać modelu. Tym razem jednak test przebiegł prawidłowo i wynik się potwierdził.
    Model może wyglądać bardzo dobrze w benchmarku, a znacznie gorzej radzić sobie wtedy, gdy musi przez dłuższą chwilę samodzielnie pracować nad prawdziwym projektem.
    GPT-OSS nadal jest szybki i ciekawy, ale jako lokalny zamiennik narzędzi, których używam do codziennego programowania, na razie mnie nie przekonał.
    Kolejnych modeli nie będę już testował. Czekają na mnie następne projekty, więc na razie zostaję przy Codex i Antigravity.
    #LocalLLM #LLM #AI #AppleSilicon #MacBookAir #M4 #LMStudio #GPTOSS #Coding #OpenSourceAI

  5. Local LLM Arena #7
    Na początku GPT-OSS-20B zrobił na mnie bardzo dobre wrażenie. W benchmarku codingowym zremisował z Qwenem, a przy tym działał około 5 razy szybciej. Dlatego chciałem sprawdzić, jak poradzi sobie nie z krótkimi zadaniami, ale z normalną pracą nad kodem.
    Przygotowałem 5 praktycznych zadań, w których model musiał sam znaleźć problem w projekcie, zmienić kod i przejść testy.
    Wynik końcowy: 0/5.
    Sprawdziłem to jeszcze osobnym audytem, bo po wcześniejszych problemach z samym środowiskiem nie chciałem niesprawiedliwie obwiniać modelu. Tym razem jednak test przebiegł prawidłowo i wynik się potwierdził.
    Model może wyglądać bardzo dobrze w benchmarku, a znacznie gorzej radzić sobie wtedy, gdy musi przez dłuższą chwilę samodzielnie pracować nad prawdziwym projektem.
    GPT-OSS nadal jest szybki i ciekawy, ale jako lokalny zamiennik narzędzi, których używam do codziennego programowania, na razie mnie nie przekonał.
    Kolejnych modeli nie będę już testował. Czekają na mnie następne projekty, więc na razie zostaję przy Codex i Antigravity.
    #LocalLLM #LLM #AI #AppleSilicon #MacBookAir #M4 #LMStudio #GPTOSS #Coding #OpenSourceAI

  6. Apple aggiorna la lista dei prodotti obsoleti e pensiona tre #Mac Intel, tra cui il #MacBookAir Retina del 2018. Un passo ulteriore verso l'abbandono definitivo dell'architettura Intel a favore di Apple Silicon. kiro.it/rWeTF #Apple #Tecnologia

  7. Apple aggiorna la lista dei prodotti obsoleti e pensiona tre #Mac Intel, tra cui il #MacBookAir Retina del 2018. Un passo ulteriore verso l'abbandono definitivo dell'architettura Intel a favore di Apple Silicon. kiro.it/rWeTF #Apple #Tecnologia

  8. Apple aggiorna la lista dei prodotti obsoleti e pensiona tre #Mac Intel, tra cui il #MacBookAir Retina del 2018. Un passo ulteriore verso l'abbandono definitivo dell'architettura Intel a favore di Apple Silicon. kiro.it/rWeTF #Apple #Tecnologia

  9. Apple aggiorna la lista dei prodotti obsoleti e pensiona tre #Mac Intel, tra cui il #MacBookAir Retina del 2018. Un passo ulteriore verso l'abbandono definitivo dell'architettura Intel a favore di Apple Silicon. kiro.it/rWeTF #Apple #Tecnologia

  10. Apple aggiorna la lista dei prodotti obsoleti e pensiona tre #Mac Intel, tra cui il #MacBookAir Retina del 2018. Un passo ulteriore verso l'abbandono definitivo dell'architettura Intel a favore di Apple Silicon. kiro.it/rWeTF #Apple #Tecnologia

  11. Local LLM Arena #6

    Udało mi się już mniej więcej ustalić, co wydarzyło się podczas wczorajszej awarii Maca.

    I najważniejsze: problemem nie był sam GPT-OSS.

    Problemem był system, który miał go testować.

    Kilka procesów uruchamianych podczas testu nie kończyło się prawidłowo. Harness zamiast je przerwać potrafił czekać na nie godzinami, a przy okazji trzymał w pamięci coraz więcej logów i danych z kolejnych etapów.

    W pewnym momencie zaczęło się to nakładać.

    Pamięci było coraz mniej, macOS zaczął coraz mocniej korzystać z kompresji i swapu, wszystko coraz bardziej zwalniało, aż w końcu komputer praktycznie przestał reagować.

    Antigravity doszło wtedy do prawie 48 GB zajętej pamięci na MacBooku z 16 GB RAM.

    Po twardym restarcie wszystko wróciło do normy: około 87% wolnej pamięci i 0 MB swapu.

    Czyli sprzęt jest OK.

    Po prostu sam harness do testowania modeli zrobił się zbyt skomplikowany i w pewnym momencie zaczął być większym problemem niż model, który miał sprawdzać.

    Dlatego starego V3 już nie uruchamiam.

    Powstała prostsza wersja V4. Każdy zewnętrzny proces ma mieć limit czasu, logi nie mogą rosnąć bez końca, a osobny System Guard ma zatrzymać test, zanim sytuacja z pamięcią wymknie się spod kontroli.

    Trial #2 nadal nie został uruchomiony.

    Najpierw chcę mieć pewność, że tym razem bezpieczny jest nie tylko model, ale też cały system, który go testuje.

    #LocalLLM #LLM #AI #AppleSilicon #MacBookAir #M4 #LMStudio #Codex #GPTOSS #Coding #OpenSourceAI

  12. Local LLM Arena #6

    Udało mi się już mniej więcej ustalić, co wydarzyło się podczas wczorajszej awarii Maca.

    I najważniejsze: problemem nie był sam GPT-OSS.

    Problemem był system, który miał go testować.

    Kilka procesów uruchamianych podczas testu nie kończyło się prawidłowo. Harness zamiast je przerwać potrafił czekać na nie godzinami, a przy okazji trzymał w pamięci coraz więcej logów i danych z kolejnych etapów.

    W pewnym momencie zaczęło się to nakładać.

    Pamięci było coraz mniej, macOS zaczął coraz mocniej korzystać z kompresji i swapu, wszystko coraz bardziej zwalniało, aż w końcu komputer praktycznie przestał reagować.

    Antigravity doszło wtedy do prawie 48 GB zajętej pamięci na MacBooku z 16 GB RAM.

    Po twardym restarcie wszystko wróciło do normy: około 87% wolnej pamięci i 0 MB swapu.

    Czyli sprzęt jest OK.

    Po prostu sam harness do testowania modeli zrobił się zbyt skomplikowany i w pewnym momencie zaczął być większym problemem niż model, który miał sprawdzać.

    Dlatego starego V3 już nie uruchamiam.

    Powstała prostsza wersja V4. Każdy zewnętrzny proces ma mieć limit czasu, logi nie mogą rosnąć bez końca, a osobny System Guard ma zatrzymać test, zanim sytuacja z pamięcią wymknie się spod kontroli.

    Trial #2 nadal nie został uruchomiony.

    Najpierw chcę mieć pewność, że tym razem bezpieczny jest nie tylko model, ale też cały system, który go testuje.

    #LocalLLM #LLM #AI #AppleSilicon #MacBookAir #M4 #LMStudio #Codex #GPTOSS #Coding #OpenSourceAI

  13. Local LLM Arena #6

    Udało mi się już mniej więcej ustalić, co wydarzyło się podczas wczorajszej awarii Maca.

    I najważniejsze: problemem nie był sam GPT-OSS.

    Problemem był system, który miał go testować.

    Kilka procesów uruchamianych podczas testu nie kończyło się prawidłowo. Harness zamiast je przerwać potrafił czekać na nie godzinami, a przy okazji trzymał w pamięci coraz więcej logów i danych z kolejnych etapów.

    W pewnym momencie zaczęło się to nakładać.

    Pamięci było coraz mniej, macOS zaczął coraz mocniej korzystać z kompresji i swapu, wszystko coraz bardziej zwalniało, aż w końcu komputer praktycznie przestał reagować.

    Antigravity doszło wtedy do prawie 48 GB zajętej pamięci na MacBooku z 16 GB RAM.

    Po twardym restarcie wszystko wróciło do normy: około 87% wolnej pamięci i 0 MB swapu.

    Czyli sprzęt jest OK.

    Po prostu sam harness do testowania modeli zrobił się zbyt skomplikowany i w pewnym momencie zaczął być większym problemem niż model, który miał sprawdzać.

    Dlatego starego V3 już nie uruchamiam.

    Powstała prostsza wersja V4. Każdy zewnętrzny proces ma mieć limit czasu, logi nie mogą rosnąć bez końca, a osobny System Guard ma zatrzymać test, zanim sytuacja z pamięcią wymknie się spod kontroli.

    Trial #2 nadal nie został uruchomiony.

    Najpierw chcę mieć pewność, że tym razem bezpieczny jest nie tylko model, ale też cały system, który go testuje.

    #LocalLLM #LLM #AI #AppleSilicon #MacBookAir #M4 #LMStudio #Codex #GPTOSS #Coding #OpenSourceAI

  14. Local LLM Arena #6

    Udało mi się już mniej więcej ustalić, co wydarzyło się podczas wczorajszej awarii Maca.

    I najważniejsze: problemem nie był sam GPT-OSS.

    Problemem był system, który miał go testować.

    Kilka procesów uruchamianych podczas testu nie kończyło się prawidłowo. Harness zamiast je przerwać potrafił czekać na nie godzinami, a przy okazji trzymał w pamięci coraz więcej logów i danych z kolejnych etapów.

    W pewnym momencie zaczęło się to nakładać.

    Pamięci było coraz mniej, macOS zaczął coraz mocniej korzystać z kompresji i swapu, wszystko coraz bardziej zwalniało, aż w końcu komputer praktycznie przestał reagować.

    Antigravity doszło wtedy do prawie 48 GB zajętej pamięci na MacBooku z 16 GB RAM.

    Po twardym restarcie wszystko wróciło do normy: około 87% wolnej pamięci i 0 MB swapu.

    Czyli sprzęt jest OK.

    Po prostu sam harness do testowania modeli zrobił się zbyt skomplikowany i w pewnym momencie zaczął być większym problemem niż model, który miał sprawdzać.

    Dlatego starego V3 już nie uruchamiam.

    Powstała prostsza wersja V4. Każdy zewnętrzny proces ma mieć limit czasu, logi nie mogą rosnąć bez końca, a osobny System Guard ma zatrzymać test, zanim sytuacja z pamięcią wymknie się spod kontroli.

    Trial #2 nadal nie został uruchomiony.

    Najpierw chcę mieć pewność, że tym razem bezpieczny jest nie tylko model, ale też cały system, który go testuje.

    #LocalLLM #LLM #AI #AppleSilicon #MacBookAir #M4 #LMStudio #Codex #GPTOSS #Coding #OpenSourceAI

  15. Local LLM Arena #6

    Udało mi się już mniej więcej ustalić, co wydarzyło się podczas wczorajszej awarii Maca.

    I najważniejsze: problemem nie był sam GPT-OSS.

    Problemem był system, który miał go testować.

    Kilka procesów uruchamianych podczas testu nie kończyło się prawidłowo. Harness zamiast je przerwać potrafił czekać na nie godzinami, a przy okazji trzymał w pamięci coraz więcej logów i danych z kolejnych etapów.

    W pewnym momencie zaczęło się to nakładać.

    Pamięci było coraz mniej, macOS zaczął coraz mocniej korzystać z kompresji i swapu, wszystko coraz bardziej zwalniało, aż w końcu komputer praktycznie przestał reagować.

    Antigravity doszło wtedy do prawie 48 GB zajętej pamięci na MacBooku z 16 GB RAM.

    Po twardym restarcie wszystko wróciło do normy: około 87% wolnej pamięci i 0 MB swapu.

    Czyli sprzęt jest OK.

    Po prostu sam harness do testowania modeli zrobił się zbyt skomplikowany i w pewnym momencie zaczął być większym problemem niż model, który miał sprawdzać.

    Dlatego starego V3 już nie uruchamiam.

    Powstała prostsza wersja V4. Każdy zewnętrzny proces ma mieć limit czasu, logi nie mogą rosnąć bez końca, a osobny System Guard ma zatrzymać test, zanim sytuacja z pamięcią wymknie się spod kontroli.

    Trial #2 nadal nie został uruchomiony.

    Najpierw chcę mieć pewność, że tym razem bezpieczny jest nie tylko model, ale też cały system, który go testuje.

    #LocalLLM #LLM #AI #AppleSilicon #MacBookAir #M4 #LMStudio #Codex #GPTOSS #Coding #OpenSourceAI

  16. Promo : le MacBook Air M5 chute à 1 210 €, avec 181 € cagnottés chez Carrefour dlvr.it/TVGKtV #MacBookAir #MacBookM5

  17. Promo : le MacBook Air M5 chute à 1 210 €, avec 181 € cagnottés chez Carrefour dlvr.it/TVGKtV #MacBookAir #MacBookM5

  18. Promo : le MacBook Air M5 chute à 1 210 €, avec 181 € cagnottés chez Carrefour dlvr.it/TVGKtV #MacBookAir #MacBookM5

  19. Promo : le MacBook Air M5 chute à 1 210 €, avec 181 € cagnottés chez Carrefour dlvr.it/TVGKtV #MacBookAir #MacBookM5

  20. Promo : le MacBook Air M5 chute à 1 210 €, avec 181 € cagnottés chez Carrefour dlvr.it/TVGKtV #MacBookAir #MacBookM5

  21. Local LLM Arena #5

    Pierwszy prawdziwy test GPT-OSS jako lokalnego agenta programistycznego przyniósł więcej informacji, niż się spodziewałem — tylko niekoniecznie o samym modelu.

    Okazało się, że pierwsza wersja testu miała problem z izolacją środowiska Codex CLI. Do kontekstu lokalnego modelu trafiały informacje o wtyczkach i narzędziach, które nie miały nic wspólnego z zadaniem programistycznym.

    Dlatego wyniku tego testu nie traktuję jako miarodajnego wyniku GPT-OSS.

    Zacząłem więc poprawiać środowisko: czyste sesje, brak chmurowego fallbacku, izolacja hidden testów, kontrola retry, timeouty i dodatkowa diagnostyka.

    I tutaj pojawił się kolejny problem.

    Sam system testujący zrobił się zbyt skomplikowany.

    Kolejne preflighty potrafiły zawieszać procesy na wiele godzin, a podczas ostatniej próby Antigravity doszedł do około 48 GB (?!?!?) zajętej pamięci na MacBooku Air M4 z 16 GB RAM.

    System w końcu przestał odpowiadać i potrzebny był twardy restart.

    Na szczęście właściwy Trial #2 nigdy nie został uruchomiony, a po restarcie Mac wrócił do normalnego stanu: 0 MB swapu i około 87% wolnej pamięci.

    Wniosek jest prosty: nie ma sensu dokładać kolejnych warstw do wadliwego harnessu.

    Teraz robię krok wstecz.

    Codex ma przeprowadzić audyt całej obecnej infrastruktury i pomóc zaprojektować prostszą wersję V4.

    Założenia są już inne:

    – każdy proces ma twardy timeout,
    – żadnego czekania godzinami,
    – test ma własny niezależny System Guard,
    – w razie problemów zatrzymywana jest tylko grupa procesów trialu,
    – hidden testy są całkowicie poza zasięgiem modelu podczas kodowania,
    – iCloud nie jest częścią krytycznej ścieżki,
    – Antigravity ma tylko przygotować i uruchomić test, a nie czekać na niego godzinami.

    Cel się nie zmienił.

    Tym razem jednak najpierw trzeba mieć pewność, że sam test nie jest groźniejszy dla Maca niż model, który ma sprawdzać.

    #LocalLLM #LLM #AI #AppleSilicon #MacBookAir #M4 #LMStudio #Codex #GPTOSS #Coding #OpenSourceAI

  22. Local LLM Arena #5

    Pierwszy prawdziwy test GPT-OSS jako lokalnego agenta programistycznego przyniósł więcej informacji, niż się spodziewałem — tylko niekoniecznie o samym modelu.

    Okazało się, że pierwsza wersja testu miała problem z izolacją środowiska Codex CLI. Do kontekstu lokalnego modelu trafiały informacje o wtyczkach i narzędziach, które nie miały nic wspólnego z zadaniem programistycznym.

    Dlatego wyniku tego testu nie traktuję jako miarodajnego wyniku GPT-OSS.

    Zacząłem więc poprawiać środowisko: czyste sesje, brak chmurowego fallbacku, izolacja hidden testów, kontrola retry, timeouty i dodatkowa diagnostyka.

    I tutaj pojawił się kolejny problem.

    Sam system testujący zrobił się zbyt skomplikowany.

    Kolejne preflighty potrafiły zawieszać procesy na wiele godzin, a podczas ostatniej próby Antigravity doszedł do około 48 GB (?!?!?) zajętej pamięci na MacBooku Air M4 z 16 GB RAM.

    System w końcu przestał odpowiadać i potrzebny był twardy restart.

    Na szczęście właściwy Trial #2 nigdy nie został uruchomiony, a po restarcie Mac wrócił do normalnego stanu: 0 MB swapu i około 87% wolnej pamięci.

    Wniosek jest prosty: nie ma sensu dokładać kolejnych warstw do wadliwego harnessu.

    Teraz robię krok wstecz.

    Codex ma przeprowadzić audyt całej obecnej infrastruktury i pomóc zaprojektować prostszą wersję V4.

    Założenia są już inne:

    – każdy proces ma twardy timeout,
    – żadnego czekania godzinami,
    – test ma własny niezależny System Guard,
    – w razie problemów zatrzymywana jest tylko grupa procesów trialu,
    – hidden testy są całkowicie poza zasięgiem modelu podczas kodowania,
    – iCloud nie jest częścią krytycznej ścieżki,
    – Antigravity ma tylko przygotować i uruchomić test, a nie czekać na niego godzinami.

    Cel się nie zmienił.

    Tym razem jednak najpierw trzeba mieć pewność, że sam test nie jest groźniejszy dla Maca niż model, który ma sprawdzać.

    #LocalLLM #LLM #AI #AppleSilicon #MacBookAir #M4 #LMStudio #Codex #GPTOSS #Coding #OpenSourceAI

  23. Local LLM Arena #5

    Pierwszy prawdziwy test GPT-OSS jako lokalnego agenta programistycznego przyniósł więcej informacji, niż się spodziewałem — tylko niekoniecznie o samym modelu.

    Okazało się, że pierwsza wersja testu miała problem z izolacją środowiska Codex CLI. Do kontekstu lokalnego modelu trafiały informacje o wtyczkach i narzędziach, które nie miały nic wspólnego z zadaniem programistycznym.

    Dlatego wyniku tego testu nie traktuję jako miarodajnego wyniku GPT-OSS.

    Zacząłem więc poprawiać środowisko: czyste sesje, brak chmurowego fallbacku, izolacja hidden testów, kontrola retry, timeouty i dodatkowa diagnostyka.

    I tutaj pojawił się kolejny problem.

    Sam system testujący zrobił się zbyt skomplikowany.

    Kolejne preflighty potrafiły zawieszać procesy na wiele godzin, a podczas ostatniej próby Antigravity doszedł do około 48 GB (?!?!?) zajętej pamięci na MacBooku Air M4 z 16 GB RAM.

    System w końcu przestał odpowiadać i potrzebny był twardy restart.

    Na szczęście właściwy Trial #2 nigdy nie został uruchomiony, a po restarcie Mac wrócił do normalnego stanu: 0 MB swapu i około 87% wolnej pamięci.

    Wniosek jest prosty: nie ma sensu dokładać kolejnych warstw do wadliwego harnessu.

    Teraz robię krok wstecz.

    Codex ma przeprowadzić audyt całej obecnej infrastruktury i pomóc zaprojektować prostszą wersję V4.

    Założenia są już inne:

    – każdy proces ma twardy timeout,
    – żadnego czekania godzinami,
    – test ma własny niezależny System Guard,
    – w razie problemów zatrzymywana jest tylko grupa procesów trialu,
    – hidden testy są całkowicie poza zasięgiem modelu podczas kodowania,
    – iCloud nie jest częścią krytycznej ścieżki,
    – Antigravity ma tylko przygotować i uruchomić test, a nie czekać na niego godzinami.

    Cel się nie zmienił.

    Tym razem jednak najpierw trzeba mieć pewność, że sam test nie jest groźniejszy dla Maca niż model, który ma sprawdzać.

    #LocalLLM #LLM #AI #AppleSilicon #MacBookAir #M4 #LMStudio #Codex #GPTOSS #Coding #OpenSourceAI

  24. Local LLM Arena #5

    Pierwszy prawdziwy test GPT-OSS jako lokalnego agenta programistycznego przyniósł więcej informacji, niż się spodziewałem — tylko niekoniecznie o samym modelu.

    Okazało się, że pierwsza wersja testu miała problem z izolacją środowiska Codex CLI. Do kontekstu lokalnego modelu trafiały informacje o wtyczkach i narzędziach, które nie miały nic wspólnego z zadaniem programistycznym.

    Dlatego wyniku tego testu nie traktuję jako miarodajnego wyniku GPT-OSS.

    Zacząłem więc poprawiać środowisko: czyste sesje, brak chmurowego fallbacku, izolacja hidden testów, kontrola retry, timeouty i dodatkowa diagnostyka.

    I tutaj pojawił się kolejny problem.

    Sam system testujący zrobił się zbyt skomplikowany.

    Kolejne preflighty potrafiły zawieszać procesy na wiele godzin, a podczas ostatniej próby Antigravity doszedł do około 48 GB (?!?!?) zajętej pamięci na MacBooku Air M4 z 16 GB RAM.

    System w końcu przestał odpowiadać i potrzebny był twardy restart.

    Na szczęście właściwy Trial #2 nigdy nie został uruchomiony, a po restarcie Mac wrócił do normalnego stanu: 0 MB swapu i około 87% wolnej pamięci.

    Wniosek jest prosty: nie ma sensu dokładać kolejnych warstw do wadliwego harnessu.

    Teraz robię krok wstecz.

    Codex ma przeprowadzić audyt całej obecnej infrastruktury i pomóc zaprojektować prostszą wersję V4.

    Założenia są już inne:

    – każdy proces ma twardy timeout,
    – żadnego czekania godzinami,
    – test ma własny niezależny System Guard,
    – w razie problemów zatrzymywana jest tylko grupa procesów trialu,
    – hidden testy są całkowicie poza zasięgiem modelu podczas kodowania,
    – iCloud nie jest częścią krytycznej ścieżki,
    – Antigravity ma tylko przygotować i uruchomić test, a nie czekać na niego godzinami.

    Cel się nie zmienił.

    Tym razem jednak najpierw trzeba mieć pewność, że sam test nie jest groźniejszy dla Maca niż model, który ma sprawdzać.

    #LocalLLM #LLM #AI #AppleSilicon #MacBookAir #M4 #LMStudio #Codex #GPTOSS #Coding #OpenSourceAI

  25. Local LLM Arena #5

    Pierwszy prawdziwy test GPT-OSS jako lokalnego agenta programistycznego przyniósł więcej informacji, niż się spodziewałem — tylko niekoniecznie o samym modelu.

    Okazało się, że pierwsza wersja testu miała problem z izolacją środowiska Codex CLI. Do kontekstu lokalnego modelu trafiały informacje o wtyczkach i narzędziach, które nie miały nic wspólnego z zadaniem programistycznym.

    Dlatego wyniku tego testu nie traktuję jako miarodajnego wyniku GPT-OSS.

    Zacząłem więc poprawiać środowisko: czyste sesje, brak chmurowego fallbacku, izolacja hidden testów, kontrola retry, timeouty i dodatkowa diagnostyka.

    I tutaj pojawił się kolejny problem.

    Sam system testujący zrobił się zbyt skomplikowany.

    Kolejne preflighty potrafiły zawieszać procesy na wiele godzin, a podczas ostatniej próby Antigravity doszedł do około 48 GB (?!?!?) zajętej pamięci na MacBooku Air M4 z 16 GB RAM.

    System w końcu przestał odpowiadać i potrzebny był twardy restart.

    Na szczęście właściwy Trial #2 nigdy nie został uruchomiony, a po restarcie Mac wrócił do normalnego stanu: 0 MB swapu i około 87% wolnej pamięci.

    Wniosek jest prosty: nie ma sensu dokładać kolejnych warstw do wadliwego harnessu.

    Teraz robię krok wstecz.

    Codex ma przeprowadzić audyt całej obecnej infrastruktury i pomóc zaprojektować prostszą wersję V4.

    Założenia są już inne:

    – każdy proces ma twardy timeout,
    – żadnego czekania godzinami,
    – test ma własny niezależny System Guard,
    – w razie problemów zatrzymywana jest tylko grupa procesów trialu,
    – hidden testy są całkowicie poza zasięgiem modelu podczas kodowania,
    – iCloud nie jest częścią krytycznej ścieżki,
    – Antigravity ma tylko przygotować i uruchomić test, a nie czekać na niego godzinami.

    Cel się nie zmienił.

    Tym razem jednak najpierw trzeba mieć pewność, że sam test nie jest groźniejszy dla Maca niż model, który ma sprawdzać.

    #LocalLLM #LLM #AI #AppleSilicon #MacBookAir #M4 #LMStudio #Codex #GPTOSS #Coding #OpenSourceAI

  26. Amazon brade le MacBook Air M5 : -230€ en 1To, -150€ en 512 Go, le bon plan du moment !
    mac4ever.com/197781
    #Mac4Ever #M5 #MacBookAir #Promo

  27. Amazon brade le MacBook Air M5 : -230€ en 1To, -150€ en 512 Go, le bon plan du moment !
    mac4ever.com/197781
    #Mac4Ever #M5 #MacBookAir #Promo

  28. Amazon brade le MacBook Air M5 : -230€ en 1To, -150€ en 512 Go, le bon plan du moment !
    mac4ever.com/197781
    #Mac4Ever #M5 #MacBookAir #Promo

  29. Local LLM Arena #4

    Repair run już się zakończył i po kilku dodatkowych poprawkach udało się domknąć benchmark.

    Po drodze wyszło jeszcze kilka problemów technicznych, więc część testów trzeba było poprawić i uzupełnić. Ostatecznie mamy jednak kompletny zestaw wyników dla wszystkich 5 modeli.

    Najlepiej wypadły dwa modele.

    Qwen3.8-27B wygrał cały benchmark i osiągnął najwyższy wynik jakościowy.

    GPT-OSS-20B był bardzo blisko, a w testach kodowania uzyskał taki sam wynik jak Qwen. Jednocześnie na moim MacBooku Air M4 16 GB działa około 5 razy szybciej.

    Dlatego teraz testuję właśnie GPT-OSS jako lokalnego agenta do prawdziwego kodowania.

    Schemat wygląda tak:

    Codex CLI

    LM Studio

    GPT-OSS-20B

    repozytorium projektu

    Model dostał 5 rzeczywistych zadań w kodzie Local LLM Arena.

    Może sam przeglądać repozytorium, edytować pliki, uruchamiać testy, analizować błędy i poprawiać własne rozwiązania.

    Każde zadanie zaczyna od czystej kopii repozytorium. Po zakończeniu rozwiązanie jest sprawdzane także dodatkowymi testami, których model wcześniej nie widział. Jeśli coś nie przejdzie, dostaje informację o błędzie i może spróbować się poprawić.

    Maksymalnie trzy podejścia na zadanie.

    Całość działa lokalnie na Macu.

    Teraz chcę sprawdzić nie tylko, czy model potrafi wygenerować poprawny kod, ale czy rzeczywiście może wykonywać część pracy lokalnego agenta programistycznego i odciążyć modele działające w chmurze.

    Test właśnie trwa.

    #LocalLLM #LLM #AI #AppleSilicon #MacBookAir #M4 #LMStudio #Codex #GPTOSS #Qwen #Coding #OpenSourceAI

  30. Local LLM Arena #4

    Repair run już się zakończył i po kilku dodatkowych poprawkach udało się domknąć benchmark.

    Po drodze wyszło jeszcze kilka problemów technicznych, więc część testów trzeba było poprawić i uzupełnić. Ostatecznie mamy jednak kompletny zestaw wyników dla wszystkich 5 modeli.

    Najlepiej wypadły dwa modele.

    Qwen3.8-27B wygrał cały benchmark i osiągnął najwyższy wynik jakościowy.

    GPT-OSS-20B był bardzo blisko, a w testach kodowania uzyskał taki sam wynik jak Qwen. Jednocześnie na moim MacBooku Air M4 16 GB działa około 5 razy szybciej.

    Dlatego teraz testuję właśnie GPT-OSS jako lokalnego agenta do prawdziwego kodowania.

    Schemat wygląda tak:

    Codex CLI

    LM Studio

    GPT-OSS-20B

    repozytorium projektu

    Model dostał 5 rzeczywistych zadań w kodzie Local LLM Arena.

    Może sam przeglądać repozytorium, edytować pliki, uruchamiać testy, analizować błędy i poprawiać własne rozwiązania.

    Każde zadanie zaczyna od czystej kopii repozytorium. Po zakończeniu rozwiązanie jest sprawdzane także dodatkowymi testami, których model wcześniej nie widział. Jeśli coś nie przejdzie, dostaje informację o błędzie i może spróbować się poprawić.

    Maksymalnie trzy podejścia na zadanie.

    Całość działa lokalnie na Macu.

    Teraz chcę sprawdzić nie tylko, czy model potrafi wygenerować poprawny kod, ale czy rzeczywiście może wykonywać część pracy lokalnego agenta programistycznego i odciążyć modele działające w chmurze.

    Test właśnie trwa.

    #LocalLLM #LLM #AI #AppleSilicon #MacBookAir #M4 #LMStudio #Codex #GPTOSS #Qwen #Coding #OpenSourceAI

  31. Local LLM Arena #4

    Repair run już się zakończył i po kilku dodatkowych poprawkach udało się domknąć benchmark.

    Po drodze wyszło jeszcze kilka problemów technicznych, więc część testów trzeba było poprawić i uzupełnić. Ostatecznie mamy jednak kompletny zestaw wyników dla wszystkich 5 modeli.

    Najlepiej wypadły dwa modele.

    Qwen3.8-27B wygrał cały benchmark i osiągnął najwyższy wynik jakościowy.

    GPT-OSS-20B był bardzo blisko, a w testach kodowania uzyskał taki sam wynik jak Qwen. Jednocześnie na moim MacBooku Air M4 16 GB działa około 5 razy szybciej.

    Dlatego teraz testuję właśnie GPT-OSS jako lokalnego agenta do prawdziwego kodowania.

    Schemat wygląda tak:

    Codex CLI

    LM Studio

    GPT-OSS-20B

    repozytorium projektu

    Model dostał 5 rzeczywistych zadań w kodzie Local LLM Arena.

    Może sam przeglądać repozytorium, edytować pliki, uruchamiać testy, analizować błędy i poprawiać własne rozwiązania.

    Każde zadanie zaczyna od czystej kopii repozytorium. Po zakończeniu rozwiązanie jest sprawdzane także dodatkowymi testami, których model wcześniej nie widział. Jeśli coś nie przejdzie, dostaje informację o błędzie i może spróbować się poprawić.

    Maksymalnie trzy podejścia na zadanie.

    Całość działa lokalnie na Macu.

    Teraz chcę sprawdzić nie tylko, czy model potrafi wygenerować poprawny kod, ale czy rzeczywiście może wykonywać część pracy lokalnego agenta programistycznego i odciążyć modele działające w chmurze.

    Test właśnie trwa.

    #LocalLLM #LLM #AI #AppleSilicon #MacBookAir #M4 #LMStudio #Codex #GPTOSS #Qwen #Coding #OpenSourceAI

  32. Local LLM Arena #4

    Repair run już się zakończył i po kilku dodatkowych poprawkach udało się domknąć benchmark.

    Po drodze wyszło jeszcze kilka problemów technicznych, więc część testów trzeba było poprawić i uzupełnić. Ostatecznie mamy jednak kompletny zestaw wyników dla wszystkich 5 modeli.

    Najlepiej wypadły dwa modele.

    Qwen3.8-27B wygrał cały benchmark i osiągnął najwyższy wynik jakościowy.

    GPT-OSS-20B był bardzo blisko, a w testach kodowania uzyskał taki sam wynik jak Qwen. Jednocześnie na moim MacBooku Air M4 16 GB działa około 5 razy szybciej.

    Dlatego teraz testuję właśnie GPT-OSS jako lokalnego agenta do prawdziwego kodowania.

    Schemat wygląda tak:

    Codex CLI

    LM Studio

    GPT-OSS-20B

    repozytorium projektu

    Model dostał 5 rzeczywistych zadań w kodzie Local LLM Arena.

    Może sam przeglądać repozytorium, edytować pliki, uruchamiać testy, analizować błędy i poprawiać własne rozwiązania.

    Każde zadanie zaczyna od czystej kopii repozytorium. Po zakończeniu rozwiązanie jest sprawdzane także dodatkowymi testami, których model wcześniej nie widział. Jeśli coś nie przejdzie, dostaje informację o błędzie i może spróbować się poprawić.

    Maksymalnie trzy podejścia na zadanie.

    Całość działa lokalnie na Macu.

    Teraz chcę sprawdzić nie tylko, czy model potrafi wygenerować poprawny kod, ale czy rzeczywiście może wykonywać część pracy lokalnego agenta programistycznego i odciążyć modele działające w chmurze.

    Test właśnie trwa.

    #LocalLLM #LLM #AI #AppleSilicon #MacBookAir #M4 #LMStudio #Codex #GPTOSS #Qwen #Coding #OpenSourceAI

  33. Local LLM Arena #4

    Repair run już się zakończył i po kilku dodatkowych poprawkach udało się domknąć benchmark.

    Po drodze wyszło jeszcze kilka problemów technicznych, więc część testów trzeba było poprawić i uzupełnić. Ostatecznie mamy jednak kompletny zestaw wyników dla wszystkich 5 modeli.

    Najlepiej wypadły dwa modele.

    Qwen3.8-27B wygrał cały benchmark i osiągnął najwyższy wynik jakościowy.

    GPT-OSS-20B był bardzo blisko, a w testach kodowania uzyskał taki sam wynik jak Qwen. Jednocześnie na moim MacBooku Air M4 16 GB działa około 5 razy szybciej.

    Dlatego teraz testuję właśnie GPT-OSS jako lokalnego agenta do prawdziwego kodowania.

    Schemat wygląda tak:

    Codex CLI

    LM Studio

    GPT-OSS-20B

    repozytorium projektu

    Model dostał 5 rzeczywistych zadań w kodzie Local LLM Arena.

    Może sam przeglądać repozytorium, edytować pliki, uruchamiać testy, analizować błędy i poprawiać własne rozwiązania.

    Każde zadanie zaczyna od czystej kopii repozytorium. Po zakończeniu rozwiązanie jest sprawdzane także dodatkowymi testami, których model wcześniej nie widział. Jeśli coś nie przejdzie, dostaje informację o błędzie i może spróbować się poprawić.

    Maksymalnie trzy podejścia na zadanie.

    Całość działa lokalnie na Macu.

    Teraz chcę sprawdzić nie tylko, czy model potrafi wygenerować poprawny kod, ale czy rzeczywiście może wykonywać część pracy lokalnego agenta programistycznego i odciążyć modele działające w chmurze.

    Test właśnie trwa.

    #LocalLLM #LLM #AI #AppleSilicon #MacBookAir #M4 #LMStudio #Codex #GPTOSS #Qwen #Coding #OpenSourceAI

  34. It’s always that one screw that you can’t undo because it’s stripped.

    #apple #macbookair #RightToRepair

  35. It’s always that one screw that you can’t undo because it’s stripped.

  36. It’s always that one screw that you can’t undo because it’s stripped.

    #apple #macbookair #RightToRepair

  37. It’s always that one screw that you can’t undo because it’s stripped.

    #apple #macbookair #RightToRepair

  38. It’s always that one screw that you can’t undo because it’s stripped.

    #apple #macbookair #RightToRepair

  39. Economisez 150€ sur le MacBook Air M5, 230€ sur la version 1To : le bon plan de la rentrée !
    mac4ever.com/197719
    #Mac4Ever #M5 #Mac #MacBookAir #Promo

  40. Economisez 150€ sur le MacBook Air M5, 230€ sur la version 1To : le bon plan de la rentrée !
    mac4ever.com/197719
    #Mac4Ever #M5 #Mac #MacBookAir #Promo

  41. Economisez 150€ sur le MacBook Air M5, 230€ sur la version 1To : le bon plan de la rentrée !
    mac4ever.com/197719
    #Mac4Ever #M5 #Mac #MacBookAir #Promo

  42. Economisez 150€ sur le MacBook Air M5, 230€ sur la version 1To : le bon plan de la rentrée !
    mac4ever.com/197719
    #Mac4Ever #M5 #Mac #MacBookAir #Promo

  43. Economisez 150€ sur le MacBook Air M5, 230€ sur la version 1To : le bon plan de la rentrée !
    mac4ever.com/197719
    #Mac4Ever #M5 #Mac #MacBookAir #Promo

  44. Apple’s $9 polishing cloth is real, useful, and still kind of silly

    The cloth itself hasn’t changed. The price has. And that shift says a lot about how Apple sells even the smallest accessories.

    gadgetbond.com/apple-polishing

  45. Apple’s $9 polishing cloth is real, useful, and still kind of silly

    The cloth itself hasn’t changed. The price has. And that shift says a lot about how Apple sells even the smallest accessories.

    gadgetbond.com/apple-polishing

  46. I'm happy to report that the $0.99 m.2 adapter and AX200NGW Wi-Fi 6 m.2 card on AliExpress WORK on both my 2014 MacBook Air and 2015 MacBook Pro!

    The AX200NGW also works on my other laptops, a HP 14-dq1025cl and a ThinkPad A475.

    Who knew it would take a Wi-Fi 6 card to finally get full Wi-Fi 5 speeds on my network? Time to order some more Wi-Fi cards...

    #WiFi #Linux #MacBookAir #MacBookPro #ArchLinux #GarudaLinux #AliExpress #WiFi6 #omada

  47. I'm happy to report that the $0.99 m.2 adapter and AX200NGW Wi-Fi 6 m.2 card on AliExpress WORK on both my 2014 MacBook Air and 2015 MacBook Pro!

    The AX200NGW also works on my other laptops, a HP 14-dq1025cl and a ThinkPad A475.

    Who knew it would take a Wi-Fi 6 card to finally get full Wi-Fi 5 speeds on my network? Time to order some more Wi-Fi cards...

  48. I'm happy to report that the $0.99 m.2 adapter and AX200NGW Wi-Fi 6 m.2 card on AliExpress WORK on both my 2014 MacBook Air and 2015 MacBook Pro!

    The AX200NGW also works on my other laptops, a HP 14-dq1025cl and a ThinkPad A475.

    Who knew it would take a Wi-Fi 6 card to finally get full Wi-Fi 5 speeds on my network? Time to order some more Wi-Fi cards...

    #WiFi #Linux #MacBookAir #MacBookPro #ArchLinux #GarudaLinux #AliExpress #WiFi6 #omada

  49. I'm happy to report that the $0.99 m.2 adapter and AX200NGW Wi-Fi 6 m.2 card on AliExpress WORK on both my 2014 MacBook Air and 2015 MacBook Pro!

    The AX200NGW also works on my other laptops, a HP 14-dq1025cl and a ThinkPad A475.

    Who knew it would take a Wi-Fi 6 card to finally get full Wi-Fi 5 speeds on my network? Time to order some more Wi-Fi cards...

    #WiFi #Linux #MacBookAir #MacBookPro #ArchLinux #GarudaLinux #AliExpress #WiFi6 #omada