#gptoss — Public Fediverse posts
Live and recent posts from across the Fediverse tagged #gptoss, aggregated by home.social.
-
Local LLM Arena #7
Na początku GPT-OSS-20B zrobił na mnie bardzo dobre wrażenie. W benchmarku codingowym zremisował z Qwenem, a przy tym działał około 5 razy szybciej. Dlatego chciałem sprawdzić, jak poradzi sobie nie z krótkimi zadaniami, ale z normalną pracą nad kodem.
Przygotowałem 5 praktycznych zadań, w których model musiał sam znaleźć problem w projekcie, zmienić kod i przejść testy.
Wynik końcowy: 0/5.
Sprawdziłem to jeszcze osobnym audytem, bo po wcześniejszych problemach z samym środowiskiem nie chciałem niesprawiedliwie obwiniać modelu. Tym razem jednak test przebiegł prawidłowo i wynik się potwierdził.
Model może wyglądać bardzo dobrze w benchmarku, a znacznie gorzej radzić sobie wtedy, gdy musi przez dłuższą chwilę samodzielnie pracować nad prawdziwym projektem.
GPT-OSS nadal jest szybki i ciekawy, ale jako lokalny zamiennik narzędzi, których używam do codziennego programowania, na razie mnie nie przekonał.
Kolejnych modeli nie będę już testował. Czekają na mnie następne projekty, więc na razie zostaję przy Codex i Antigravity.
#LocalLLM #LLM #AI #AppleSilicon #MacBookAir #M4 #LMStudio #GPTOSS #Coding #OpenSourceAI -
Local LLM Arena #7
Na początku GPT-OSS-20B zrobił na mnie bardzo dobre wrażenie. W benchmarku codingowym zremisował z Qwenem, a przy tym działał około 5 razy szybciej. Dlatego chciałem sprawdzić, jak poradzi sobie nie z krótkimi zadaniami, ale z normalną pracą nad kodem.
Przygotowałem 5 praktycznych zadań, w których model musiał sam znaleźć problem w projekcie, zmienić kod i przejść testy.
Wynik końcowy: 0/5.
Sprawdziłem to jeszcze osobnym audytem, bo po wcześniejszych problemach z samym środowiskiem nie chciałem niesprawiedliwie obwiniać modelu. Tym razem jednak test przebiegł prawidłowo i wynik się potwierdził.
Model może wyglądać bardzo dobrze w benchmarku, a znacznie gorzej radzić sobie wtedy, gdy musi przez dłuższą chwilę samodzielnie pracować nad prawdziwym projektem.
GPT-OSS nadal jest szybki i ciekawy, ale jako lokalny zamiennik narzędzi, których używam do codziennego programowania, na razie mnie nie przekonał.
Kolejnych modeli nie będę już testował. Czekają na mnie następne projekty, więc na razie zostaję przy Codex i Antigravity.
#LocalLLM #LLM #AI #AppleSilicon #MacBookAir #M4 #LMStudio #GPTOSS #Coding #OpenSourceAI -
Local LLM Arena #7
Na początku GPT-OSS-20B zrobił na mnie bardzo dobre wrażenie. W benchmarku codingowym zremisował z Qwenem, a przy tym działał około 5 razy szybciej. Dlatego chciałem sprawdzić, jak poradzi sobie nie z krótkimi zadaniami, ale z normalną pracą nad kodem.
Przygotowałem 5 praktycznych zadań, w których model musiał sam znaleźć problem w projekcie, zmienić kod i przejść testy.
Wynik końcowy: 0/5.
Sprawdziłem to jeszcze osobnym audytem, bo po wcześniejszych problemach z samym środowiskiem nie chciałem niesprawiedliwie obwiniać modelu. Tym razem jednak test przebiegł prawidłowo i wynik się potwierdził.
Model może wyglądać bardzo dobrze w benchmarku, a znacznie gorzej radzić sobie wtedy, gdy musi przez dłuższą chwilę samodzielnie pracować nad prawdziwym projektem.
GPT-OSS nadal jest szybki i ciekawy, ale jako lokalny zamiennik narzędzi, których używam do codziennego programowania, na razie mnie nie przekonał.
Kolejnych modeli nie będę już testował. Czekają na mnie następne projekty, więc na razie zostaję przy Codex i Antigravity.
#LocalLLM #LLM #AI #AppleSilicon #MacBookAir #M4 #LMStudio #GPTOSS #Coding #OpenSourceAI -
Local LLM Arena #7
Na początku GPT-OSS-20B zrobił na mnie bardzo dobre wrażenie. W benchmarku codingowym zremisował z Qwenem, a przy tym działał około 5 razy szybciej. Dlatego chciałem sprawdzić, jak poradzi sobie nie z krótkimi zadaniami, ale z normalną pracą nad kodem.
Przygotowałem 5 praktycznych zadań, w których model musiał sam znaleźć problem w projekcie, zmienić kod i przejść testy.
Wynik końcowy: 0/5.
Sprawdziłem to jeszcze osobnym audytem, bo po wcześniejszych problemach z samym środowiskiem nie chciałem niesprawiedliwie obwiniać modelu. Tym razem jednak test przebiegł prawidłowo i wynik się potwierdził.
Model może wyglądać bardzo dobrze w benchmarku, a znacznie gorzej radzić sobie wtedy, gdy musi przez dłuższą chwilę samodzielnie pracować nad prawdziwym projektem.
GPT-OSS nadal jest szybki i ciekawy, ale jako lokalny zamiennik narzędzi, których używam do codziennego programowania, na razie mnie nie przekonał.
Kolejnych modeli nie będę już testował. Czekają na mnie następne projekty, więc na razie zostaję przy Codex i Antigravity.
#LocalLLM #LLM #AI #AppleSilicon #MacBookAir #M4 #LMStudio #GPTOSS #Coding #OpenSourceAI -
Local LLM Arena #7
Na początku GPT-OSS-20B zrobił na mnie bardzo dobre wrażenie. W benchmarku codingowym zremisował z Qwenem, a przy tym działał około 5 razy szybciej. Dlatego chciałem sprawdzić, jak poradzi sobie nie z krótkimi zadaniami, ale z normalną pracą nad kodem.
Przygotowałem 5 praktycznych zadań, w których model musiał sam znaleźć problem w projekcie, zmienić kod i przejść testy.
Wynik końcowy: 0/5.
Sprawdziłem to jeszcze osobnym audytem, bo po wcześniejszych problemach z samym środowiskiem nie chciałem niesprawiedliwie obwiniać modelu. Tym razem jednak test przebiegł prawidłowo i wynik się potwierdził.
Model może wyglądać bardzo dobrze w benchmarku, a znacznie gorzej radzić sobie wtedy, gdy musi przez dłuższą chwilę samodzielnie pracować nad prawdziwym projektem.
GPT-OSS nadal jest szybki i ciekawy, ale jako lokalny zamiennik narzędzi, których używam do codziennego programowania, na razie mnie nie przekonał.
Kolejnych modeli nie będę już testował. Czekają na mnie następne projekty, więc na razie zostaję przy Codex i Antigravity.
#LocalLLM #LLM #AI #AppleSilicon #MacBookAir #M4 #LMStudio #GPTOSS #Coding #OpenSourceAI -
Local LLM Arena #6
Udało mi się już mniej więcej ustalić, co wydarzyło się podczas wczorajszej awarii Maca.
I najważniejsze: problemem nie był sam GPT-OSS.
Problemem był system, który miał go testować.
Kilka procesów uruchamianych podczas testu nie kończyło się prawidłowo. Harness zamiast je przerwać potrafił czekać na nie godzinami, a przy okazji trzymał w pamięci coraz więcej logów i danych z kolejnych etapów.
W pewnym momencie zaczęło się to nakładać.
Pamięci było coraz mniej, macOS zaczął coraz mocniej korzystać z kompresji i swapu, wszystko coraz bardziej zwalniało, aż w końcu komputer praktycznie przestał reagować.
Antigravity doszło wtedy do prawie 48 GB zajętej pamięci na MacBooku z 16 GB RAM.
Po twardym restarcie wszystko wróciło do normy: około 87% wolnej pamięci i 0 MB swapu.
Czyli sprzęt jest OK.
Po prostu sam harness do testowania modeli zrobił się zbyt skomplikowany i w pewnym momencie zaczął być większym problemem niż model, który miał sprawdzać.
Dlatego starego V3 już nie uruchamiam.
Powstała prostsza wersja V4. Każdy zewnętrzny proces ma mieć limit czasu, logi nie mogą rosnąć bez końca, a osobny System Guard ma zatrzymać test, zanim sytuacja z pamięcią wymknie się spod kontroli.
Trial #2 nadal nie został uruchomiony.
Najpierw chcę mieć pewność, że tym razem bezpieczny jest nie tylko model, ale też cały system, który go testuje.
#LocalLLM #LLM #AI #AppleSilicon #MacBookAir #M4 #LMStudio #Codex #GPTOSS #Coding #OpenSourceAI
-
Local LLM Arena #6
Udało mi się już mniej więcej ustalić, co wydarzyło się podczas wczorajszej awarii Maca.
I najważniejsze: problemem nie był sam GPT-OSS.
Problemem był system, który miał go testować.
Kilka procesów uruchamianych podczas testu nie kończyło się prawidłowo. Harness zamiast je przerwać potrafił czekać na nie godzinami, a przy okazji trzymał w pamięci coraz więcej logów i danych z kolejnych etapów.
W pewnym momencie zaczęło się to nakładać.
Pamięci było coraz mniej, macOS zaczął coraz mocniej korzystać z kompresji i swapu, wszystko coraz bardziej zwalniało, aż w końcu komputer praktycznie przestał reagować.
Antigravity doszło wtedy do prawie 48 GB zajętej pamięci na MacBooku z 16 GB RAM.
Po twardym restarcie wszystko wróciło do normy: około 87% wolnej pamięci i 0 MB swapu.
Czyli sprzęt jest OK.
Po prostu sam harness do testowania modeli zrobił się zbyt skomplikowany i w pewnym momencie zaczął być większym problemem niż model, który miał sprawdzać.
Dlatego starego V3 już nie uruchamiam.
Powstała prostsza wersja V4. Każdy zewnętrzny proces ma mieć limit czasu, logi nie mogą rosnąć bez końca, a osobny System Guard ma zatrzymać test, zanim sytuacja z pamięcią wymknie się spod kontroli.
Trial #2 nadal nie został uruchomiony.
Najpierw chcę mieć pewność, że tym razem bezpieczny jest nie tylko model, ale też cały system, który go testuje.
#LocalLLM #LLM #AI #AppleSilicon #MacBookAir #M4 #LMStudio #Codex #GPTOSS #Coding #OpenSourceAI
-
Local LLM Arena #6
Udało mi się już mniej więcej ustalić, co wydarzyło się podczas wczorajszej awarii Maca.
I najważniejsze: problemem nie był sam GPT-OSS.
Problemem był system, który miał go testować.
Kilka procesów uruchamianych podczas testu nie kończyło się prawidłowo. Harness zamiast je przerwać potrafił czekać na nie godzinami, a przy okazji trzymał w pamięci coraz więcej logów i danych z kolejnych etapów.
W pewnym momencie zaczęło się to nakładać.
Pamięci było coraz mniej, macOS zaczął coraz mocniej korzystać z kompresji i swapu, wszystko coraz bardziej zwalniało, aż w końcu komputer praktycznie przestał reagować.
Antigravity doszło wtedy do prawie 48 GB zajętej pamięci na MacBooku z 16 GB RAM.
Po twardym restarcie wszystko wróciło do normy: około 87% wolnej pamięci i 0 MB swapu.
Czyli sprzęt jest OK.
Po prostu sam harness do testowania modeli zrobił się zbyt skomplikowany i w pewnym momencie zaczął być większym problemem niż model, który miał sprawdzać.
Dlatego starego V3 już nie uruchamiam.
Powstała prostsza wersja V4. Każdy zewnętrzny proces ma mieć limit czasu, logi nie mogą rosnąć bez końca, a osobny System Guard ma zatrzymać test, zanim sytuacja z pamięcią wymknie się spod kontroli.
Trial #2 nadal nie został uruchomiony.
Najpierw chcę mieć pewność, że tym razem bezpieczny jest nie tylko model, ale też cały system, który go testuje.
#LocalLLM #LLM #AI #AppleSilicon #MacBookAir #M4 #LMStudio #Codex #GPTOSS #Coding #OpenSourceAI
-
Local LLM Arena #6
Udało mi się już mniej więcej ustalić, co wydarzyło się podczas wczorajszej awarii Maca.
I najważniejsze: problemem nie był sam GPT-OSS.
Problemem był system, który miał go testować.
Kilka procesów uruchamianych podczas testu nie kończyło się prawidłowo. Harness zamiast je przerwać potrafił czekać na nie godzinami, a przy okazji trzymał w pamięci coraz więcej logów i danych z kolejnych etapów.
W pewnym momencie zaczęło się to nakładać.
Pamięci było coraz mniej, macOS zaczął coraz mocniej korzystać z kompresji i swapu, wszystko coraz bardziej zwalniało, aż w końcu komputer praktycznie przestał reagować.
Antigravity doszło wtedy do prawie 48 GB zajętej pamięci na MacBooku z 16 GB RAM.
Po twardym restarcie wszystko wróciło do normy: około 87% wolnej pamięci i 0 MB swapu.
Czyli sprzęt jest OK.
Po prostu sam harness do testowania modeli zrobił się zbyt skomplikowany i w pewnym momencie zaczął być większym problemem niż model, który miał sprawdzać.
Dlatego starego V3 już nie uruchamiam.
Powstała prostsza wersja V4. Każdy zewnętrzny proces ma mieć limit czasu, logi nie mogą rosnąć bez końca, a osobny System Guard ma zatrzymać test, zanim sytuacja z pamięcią wymknie się spod kontroli.
Trial #2 nadal nie został uruchomiony.
Najpierw chcę mieć pewność, że tym razem bezpieczny jest nie tylko model, ale też cały system, który go testuje.
#LocalLLM #LLM #AI #AppleSilicon #MacBookAir #M4 #LMStudio #Codex #GPTOSS #Coding #OpenSourceAI
-
Local LLM Arena #6
Udało mi się już mniej więcej ustalić, co wydarzyło się podczas wczorajszej awarii Maca.
I najważniejsze: problemem nie był sam GPT-OSS.
Problemem był system, który miał go testować.
Kilka procesów uruchamianych podczas testu nie kończyło się prawidłowo. Harness zamiast je przerwać potrafił czekać na nie godzinami, a przy okazji trzymał w pamięci coraz więcej logów i danych z kolejnych etapów.
W pewnym momencie zaczęło się to nakładać.
Pamięci było coraz mniej, macOS zaczął coraz mocniej korzystać z kompresji i swapu, wszystko coraz bardziej zwalniało, aż w końcu komputer praktycznie przestał reagować.
Antigravity doszło wtedy do prawie 48 GB zajętej pamięci na MacBooku z 16 GB RAM.
Po twardym restarcie wszystko wróciło do normy: około 87% wolnej pamięci i 0 MB swapu.
Czyli sprzęt jest OK.
Po prostu sam harness do testowania modeli zrobił się zbyt skomplikowany i w pewnym momencie zaczął być większym problemem niż model, który miał sprawdzać.
Dlatego starego V3 już nie uruchamiam.
Powstała prostsza wersja V4. Każdy zewnętrzny proces ma mieć limit czasu, logi nie mogą rosnąć bez końca, a osobny System Guard ma zatrzymać test, zanim sytuacja z pamięcią wymknie się spod kontroli.
Trial #2 nadal nie został uruchomiony.
Najpierw chcę mieć pewność, że tym razem bezpieczny jest nie tylko model, ale też cały system, który go testuje.
#LocalLLM #LLM #AI #AppleSilicon #MacBookAir #M4 #LMStudio #Codex #GPTOSS #Coding #OpenSourceAI
-
Local LLM Arena #5
Pierwszy prawdziwy test GPT-OSS jako lokalnego agenta programistycznego przyniósł więcej informacji, niż się spodziewałem — tylko niekoniecznie o samym modelu.
Okazało się, że pierwsza wersja testu miała problem z izolacją środowiska Codex CLI. Do kontekstu lokalnego modelu trafiały informacje o wtyczkach i narzędziach, które nie miały nic wspólnego z zadaniem programistycznym.
Dlatego wyniku tego testu nie traktuję jako miarodajnego wyniku GPT-OSS.
Zacząłem więc poprawiać środowisko: czyste sesje, brak chmurowego fallbacku, izolacja hidden testów, kontrola retry, timeouty i dodatkowa diagnostyka.
I tutaj pojawił się kolejny problem.
Sam system testujący zrobił się zbyt skomplikowany.
Kolejne preflighty potrafiły zawieszać procesy na wiele godzin, a podczas ostatniej próby Antigravity doszedł do około 48 GB (?!?!?) zajętej pamięci na MacBooku Air M4 z 16 GB RAM.
System w końcu przestał odpowiadać i potrzebny był twardy restart.
Na szczęście właściwy Trial #2 nigdy nie został uruchomiony, a po restarcie Mac wrócił do normalnego stanu: 0 MB swapu i około 87% wolnej pamięci.
Wniosek jest prosty: nie ma sensu dokładać kolejnych warstw do wadliwego harnessu.
Teraz robię krok wstecz.
Codex ma przeprowadzić audyt całej obecnej infrastruktury i pomóc zaprojektować prostszą wersję V4.
Założenia są już inne:
– każdy proces ma twardy timeout,
– żadnego czekania godzinami,
– test ma własny niezależny System Guard,
– w razie problemów zatrzymywana jest tylko grupa procesów trialu,
– hidden testy są całkowicie poza zasięgiem modelu podczas kodowania,
– iCloud nie jest częścią krytycznej ścieżki,
– Antigravity ma tylko przygotować i uruchomić test, a nie czekać na niego godzinami.Cel się nie zmienił.
Tym razem jednak najpierw trzeba mieć pewność, że sam test nie jest groźniejszy dla Maca niż model, który ma sprawdzać.
#LocalLLM #LLM #AI #AppleSilicon #MacBookAir #M4 #LMStudio #Codex #GPTOSS #Coding #OpenSourceAI