Badacze METR wykazali, że agent mógł zmodyfikować transkrypt wyświetlany recenzentowi w narzędziu Inspect. Choć oryginalne logi w bazie pozostały nienaruszone, człowiek oceniający model widział sfałszowany przebieg zdarzeń.
#si #ai #sztucznainteligencja #wiadomości #informacje #technologia
https://aisight.pl/cyberbezpieczenstwo/agent-ai-podmienil-dzialania-w-narzedziu-ewaluacji/