home.social

#interpretable_ai — Public Fediverse posts

Live and recent posts from across the Fediverse tagged #interpretable_ai, aggregated by home.social.

  1. Как «думает» ИИ: гроккаем разреженные автоэнкодеры (SAE)

    В этой статье разберём исследование от компании Anthropic, которое демонстрирует практическую возможность вскрытия «черного ящика» больших языковых моделей для обеспечения их контролируемости и безопасности с помощью разреженных автоэнкодеров (SAE - Sparse AutoEncoders). И в конце, попробуем поуправлять поведением модели - заставим думать, что она Санта Клаус 🎅.

    habr.com/ru/articles/981964/

    #Сезон_ИИ_в_разработке #LLM #interpretable_ml #interpretability #interpretable_AI #искусственный_интеллект #ai_security #Steering #SAE #Sparse_AutoEncoder