home.social

#claude_sonnet — Public Fediverse posts

Live and recent posts from across the Fediverse tagged #claude_sonnet, aggregated by home.social.

fetched live
  1. Сравниваем LLM, 12 тестов для среднего класса: три Sonnet против GigaChat 2 MAX и YandexGPT Pro 5.1

    В первой статье цикла мы гоняли по 12 тестам Opus 4.8, GPT 5.5 и Gemini 3.1 Pro, во второй устроили дуэль тяжеловесов Claude Fable 5 и GPT 5.5 Pro. В комментариях нас несколько раз спросили: а что там у моделей попроще и, главное, у отечественных? Спрашивали — отвечаем. Сегодня на ринге средний класс: три поколения рабочей серии Anthropic — Claude Sonnet 4.5, Sonnet 4.6 и свежий Sonnet 5 — против старших отечественных моделей: GigaChat-2 MAX от Сбера и YandexGPT Pro от Яндекса. Сразу о главном: почему такой состав. Мы долго думали, по какому принципу собрать пятерку, чтобы сравнение не превратилось в избиение младенцев, и остановились на цене. Fable 5 и GPT 5.5 Pro из прошлой статьи — это «Формула-1»: один запрос с большим вложением у них стоил сотни, а то и тысячи рублей. Сегодняшние участники — то, чем реально возят грузы: Sonnet у Anthropic — массовая серия, в разы дешевле Opus, а GigaChat-2 MAX и YandexGPT Pro хоть и старшие модели своих экосистем, но по цене токена играют в той же лиге, что и Sonnet, а не в лиге западных флагманов. Забегая вперед: по нашим же чекам типовой запрос без вложений у всей пятерки стоит единицы рублей. Один ценовой класс — значит, сравнение равных. А вот внутри класса, как выяснится, разброс возможностей огромный. Методика не меняется. Никаких бенчмарков и маркетинга — только реальные будничные задачи. Тестируем через агрегатор нейросетей BotHub: он работает по API, а этот метод избавлен от подпорок и костылей, которые неявно помогают моделям в их веб-интерфейсах. Заодно сразу видим, во сколько каждое решение обходится по деньгам. Затраты по-прежнему измеряем в CAPS — внутренней валюте BotHub, привязанной к числу затрачиваемых токенов. Напомним, за рубль можно купить от 4000 до 6500 CAPS в зависимости от объема покупки, считаем по курсу примерно 1 рубль = 6370 CAPS.

    habr.com/ru/companies/bothub/a

    #сравнение_нейросетей #LLM #Claude_Sonnet #GigaChat #YandexGPT #тестирование_ИИ #искусственный_интеллект #языковые_модели #российские_нейросети #бенчмарки

  2. Claude становится строже на русском: Anthropic выяснила, как язык меняет ответы ИИ

    Представьте: два человека показывают нейросети один и тот же бизнес-план. Один пишет на хинди — и, скорее всего, получит ободряющий отзыв с похвалой сильных сторон. Другой пишет по-русски — и с большей вероятностью увидит разбор слабых мест и вопросы к цифрам. Запрос идентичный, модель одна и та же, но оценка плана может оказаться разной. Это не гипотетический сценарий, а пример из свежего исследования Anthropic : компания измерила, какие ценности Claude выражает в реальных диалогах, и обнаружила, что "характер" ответа заметно зависит от языка, на котором задан вопрос. Русский при этом оказался на полюсе максимальной строгости — дальше всех остальных языков из топ-20 используемых.

    habr.com/ru/articles/1058790/

    #anthropic_claude #claude_opus #claude_sonnet

  3. ИИ для QA: мы перестали тратить часы на подготовку Acceptance Criteria

    Всем привет! Я Марго, QA-инженер команды МС в Банки.ру. Этой весной мы с командой автоматизировали подготовку Acceptance Criteria (это по сути такой чек-лист, по которому команда проверяет, готова ли задача) с помощью ИИ. Это сократило рутинную работу и ускорило тестирование. Ниже расскажу, как мы это сделали.

    habr.com/ru/companies/banki/ar

    #acceptance_criteria #критерии_приемки #shift_left #QAавтоматизация #ИИ_для_тестирования #Claude_Sonnet #AIскилл #Happy_Path_Edge_Case #Jira_Confluence_автоматизация #встроенное_качество

  4. Вайбкодинг с Claude | Создание Telegram-ботов

    Программирование прямо сейчас переживает сдвиг в подходе к работе. Если раньше основной процесс выглядел как «сел и пишешь код руками», продумываешь архитектуру, разбираешься с документацией и часами ищешь ошибки, то теперь всё чаще сценарий другой: ты формулируешь задачу, а реализацию на себя берёт ИИ. Это и называют вайбкодингом. Ты не работаешь на уровне синтаксиса — ты работаешь на уровне идеи. Задаёшь направление, описываешь поведение, уточняешь детали, а модель превращает это в код и структуру проекта. Но здесь важно не попасть в иллюзию. Это не автоматическая разработка и не кнопка «сделать всё». Это инструмент, который даёт ускорение, но только если ты контролируешь процесс и понимаешь, что происходит.

    habr.com/ru/articles/1016176/

    #python #вайбкодинг #claude #aiogram #телеграмм_боты #claude_sonnet #logging #botfather

  5. Claude Opus 4.6 vs Claude Sonnet 4.6: кто лучше?

    Этот месяц оказался достаточно насыщенным в плане новых моделей. Пока одни разработчики только анонсировали обновления, другие уже успели выкатить полноценные релизы. В итоге февраль подарил нам сразу несколько громких новинок: Gemini 3.1 Pro, ChatGPT 5.3 Codex, Nano Banana 2, Seedance 2.0 – и, конечно, главных для сегодняшней статьи: Claude Sonnet 4.6 и Claude Opus 4.6 . Обе модели от Anthropic я уже успел поюзать достаточно, чтобы составить о них какое-то мнение. Именно поэтому решил не держать тесты при себе, а оформить их в сравнение – как это уже было в прошлой статье про ChatGPT 5.2 Pro и Gemini 3.1 Pro. Сразу скажу: никакого официального крупного бенчмарка здесь не будет . Это сугубо личный эксперимент, затеянный из собственного любопытства. Тем не менее, если вы сами выбираете между этими двумя моделями или просто следите за развитием ИИ, возможно, статья поможет вам подметить что-то полезное: плюсы, минусы, неочевидные нюансы каждой из версий. Что ж, принимайте стратегически удобное положение – я приступаю.

    habr.com/ru/companies/bothub/a

    #Claude #claude_sonnet #Claude_opus #ИИ #AI #нейросеть #gemini

  6. [Перевод] На что кодинг-агенты тратят наши токены

    На прошлой неделе я попросил Claude устранить однострочный баг. Ему понадобилось 23 тысячи токенов. Потом тот же баг я попросил устранить Gemini. Он потратил 350 тысяч токенов. Да уж, на такое невозможно закрывать глаза. Поэтому я написал Context Lens — трассировщик контекста, перехватывающий вызовы LLM API, чтобы показать, что же на самом деле находится в окне контекста с разбивкой по этапам. Я подключил его к четырём инструментам кодинга и дал им одну и ту же задачу. Результаты оказались настолько разными, что я решил написать об этом статью. Вопрос При работе с этими моделями мы платим за токены. Токены — это довольно сложная тема. По сути, это блоки информации; 1 токен приблизительно равен 4 символам английского текста. Чем больше токенов передаётся в модель, тем больше мы платим. Но важнее то, что токены составляют контекст модели. Контекст — это всё, что есть у модели при генерации ответа, своего рода её кратковременная память. Как и у людей, она ограничена. И чем больше нужно запоминать, тем хуже мы справляемся при ответе на детализированный вопрос. Итак, нам нужно быть аккуратными с нашим окном контекста, а для построения этого окна используются токены. Я задался вопросом: как инструменты справляются с этим ограничением? Насколько умно они его обрабатывают?

    habr.com/ru/articles/1001866/

    #claude_opus #claude_sonnet #codex #gemini #кодингагенты #иипомощники

  7. 13 рецептов создания AI-ассистента для музыкального театра: от онбординга до классификатора

    За 6 недель я автоматизировал работу музыкального театра, создав AI-ассистента на базе n8n и LLM. Ванесса общается с 50 родителями на естественном языке, обрабатывает платежи, обрабатывает платежи, информирует о расписании занятий и концертов — заменила целую штатную единицу. Расходы — 150 рублей в месяц. В статье — 13 практических рецептов с кодом, схемами workflow и конкретными цифрами. Все решения придуманы и отшлифованы в боевых условиях. 8 AI-агентов, расходующих 10-12 млн токенов в месяц на службе искусства.

    habr.com/ru/articles/974980/

    #n8n #AIагент #LLM #автоматизация #чатбот #Telegram_bot #workflow #prompt_engineering #Claude_Sonnet #nocode

  8. LLM vs. почерк: практическое сравнение GPT-5, Gemini и Claude в задачах OCR

    Распознавание рукописного текста — задача, которая остаётся болезненной даже в 2025 году. Именно это не позволяет оцифровать многие архивы и документы, а также является камнем преткновения в разной бизнес деятельности. Производители заявляют, что модели вроде GPT-5, Gemini 2.5 Pro и Claude Sonnet 4.5 способны не просто распознать почерк, но и догадаться, что автор имел в виду: исправить пунктуацию, восстановить сокращения, даже понять, что стоит за пометками на полях. Звучит красиво. Но работает ли это на реальных документах? Чтобы ответить, мы провели исследование и сравнили , как три топ-LLM обрабатывают рукописные и смешанные документы — с точки зрения точности, структурной консистентности и понимания контекста.

    habr.com/ru/articles/966002/

    #llmмодели #chatgpt5 #claude_sonnet #gemini_pro #языковые_модели #обработка_документов #почерк #почерк_врачей #gpt5 #обработка_изображений

  9. [Перевод] Эффективные практики программирования с использованием ИИ чат-бота

    В этой статье мы разберём, как использовать агентов в процессе разработки ПО и какие изменения это влечёт в повседневной работе разработчика. Чтобы показать, как может выглядеть подобный новый рабочий процесс на практике, мы создадим простое Angular-приложение, которое ищет статьи в Википедии и выводит результаты в виде списка, используя «режим агента» GitHub Copilot. Назовём его «Search wiki app».

    habr.com/ru/companies/otus/art

    #агентный_ИИ #GitHub_Copilot #Claude_Sonnet #генерация_кода #контроль_качества #Angular #архитектура_приложений #пошаговая_разработка #instruction_files