home.social

#natural_language_processing — Public Fediverse posts

Live and recent posts from across the Fediverse tagged #natural_language_processing, aggregated by home.social.

fetched live
  1. OWASP LLM10: Unbounded Consumption. Тестируем современные языковые модели на ресурсоёмких промптах

    Большие языковые модели становятся неотъемлемой частью современных информационных систем. Корпоративные помощники, RAG-приложения, AI-агенты, генерация программного кода, автоматизация документооборота – всё чаще именно LLM становятся основным интерфейсом взаимодействия пользователя с данными и сервисами компании. Вместе с ростом популярности меняется и профиль угроз. Если ещё несколько лет назад основной задачей злоумышленника был поиск уязвимости в веб-приложении или API, то сегодня достаточно правильно сформулировать запрос к языковой модели. Причём целью может быть не получение конфиденциальной информации и даже не обход механизмов безопасности. Иногда гораздо выгоднее заставить модель выполнять заведомо ресурсоёмкую задачу, расходуя процессорное время, память и тысячи токенов. Именно этой проблеме посвящена категория LLM10: Unbounded Consumption в рейтинге OWASP Top 10 for LLM Applications . В отличие от классических атак типа Prompt Injection или Data Leakage, здесь злоумышленник воздействует не на логику приложения, а на его вычислительные ресурсы. По сути, речь идёт об адаптации идеи Denial of Service (DoS) к эпохе генеративного искусственного интеллекта. На первый взгляд может показаться, что защититься от подобных атак достаточно просто – например, ограничить длину пользовательского запроса или максимальный размер ответа. Однако на практике современные атаки становятся значительно изощрённее. Они используют особенности работы больших языковых моделей: рекурсивные инструкции, экспоненциальный рост контекста, моделирование множества независимых агентов, комбинаторные задачи и другие приёмы, заставляющие модель выполнять непропорционально большой объём вычислений при внешне вполне безобидном запросе.

    habr.com/ru/articles/1066688/

    #LLM #большие_языковые_модели #информационная_безопасность #пентест #red_teaming #natural_language_processing #jailbreak #джейлбрейк #промпт #атака

  2. Проектирование архитектуры в нотации ArchiMate с использованием ИИ. Часть 2

    Всем привет! Меня зовут Владимир Зуев, я руководитель разработки JAVA-практики в компании Axenix. Сегодня я хочу представить новую часть из цикла статей о нотации ArchiMate. В этой части мы продолжим проектирование системы управления беспилотным грузовым автотранспортом для междугородних перевозок. Мы попытаемся получить ответ на главный вопрос – что же мы хотим получить? Для этого подробно разберем требования к системе, составим перечень прецедентов использования, а также сформируем техническое задание. Для решения всех задач будем использовать ИИ.

    habr.com/ru/companies/axenix/a

    #проектирование_систем #архитектура_приложений #archimate #искусственный_интеллект #genai #анализ_и_проектирование_систем #natural_language_processing #беспилотный_автомобиль #ватс

  3. Проектирование архитектуры в нотации ArchiMate с использованием ИИ. Часть 1

    Всем привет! Меня зовут Владимир Зуев, я руководитель разработки JAVA-практики в компании Axenix. Сегодня я хочу рассказать о нотации ArchiMate, используемой для разработки и моделирования информационных систем. Несмотря на свои уникальные возможности, нотация ArchiMate не получила широкого распространения. Даже среди практикующих архитекторов распространенность нотации не превышает 25%. Отчасти это связано со скудным описанием в официальной документации и отсутствием практических руководств. Я хочу исправить эту ужасную несправедливость и показать сильные стороны ArchiMate, подробно разобрав ее использование на практическом примере, а так же показать как применение ИИ может помочь архитектору.

    habr.com/ru/companies/axenix/a

    #проектирование_систем #архитектура_приложений #archimate #искусственный_интеллект #genai #анализ_и_проектирование_систем #natural_language_processing #беспилотный_автомобиль #ватс

  4. Цифровая копия сотрудника (руководство)

    Как клонировать экспертизу человека, на которого у тебя нет бюджета? Я взял двухчасовой разговор с топовым маркетологом, прогнал транскрипт через промпты, построенные на научных методах извлечения знаний — CogKC, Knowledge Graph, поведенческое клонирование — и получил JSON-файл, который отвечает на вопросы почти как она. Сначала проверил на себе: файл с «душой» выглядел банально, но агент на его основе пугающе точно воспроизводил мою логику решений. Внутри — наука, два эксперимента, этика и готовые промпты.

    habr.com/ru/articles/1026998/

    #Искусственный_интеллект #Машинное_обучение #Natural_Language_Processing #Управление_знаниями #Стартапы #Этика_ИИ

  5. Как решать задачу NER на практике

    Рассказываю, как на практике решать задачу NER. На примере извлечения сущностей из резюме пройдём путь от разметки данных до работающего API. Меньше теории, больше практики. 🔥 Начинаем 🔥

    habr.com/ru/articles/1023552/

    #NER #NLP #bert #natural_language_processing #python #как_решать_задачу_ner

  6. [Перевод] Почему никто не ожидал, что механизм «предсказать следующее слово» не должен был оказаться так успешен (но оказался)

    Привет, Хаброжители! Большие языковые модели по-прежнему просто предсказывают следующее слово. Два года назад одна лишь эта причина казалось достаточной, чтобы их отвергать — ведь именно ею обосновывали их неуклюжий вывод. Но в настоящее время большие языковые модели стали гораздо лучше, и одним лишь масштабированием этого не объяснить.

    habr.com/ru/companies/piter/ar

    #алгоритмы #искусственный_интеллект #машинное_обучение #Natural_language_processing

  7. Способы автоматизации ответов на часто задаваемые вопросы (FAQ)

    Автоматизация ответов на часто задаваемые вопросы (FAQ) - актуальная задача в процессах, где важно быстро и качественно взаимодействовать с клиентами и с аудиторией. Если клиент долго не может найти информацию, долго не получает ответа в чате, то он уходит к другому продавцу. В итоге и продажа теряется, и клиент теряется. Особенно это критично во время проведения активной рекламной кампании, когда количество обращений резко возрастает и очень большая часть не успевает обрабатываться. Что можно сделать, чтобы не терять обращения, продажи и клиентов? Ответ: Автоматизировать ответы на часто задаваемые вопросы (FAQ). Автоматизация ответов на часто задаваемые вопросы (FAQ) - один из распространенных способов применения Искусственного Интеллекта в бизнесе. Раньше клиент был вынужден искать информацию самостоятельно на сайте, в том числе в FAQ‑разделе сайта. Если же вопрос отправлялся оператору, то оператору приходилось самому готовить ответ, опираясь на свой опыт и имеющую документацию. Теперь у клиентов появилась возможность составлять свой вопрос на естественном языке, и система автоматически выдает ответ, основываясь на соответствующей Базе Знаний. В итоге клиенты получают быстрые и точные ответы на типичные вопросы и переходят к оформлению и оплате.

    habr.com/ru/articles/1015142/

    #искусственный_интеллект #управление_продажами #поддержка_пользователей #поддержка_клиентов #автоматизация_поддержки #natural_language_processing #обработка_естественного_языка

  8. Машинный перевод. Как развивалась технология

    Почти десять лет я занимаюсь машинным переводом в Lingvanex - и за это время увидел, как меняются не только модели, но и само понимание языка. В этой статье я прослежу путь от первых философских идей Древней Греции до нейросетей и LLM, которые формируют индустрию сегодня. Разберём ключевые этапы эволюции, прорывные исследования 2024–2026 годов и попробуем понять, куда движется машинный перевод дальше.

    habr.com/ru/articles/1003076/

    #машинный_перевод #machine_translation #artificial_intelligence #llm #llmмодели #технологии #лингвистика #обработка_естественного_языка #nlp #natural_language_processing

  9. Курс Natural Language Processing & LLMs — новый сезон

    новый запуск курса начинается 10 февраля курс включает в себя все базовые технологии от TF-IDF до агентов, про вайб-кодинг тоже поговорим

    habr.com/ru/companies/ru_mts/a

    #анализ_текста #анализ_текстов #искусственный_интеллект #nlp #naturallanguageprocessing #natural_language_processing #natural_language_understanding #llm #агенты #агенты_ии

  10. Топ вопросов с NLP собеседований: трансформеры и внимание до малейших деталей

    Архитектура трансформера и его сердце механизм внимания уже давно стали базой собесов на NLP, LLM и даже CV. В работе трансформеры тоже доминируют. Именно поэтому очень важно до деталей разбираться в том, как они устрены, из каких частей состоят, как работают и где применяются на практике. Разберем архитектуру по слоям с примерами кода и большим количеством картинок и схем.

    habr.com/ru/articles/972178/

    #transformers #attention #llms #natural_language_processing #nlp #нлп #механизм_внимания #трансформеры #глубокое_обучение #машинное_обучение

  11. GigaMemory на AI Journey Contest 2025: итоги

    Приветствуем всех! С вами снова ML-команда RnD для B2C SberAI. Этой осенью в рамках AI Journey Contest 2025 мы представили задачу GigaMemory: global memory for LLM. Её цель — создание автономного модуля долговременной памяти для языковых моделей, способного накапливать и использовать знания о конкретном пользователе, по сути наделяя ИИ способностью «помнить» своего собеседника. Пришло время объявить результаты соревнования и разобрать лучшие решения участников!

    habr.com/ru/companies/sberbank

    #artificial_intelligence #natural_language_processing #большие_языковые_модели #хакатон #соревнование #машинное_обучение #память #gigachat #хакатоны

  12. «Король глядит угрюмо…» — а я считаю звуки. Цифровое сравнение Стивенсона и Маршака

    Стивенсон и Маршак. Схватка поэтических тяжеловесов, которую можно судить с помощью кода Python. Награда - вересковый мед.

    habr.com/ru/articles/972154/

    #python #токенизация #naturallanguageprocessing #natural_language_processing #nlp #поэзия #литература #чтение

  13. Как я Альфе новый навык делал и что из этого вышло

    Привет, Хабр! Время от времени я возвращаюсь к своему pet-проекту голосового ассистента с кодовым именем «Альфа», который разрабатывался как приватный голосовой интерфейс (а-ля «умная колонка») для управления своим «Умным домом». И в этот раз — так сошлись звезды или под влиянием магнитных бурь — мне очень захотелось добавить новый навык. А что из этого вышло, читайте далее.

    habr.com/ru/companies/timeweb/

    #голосовой_ассистент #python #natural_language_processing #timeweb_статьи

  14. GigaMemory: научи ИИ «помнить всё» с AI Journey Contest 2025

    Мы всё чаще делегируем ИИ-ассистентам рабочую рутину и бытовые вопросы. Но во взаимодействии с ними есть существенная проблема: модели не помнят пользователя . Между сессиями теряются имя, контекст работы, желаемые ограничения и предпочтения, значительно влияющие на то, что и как стоит ответить пользователю. В итоге диалог каждый раз начинается «с нуля», а ответы звучат усреднённо. Это снижает эффективность и по доверие: когда ассистент не помнит важное о вас, он превращается в поисковик с красивыми фразами. Мы в команде RnD для B2C SberAI хотим это исправить. Представляем вашему вниманию задачу GigaMemory: global memory for LLM. Мы предлагаем участникам построить долгосрочную персональную память для языковой модели — систему, которая хранит, обновляет и надёжно извлекает знания о конкретном пользователе . Привычки, предпочтения, ограничения и прочие факты о пользователе, которые могут пригодиться в дальнейшем общении. Цель — научить ИИ отвечать не «в среднем по больнице», а исходя из вашего реального контекста: от прошлых задач на работе до семейных дат и спортивных планов.

    habr.com/ru/companies/sberbank

    #artificial_intelligence #natural_language_processing #большие_языковые_модели #хакатон #соревнования #хакатоны #машинное_обучение #память #gigachat

  15. Перевод датасета для оценки эмпатии на русский язык: подход, проблемы, результаты

    Эмпатия играет важную роль в коммуникации между людьми, и в частности, в сервисах психологической помощи. В онлайн-среде, где такая помощь всё чаще оказывается в текстовом формате, появляется много различных сервисов, которые предоставляют психологическую помощь на основе чатботов. Для них способность отвечать эмпатично становится критически важным навыком. В противном случае хорошо если сеанс окажется просто бесполезным и не усугубит имеющиеся проблемы. Успех БЯМ побуждает разработчиков использовать их в качестве основы для таких чатботов. Для оценки их способностей разрабатываются различные бенчмарки, в частности для задач с уклоном в психотерапию. Одним из таких является PsyEval . Однако для автоматической оценки эмпатии в текстах на русском языке размеченных датасетов просто нет. Мы, русскоязычные MLщики, не можем сказать, как сейчас БЯМ справляются с задачами, которые связаны с выявлением эмпатии и генерацией эмпатичных ответов. А ведь эти задачи напрямую влияют на качество инструментов псих-поддержки. Чтобы это хоть как-то исправить, мы приспособили большие языковые модели к переводу датасета с английского на русский язык. В этом посте я расскажу, как мы в команде Пситехлаб переводили датасет EPITOME с помощью больших языковых моделей.

    habr.com/ru/articles/946264/

    #llm #natural_language_processing #machine_learning #artificial_intelligence #перевод_с_английского #пситехлаб #датасет

  16. Создание Системы генерации ответов на истории тикетов поддержки (часть 2)

    Привет, Хабр! Меня зовут Анатолий, занимаюсь автоматизацией бизнес-процессов и применением Искусственного Интеллекта в бизнесе. Кейсовая задача - создать Систему генерации ответов на основе существующей истории тикетов. При этом Система должна работать в закрытом контуре. В этой части переходим к семантическому поиску, контекстному сходству и SentenceTransformer.

    habr.com/ru/articles/945404/

    #искусственный_интеллект #искусственные_нейронные_сети #обработка_естественного_языка #natural_language_processing #поддержка_клиентов #поддержка_пользователей #большие_языковые_модели #автоматизация_бизнеса #aiпоиск #aiразработка

  17. Система генерации ответов на истории тикетов поддержки (часть 1)

    Привет, Хабр! Меня зовут Анатолий, занимаюсь диалоговыми системами, автоматизацией бизнес-процессов, применением Искусственного Интеллекта в бизнесе. Кейсовая задача - создать ассистента оператора службы поддержки, используя существующую историю тикетов.

    habr.com/ru/articles/938858/

    #искусственный_интеллект #python #программирование #искусственные_нейронные_сети #обработка_естественного_языка #поддержка_клиентов #поддержка_пользователей #natural_language_processing #большие_языковые_модели #автоматизация_бизнеса

  18. [Перевод] Путь к LangOps: руководство для начинающих

    Что такое LangOps и зачем он бизнесу - как выстроить языковую инфраструктуру, которая понимает клиентов на любом языке и снижает нагрузку на поддержку. Перевод гайда от CEO LangOps Institute; оригинал был в закрытом сообществе и публикуется с разрешения автора.

    habr.com/ru/articles/940254/

    #перевод #локализация #глобализация #langops #ai #natural_language_processing #localization

  19. Как устроены AI агенты: разбираемся на примере ReAct и Reflection

    Привет, Хабр! 2025 стал годом AI агентов. Мы видим, как их пытаются применить повсюду: от школ до банковского сектора. Но все ли понимают, как они работают? Или разработчики просто используют готовые реализации, как create_react_agent из langchain? В этой статье мы заглянем в устройство этих шаблонов.

    habr.com/ru/articles/933372/

    #python #ai #agents #llmмодели #llm #python3 #искусственный_интеллект #агенты #natural_language_processing

  20. Веб-агенты, которые действительно понимают веб-сайты: как слой восприятия Notte решает проблему DOM

    Фундаментальная проблема веб-агентов заключается не в автоматизации — а в восприятии. Как позволить LLM навигировать и действовать на веб-сайтах, погребённых в слоях HTML?

    habr.com/ru/articles/926432/

    #LLM #llmагент #ai_agent #automation #natural_language_processing

  21. Малоиспользуемые возможности ES: векторный поиск

    Всем привет! Хочу поделиться опытом применения одной из редко используемых, но полезных функций Elasticsearch, которую успешно применили в одном из проектов. Речь пойдет о векторном поиске...

    habr.com/ru/articles/922544/

    #elasticsearch #векторный_поиск #knnsearch #natural_language_processing #embeddings

  22. Что такое NER, зачем он нужен и когда не поможет

    Про NER написано немало, но этот материал носит прикладной характер. Статья будет полезна тем, кто интересуется NLP и ищет разные подходы для решения узкопрофильных задач, требующих извлечения сущностей из текста. Для джунов это возможность пройти весь путь — от разметки данных до обучения собственной кастомной NER-модели, попутно понять типичные сложности и ограничения. Привет, меня зовут Александр Агеев, на протяжении года я занимался NER-моделями для определения сущностей на этикетках продуктов питания. Несмотря на мою любовь к NER, у этой технологии есть свои границы — кейсы, которые она не может решить хорошо, поэтому надо подключать другие инструменты. В статье я дам критерии применимости NER для решения практических задач.

    habr.com/ru/articles/921698/

    #нейросети_python #named_entity_recognition #ner #natural_language_processing #nlp #spacy #примеры_кода #обучение_моделей

  23. Telegram AI Companion: веселый проект на Rust, Telegram и локальном ИИ

    Привет, Хабр! 👋 Недавно я собрал небольшой, но бодрый pet-проект — Telegram AI Companion . Это Telegram-бот, который умеет болтать с вами, используя локальную языковую модель через LocalAI . Без OpenAI, без облаков — всё на своём железе. Цель проекта — не революция в AI, а именно учебное и увлекательное погружение в Rust , асинхронность, Telegram API и локальные LLM-модели. Такой себе “бот-компаньон”, но больше для разработчика, чем пользователя :) Если вам интересно:

    habr.com/ru/articles/920482/

    #rust #telegram_bot #localai #llm #docker #actix #openai #ai #ngrok #natural_language_processing

  24. Поддержка RUTUBE 2.0: как мы научили бота не ломаться на сложных вопросах

    Как у нас в RUTUBE ИИ и служба клиентского сервиса работают сообща, вместе справляются ростом сервиса и мгновенно адаптируются к изменениям — рассказываем в этой статье. Делимся рецептом RAG-системы, которая за первые три месяца эксплуатации уже отвечает почти на 70% запросов пользователей и никогда не врёт про «космических зайцев».

    habr.com/ru/companies/habr_rut

    #rag #ml #ai #natural_language_processing #nlp #ииассистент #rutuberu #поддержка_пользователей #хакатон

  25. Как мы учили Алису видеть мир с помощью мультимодальной нейросети Яндекса

    Недавно пользователям приложения «Алиса» стал доступен Live-режим, который работает на базе мультимодальной нейросети (VLM), созданной в Яндексе. В этом режиме Алиса распознаёт объекты, показанные ей через камеру смартфона, и рассказывает о них пользователю. А ещё раньше наша VLM стала применяться в Поиске по картинкам, Умной камере и Нейроэксперте. Всё это время технология не стояла на месте и продолжала совершенствоваться. Пожалуй, пришло время поделиться опытом. На связи Роман Исаченко из команды компьютерного зрения в Яндексе. Сегодня я расскажу, какой путь наша VLM прошла за полгода. А Дарья @dara-orange Виноградова, которая работает со мной в той же команде, поделится описанием пайплайна зрения в Алисе. Мы опишем весь путь формирования новой модели: от архитектуры и сбора данных до финальных замеров качества и скорости.

    habr.com/ru/companies/yandex/a

    #vlm #natural_language_processing #computer_vision #multimodality #яндекс

  26. Накорми языковую модель документами

    Одна из актуальных задач для компаний в сфере ИИ - это поиск и генерация ответов по внутренней документации. На первый взгляд кажется, что решение простое: скормить документы большой языковой модели (LLM) и получать ответы. На практике же технические решения оказываются далеко не такими эффективными и качественными, как хотелось бы. Сейчас для работы с локальными документами доступны два основных подхода - RAG (Retrieval-Augmented Generation) и дообучение модели (fine-tuning). Оба подхода имеют свои преимущества и ограничения. В статье рассмотрим их как с теоретической, так и с практической точки зрения.

    habr.com/ru/articles/898938/

    #rag #finetuning #huggingface #llmмодели #llm #нейросети #большие_языковые_модели #nlp #искусственный_интеллект #natural_language_processing

  27. Помощник читателя: визуализируем сюжет

    Пишем AI-помощника для анализа художественных произведений. С помощью языковой модели для анализа текста и небольшой обвязки для визуализации полученного структурированного ответа генерируем: - граф связей между героями; - хронологию событий; - карту мест действия.

    habr.com/ru/articles/900870/

    #python #machine_learning #artificial_intelligence #natural_language_processing #литература

  28. RAG: борьба с низким качеством ответов в условия экономии памяти на GPU

    Привет, Хабр! Меня зовут Саприн Семён. Я занимаюсь анализом данных и машинным обучением в компании ПГК Диджитал. Сегодня мы начинаем серию статей, в которой я расскажу о том, как мы с командой разрабатывали ИИ-помощника, а также приведу практические кейсы по улучшению точности ответов с минимальными затратами памяти графических процессоров. Как вы уже могли догадаться, наш ИИ-помощник разработан на основе RAG (Retrieval-Augmented Generation) системы. Хотя принцип работы RAG многим уже знаком и не вызывает того самого «вау», я всё же кратко напомню, как эта система работает, почему она так популярна и почему её ответам можно доверять. В этой статье я расскажу, как мы разрабатывали RAG-систему для юридического отдела нашей компании, с какими вызовами столкнулись и как их преодолевали. Вы узнаете, почему стандартные подходы не всегда работают, и как, погрузившись в специфику данных, мы смогли значительно улучшить качество ответов, сохранив при этом экономию ресурсов GPU.

    habr.com/ru/companies/pgk/arti

    #rag #natural_language_processing #искусственный_интеллект #машинное_обучение #иипомощник #чанки #baseline