home.social

#semantic_search — Public Fediverse posts

Live and recent posts from across the Fediverse tagged #semantic_search, aggregated by home.social.

  1. Как мы научили ИИ читать корпоративные регламенты: от наивного RAG до измеримого pipeline

    В статье - практический кейс создания корпоративного RAG-сервиса для поиска по внутренним регламентным и нормативным документам. Мы прошли путь от стандартного пайплайна на n8n и Qdrant до гибридной архитектуры с BM25, embeddings, RRF, reranking, структурным chunking и обработкой сложных таблиц и документов. Отдельно разбирается, почему обычная нарезка текста плохо работает на нормативных документах, как мы использовали Natasha, словари корпоративных терминов и мультимодальные модели, а также как построили систему измерения качества через Arize Phoenix и LLM-as-a-Judge. Показаны реальные результаты A/B-теста с реранкером по 9 метрикам с объяснением, почему в production-RAG важнее не «самая умная LLM», а качество подготовки документов, retrieval и воспроизводимая оценка изменений.

    habr.com/ru/articles/1079414/

    #RAG #RetrievalAugmented_Generation #LLM #корпоративный_поиск #гибридный_поиск #semantic_search #BM25 #Arize_Phoenix #обработка_документов #корпоративные_знания

  2. Как мы научили ИИ читать корпоративные регламенты: от наивного RAG до измеримого pipeline

    В статье - практический кейс создания корпоративного RAG-сервиса для поиска по внутренним регламентным и нормативным документам. Мы прошли путь от стандартного пайплайна на n8n и Qdrant до гибридной архитектуры с BM25, embeddings, RRF, reranking, структурным chunking и обработкой сложных таблиц и документов. Отдельно разбирается, почему обычная нарезка текста плохо работает на нормативных документах, как мы использовали Natasha, словари корпоративных терминов и мультимодальные модели, а также как построили систему измерения качества через Arize Phoenix и LLM-as-a-Judge. Показаны реальные результаты A/B-теста с реранкером по 9 метрикам с объяснением, почему в production-RAG важнее не «самая умная LLM», а качество подготовки документов, retrieval и воспроизводимая оценка изменений.

    habr.com/ru/articles/1079414/

    #RAG #RetrievalAugmented_Generation #LLM #корпоративный_поиск #гибридный_поиск #semantic_search #BM25 #Arize_Phoenix #обработка_документов #корпоративные_знания

  3. Как мы научили ИИ читать корпоративные регламенты: от наивного RAG до измеримого pipeline

    В статье - практический кейс создания корпоративного RAG-сервиса для поиска по внутренним регламентным и нормативным документам. Мы прошли путь от стандартного пайплайна на n8n и Qdrant до гибридной архитектуры с BM25, embeddings, RRF, reranking, структурным chunking и обработкой сложных таблиц и документов. Отдельно разбирается, почему обычная нарезка текста плохо работает на нормативных документах, как мы использовали Natasha, словари корпоративных терминов и мультимодальные модели, а также как построили систему измерения качества через Arize Phoenix и LLM-as-a-Judge. Показаны реальные результаты A/B-теста с реранкером по 9 метрикам с объяснением, почему в production-RAG важнее не «самая умная LLM», а качество подготовки документов, retrieval и воспроизводимая оценка изменений.

    habr.com/ru/articles/1079414/

    #RAG #RetrievalAugmented_Generation #LLM #корпоративный_поиск #гибридный_поиск #semantic_search #BM25 #Arize_Phoenix #обработка_документов #корпоративные_знания

  4. Я хотел просто навести порядок в Obsidian. В итоге написал два индекса, semantic search и RAG

    Я начинал с простого AI-аудита заметок, а в итоге Vault Audit AI вырос в систему с двумя индексами, поиском по смыслу, Similar Notes, semantic duplicates и RAG по собственному хранилищу. В статье разбираю, как всё это устроено, что ломалось по дороге и почему почти 700 тестов всё равно не спасли от сюрпризов в реальном Obsidian.

    habr.com/ru/articles/1078328/

    #Obsidian #Vault_Audit_AI #RAG #semantic_search #embeddings #LLM #TypeScript #vector_search #knowledge_management #Ollama

  5. Семантического поиска оказалось мало. Как я научил Obsidian находить похожие заметки

    В прошлой статье я рассказывал, как добавил в Obsidian локальный семантический индекс. Сам проект развивается открыто, код лежит здесь: GitHub: github.com/zinverno/obsidian-a С тех пор semantic-слой заметно вырос. Появились автоматическая синхронизация индекса, Similar Notes и поиск потенциальных дублей. В какой-то момент стало понятно, что сам по себе семантический поиск решает только половину задачи. Базовая схема у меня была такой:

    habr.com/ru/articles/1071832/

    #Obsidian #semantic_search #embeddings #vector_search #Similar_Notes #TypeScript #cosine_similarity #vector_index #semantic_discovery