#semantic_search — Public Fediverse posts
Live and recent posts from across the Fediverse tagged #semantic_search, aggregated by home.social.
-
Как мы научили ИИ читать корпоративные регламенты: от наивного RAG до измеримого pipeline
В статье - практический кейс создания корпоративного RAG-сервиса для поиска по внутренним регламентным и нормативным документам. Мы прошли путь от стандартного пайплайна на n8n и Qdrant до гибридной архитектуры с BM25, embeddings, RRF, reranking, структурным chunking и обработкой сложных таблиц и документов. Отдельно разбирается, почему обычная нарезка текста плохо работает на нормативных документах, как мы использовали Natasha, словари корпоративных терминов и мультимодальные модели, а также как построили систему измерения качества через Arize Phoenix и LLM-as-a-Judge. Показаны реальные результаты A/B-теста с реранкером по 9 метрикам с объяснением, почему в production-RAG важнее не «самая умная LLM», а качество подготовки документов, retrieval и воспроизводимая оценка изменений.
https://habr.com/ru/articles/1079414/
#RAG #RetrievalAugmented_Generation #LLM #корпоративный_поиск #гибридный_поиск #semantic_search #BM25 #Arize_Phoenix #обработка_документов #корпоративные_знания
-
Как мы научили ИИ читать корпоративные регламенты: от наивного RAG до измеримого pipeline
В статье - практический кейс создания корпоративного RAG-сервиса для поиска по внутренним регламентным и нормативным документам. Мы прошли путь от стандартного пайплайна на n8n и Qdrant до гибридной архитектуры с BM25, embeddings, RRF, reranking, структурным chunking и обработкой сложных таблиц и документов. Отдельно разбирается, почему обычная нарезка текста плохо работает на нормативных документах, как мы использовали Natasha, словари корпоративных терминов и мультимодальные модели, а также как построили систему измерения качества через Arize Phoenix и LLM-as-a-Judge. Показаны реальные результаты A/B-теста с реранкером по 9 метрикам с объяснением, почему в production-RAG важнее не «самая умная LLM», а качество подготовки документов, retrieval и воспроизводимая оценка изменений.
https://habr.com/ru/articles/1079414/
#RAG #RetrievalAugmented_Generation #LLM #корпоративный_поиск #гибридный_поиск #semantic_search #BM25 #Arize_Phoenix #обработка_документов #корпоративные_знания
-
Как мы научили ИИ читать корпоративные регламенты: от наивного RAG до измеримого pipeline
В статье - практический кейс создания корпоративного RAG-сервиса для поиска по внутренним регламентным и нормативным документам. Мы прошли путь от стандартного пайплайна на n8n и Qdrant до гибридной архитектуры с BM25, embeddings, RRF, reranking, структурным chunking и обработкой сложных таблиц и документов. Отдельно разбирается, почему обычная нарезка текста плохо работает на нормативных документах, как мы использовали Natasha, словари корпоративных терминов и мультимодальные модели, а также как построили систему измерения качества через Arize Phoenix и LLM-as-a-Judge. Показаны реальные результаты A/B-теста с реранкером по 9 метрикам с объяснением, почему в production-RAG важнее не «самая умная LLM», а качество подготовки документов, retrieval и воспроизводимая оценка изменений.
https://habr.com/ru/articles/1079414/
#RAG #RetrievalAugmented_Generation #LLM #корпоративный_поиск #гибридный_поиск #semantic_search #BM25 #Arize_Phoenix #обработка_документов #корпоративные_знания
-
Я хотел просто навести порядок в Obsidian. В итоге написал два индекса, semantic search и RAG
Я начинал с простого AI-аудита заметок, а в итоге Vault Audit AI вырос в систему с двумя индексами, поиском по смыслу, Similar Notes, semantic duplicates и RAG по собственному хранилищу. В статье разбираю, как всё это устроено, что ломалось по дороге и почему почти 700 тестов всё равно не спасли от сюрпризов в реальном Obsidian.
https://habr.com/ru/articles/1078328/
#Obsidian #Vault_Audit_AI #RAG #semantic_search #embeddings #LLM #TypeScript #vector_search #knowledge_management #Ollama
-
Семантического поиска оказалось мало. Как я научил Obsidian находить похожие заметки
В прошлой статье я рассказывал, как добавил в Obsidian локальный семантический индекс. Сам проект развивается открыто, код лежит здесь: GitHub: https://github.com/zinverno/obsidian-ai-hub С тех пор semantic-слой заметно вырос. Появились автоматическая синхронизация индекса, Similar Notes и поиск потенциальных дублей. В какой-то момент стало понятно, что сам по себе семантический поиск решает только половину задачи. Базовая схема у меня была такой:
https://habr.com/ru/articles/1071832/
#Obsidian #semantic_search #embeddings #vector_search #Similar_Notes #TypeScript #cosine_similarity #vector_index #semantic_discovery