#hnsw — Public Fediverse posts
Live and recent posts from across the Fediverse tagged #hnsw, aggregated by home.social.
-
Строили ANN руками — когда это того стоило, а когда нет
Сразу отвечаю на вопрос, который вы задали бы в первом же комментарии: а почему не pgvector? Короткий ответ: ровно то, что pgvector делает хорошо — генерацию кандидатов (найти top‑k ближайших по косинусу) — мы и советуем отдавать pgvector, если он у вас есть. Свой ANN мы написали, потому что (1) pgvector есть не везде, где должна работать наша память, и (2) самое ценное в нашей задаче — вообще не генерация кандидатов. Про это вся статья, так что давайте по порядку.
https://habr.com/ru/articles/1063914/
#ANN #HNSW #pgvector #векторный_поиск #PostgreSQL #Personalized_PageRank #HippoRAG #память_агента #ИИагенты
-
Как я писал in-memory векторный движок на Go — и в каком месте он обогнал hnswilb
Полгода назад я начал писать in-memory базу с векторным поиском на Go: RESP-протокол, HNSW-индекс, WAL, многопоточность. Рассказываю, что из этого вышло: как я мерил производительность и на каких граблях стоял, что реально ускоряет векторный поиск, а что нет. Все цифры воспроизводимы, код открыт.
https://habr.com/ru/articles/1057136/
#векторные_базы_данных #векторный_поиск #hnsw #golang #go #inmemory #benchmark #квантизация #rag
-
Ускоренное построение KNN-индексов в Manticore
Раньше построение KNN-индекса было самым медленным этапом при сохранении и слиянии чанков в таблицах с векторными атрибутами. Начиная с v27.1.5 , Manticore может задействовать несколько ядер CPU при сохранении чанков, слияниях через OPTIMIZE , авто-оптимизации и ALTER TABLE ... REBUILD KNN . На 16-ядерном Ryzen 9 5950X построение KNN-индекса для 1 миллиона 1536-мерных векторов сократилось с 8 минут до 39 секунд.
-
Faster KNN search in Manticore: 2-pass HNSW, batched distances, and AVX-512
#HackerNews #FasterKNN #Manticore #HNSW #AVX512 #MachineLearning
-
Как мы ускорили KNN-поиск в Manticore: двухпроходный обход HNSW, пакетная обработка и AVX-512
Кратко: Три изменения в HNSW-поиске ускоряют KNN-поиск до 29% при больших k и дают более 20% прироста при параллельной нагрузке. Без изменений API, без перестроения индексов и без новых настроек — просто более быстрый поиск.
https://habr.com/ru/articles/1050922/
#knn #knnsearch #обработка_больших_данных #обработка_больших_массивов_данных #hnsw #vector_search #векторный_поиск #performance #performance_optimization #производительность
-
Алгоритмы векторного поиска: IVF и HNSW
В данной статье я хочу пройтись по двум самым популярным алгоритмам векторного поиска, используемым на практике. Попробуем понять, почему точный поиск не работает в высоких размерностях и почему мы в итоге приходим к приближенному поиску. Заодно мы затронем тему метрик, чтобы понять, как вообще сравнивают эмбеддинги. Рассмотрим вспомогательный и очень простой алгоритм k-means из классического ML’а, лежащий в основе IVF. И наконец, подробно разберем два самых главных алгоритма IVF и HNSW с примерами их реализации на Python’е.
-
Раннее завершение KNN-поиска в Manticore Search
Современные поисковые системы уже не просто сопоставляют ключевые слова. Когда вы ищете «уютный детектив, действие которого происходит в Париже», а получаете результаты вроде «атмосферный детективный роман во Франции», это векторный поиск в действии: документы и запросы превращаются в списки чисел — эмбеддинги, — а поисковый движок находит документы, чьи векторы ближе всего к вектору запроса. Manticore Search поддерживает это из коробки. Внутри используется структура данных HNSW: граф, который соединяет близкие векторы и позволяет быстро находить ближайших соседей без сканирования каждого документа. Благодаря этому векторный поиск по миллионам документов выполняется за миллисекунды.
https://habr.com/ru/articles/1042064/
#knn #knnsearch #векторный_поиск #семантический_поиск #hnsw #embeddings #oversampling #полнотекстовый_поиск
-
[Перевод] Объясняем векторные базы данных на трех уровнях сложности
Из этого материала вы узнаете о том, как работают векторные базы данных, разобравшись с широким диапазоном тем — от основ поиска по сходству, до стратегий индексирования, которые позволяют применять на практике крупномасштабный поиск данных.
-
[Перевод] Agentis Memory — Redis-совместимое хранилище со встроенным векторным поиском и локальными эмбеддингами
В наше время уже никого не удивишь разработкой агентов, очередной оптимизацией, новой моделью или новой инфраструктурой для нейронок. Всё это в порядке вещей. Однако одно дело читать в Twitter «мы написали агента X и он оптимизировал нам процессы на 300000%», и совсем другое — начать копать чуть глубже. Копнёшь — а «агентом» называют скилл с одним промптом. Разработка настоящих агентов — задача не тривиальная. Достаточно посмотреть на утёкшие исходники Claude CLI — это не просто CLI, а целая инфраструктура бизнес-логики вокруг LLM. Я бы сравнил разработку агентов с разработкой типичных бэкенд-компонентов. Аналогия такая: если вы пишете каноничный бэкенд-сервис — вам нужна СУБД. Если Web3-сервис — блокчейн. Но на СУБД или блокчейне происходит в лучшем случае 50% всей логики. Вся магия крутится именно на бэкенде. С агентами то же самое: подключаешь AI SDK, конфигурируешь мыслительное ядро и пишешь вокруг него всю обвязку — мониторинги, AIOps, оркестрацию, memory management. Вот про memory management и пойдёт речь.
https://habr.com/ru/articles/1018784/
#Redis #AI_agents #GraalVM #ONNX #embeddings #HNSW #Java_Vector_API #SIMD #Project_Loom #LLM
-
🎩 Ah, behold the "DuckDB #community extension for prefiltered #HNSW using ACORN-1" — because the alphabet soup of #developer jargon just wasn't dense enough. 🤦♂️ GitHub has unleashed yet another "game-changer" to ensure your code doesn't just run, but performs a high-wire act while juggling flaming chainsaws. 🔥🤹♀️
https://github.com/cigrainger/duckdb-hnsw-acorn #DuckDB #ACORN1 #gamechanger #HackerNews #ngated -
DuckDB community extension for prefiltered HNSW using ACORN-1
https://github.com/cigrainger/duckdb-hnsw-acorn
#HackerNews #DuckDB #HNSW #ACORN #extension #Community #Project #Data #Science
-
Implementing HNSW (Hierarchical Navigable Small World) Vector Search in PHP
https://centamori.com/index.php?slug=hierarchical-navigable-small-world-hnsw-php&lang=en
#HackerNews #HNSW #Vector #Search #PHP #Implementation #HierarchicalNavigableSmallWorld #TechInnovation
-
Как мы сделали альтернативную систему метчинга товаров в X5 Digital: опыт, грабли и результат
Привет, Хабр! Меня всё ещё зовут Данила Федюкин, и я продолжаю быть тимлидом в X5 Digital. Руковожу командой, которая занимается метчингом. В прошлый раз я рассказывал, как мы перешли на собственную систему рекомендаций, а в этот раз о том, как делаем то же самое, но с метчингом товаров. X5 Digital – один из цифровых бизнесов Х5. Мы работаем в режиме Highload с RPS в 7500 и отвечаем за всю онлайн-доставку в более чем 1000 городах и населённых пунктах России. Этот канал постоянно растёт. В 2024 году покупатели Х5 совершили свыше 119,5 млн заказов продуктов на дом. Мы делаем собственную in-house WMS для дарксторов, приложения для сборщиков и курьеров, CRM, каталоги товаров и другие онлайн-продукты, а ещё мобильное приложение для торговых сетей. Всё это, отталкиваясь от разных форматов доставки. В «Перекрёстке» среднее время доставки CTD (Click-to-Delivery — от оформления заказа до его получения клиентом) сократилось до 45 минут, в «Чижике» — до 37 минут, а в «Пятёрочке» порядка 40% заказов доставляются клиентам менее чем за 20 минут.
https://habr.com/ru/companies/X5Tech/articles/977626/
#машинное_обучение #nlp_обработка_текста #матчинг_товаров #рекомендации #векторный_поиск #faiss #hnsw #e5 #bert #onnx
-
Here's a take on #HNSW from the redis guy, antirez https://news.ycombinator.com/item?id=45887466
Seems like DiskANN on #LMDB already does better
-
#DiskANN and #HNSW (Hierarchical Navigable Small World graphs) appear to be trending again. First popped onto my radar 2 years ago, using #LMDB. https://xcancel.com/search?f=tweets&q=%23DiskANN&cursor=DAADDAABCgABGnlm6BXbcfcKAAIY9_luAhchywAIAAIAAAACCAADAAAAAAgABAAAAAAKAAUbmx1GGMAnEAoABhubHUYYv9jwAAA
A lot of the more recent noise seems to be on M$ infrastructure. For those with more money than brains...
-
🚀 So, you've spent a year wrestling with HNSWs and decided to take a break. How groundbreaking! 🤯 Now, instead of yet another intro, we're blessed with a "brain dump" of #advanced #findings, because, of course, the world was just dying for that extra mile of #HNSW wisdom. 🙄
https://antirez.com/news/156 #breakthroughs #tech #innovation #brain #dump #HackerNews #ngated -
[Перевод] Как я построил RAG-систему за вечер с помощью 5 open source-инструментов
Команда Python for Devs подготовила практическое руководство по сборке полноценной RAG-системы из пяти open source-инструментов. MarkItDown, LangChain, ChromaDB, Ollama и Gradio превращают разрозненные документы в умную базу знаний с потоковой генерацией ответов. Всё локально, без облаков и с открытым кодом — попробуйте собрать свой ChatGPT прямо у себя.
-
[Перевод] Автоэмбеддинги: поиск на ИИ без лишней мороки
Мы рады представить новую возможность, которая делает создание приложений с семантическим поиском таким же простым, как написание SQL-запроса: Автоэмбеддинги . Теперь Manticore Search берёт на себя генерацию эмбеддингов — без дополнительных пайплайнов, внешних сервисов и лишней мороки.
https://habr.com/ru/articles/947632/
#векторный_поиск #семантический_поиск #эмбеддинги #embeddings #vector_search #semantic_search #sql_search #knnsearch #hnsw #json_api
-
Векторный поиск в Elasticsearch: dense_vector, HNSW и фильтрация по атрибутам
Привет, Хабр! В современном поиске всё чаще используется поиск «по смыслу» с помощью векторных эмбеддингов. Вместо привычного анализа текста по словам мы представляем документы и запросы в виде многомерных векторов и ищем ближайших соседей по евклидовому или косинусному расстоянию. Это позволяет, например, находить документы, схожие по смыслу, а не только по точному совпадению слов. В Elasticsearch поддержка такого поиска реализована через поле dense_vector и алгоритм HNSW (Hierarchical Navigable Small World) для быстрого приближённого поиска ближайших соседей. В этой статье разберём, как настроить индекс с векторным полем, добавить документы с векторами и выполнять запросы kNN с возможностью фильтрации по дополнительным атрибутам.
https://habr.com/ru/companies/otus/articles/946162/
#elasticsearch #векторный_поиск #семантический_поиск #фильтрация_по_атрибутам #dense_vector #HNSW
-
Vector database that can index 1B vectors in 48M
https://www.vectroid.com/blog/why-and-how-we-built-Vectroid
#ycombinator #architecture #vector_database #hnsw #performance -
HNSW as abstract data structure: video intro to Redis vector sets
https://www.youtube.com/watch?v=kVApsFUeuEA
#HackerNews #HNSW #Redis #vector #sets #video #intro #data #structures
-
Сравниваем быстродействие новой функциональности ClickHouse по поиску ближайших векторов с другими решениями
Всем привет! Меня зовут Диана Бутько, я студентка 3 курса, изучаю информационные системы и программирование. В InfoWatch я пришла на практику, и одной из моих задач стал сравнительный анализ различных методов поиска похожих векторов. Это один из ключевых аспектов машинного обучения и анализа данных, используемых в рекомендательных системах, кластеризации, семантическом поиске и других областях. Но чем больше объем данных, тем важнее становится выбор инструментов: полный перебор векторов требует больших вычислительных ресурсов, а в других алгоритмах порой необходимо балансировать между точностью и скоростью поиска. В этой статье я сравниваю пять методов поиска похожих векторов: — полный перебор по евклидову расстоянию с реализацией в Python; — FAISS с индексами IndexFlatL2 (полный перебор, евклидово расстояние) и IndexIVFFlat (сегментирование по ячейкам, евклидово расстояние); — векторный поиск в ClickHouse с индексом HNSW и метриками расстояния L2Distance (евклидово расстояние) и cosineDistance (косинусное сходство).
-
HNSW index for vector embeddings in approx 500 LOC
https://github.com/dicroce/hnsw
#HackerNews #HNSW #vector #embeddings #machinelearning #GitHub #500LOC