home.social

#elasticsearch — Public Fediverse posts

Live and recent posts from across the Fediverse tagged #elasticsearch, aggregated by home.social.

  1. Мы добавили LLM в поиск, но не стали заменять им Elasticsearch. Почему?

    На первый взгляд, поиск в сервисе услуг — это довольно типовая задача. Что там может быть особенного? Под капотом лежит каталог услуг, Elasticsearch, нормализация запросов, ранжирование, кеширование. Ничего такого, чего не было бы в других продуктах. Но это только на первый взгляд. Сейчас расскажу, как устроен поиск в Профи.ру, зачем мы добавили в него LLM и почему языковая модель у нас не заменила классический алгоритм, а стала его дополнительным слоем.

    habr.com/ru/articles/1079574/

    #elasticsearch #llm #ai #search #ai_search

  2. Мы добавили LLM в поиск, но не стали заменять им Elasticsearch. Почему?

    На первый взгляд, поиск в сервисе услуг — это довольно типовая задача. Что там может быть особенного? Под капотом лежит каталог услуг, Elasticsearch, нормализация запросов, ранжирование, кеширование. Ничего такого, чего не было бы в других продуктах. Но это только на первый взгляд. Сейчас расскажу, как устроен поиск в Профи.ру, зачем мы добавили в него LLM и почему языковая модель у нас не заменила классический алгоритм, а стала его дополнительным слоем.

    habr.com/ru/articles/1079574/

    #elasticsearch #llm #ai #search #ai_search

  3. Vietnam-Linked APIS Leak Exposes 220 Million Traveler Records

    A staggering 220 million traveler records, including passenger and crew information, were left vulnerable due to a misconfigured system linked to a Vietnamese organization. This massive data leak, discovered by Kinryū Labs, exposed sensitive information spanning nearly a decade.

    osintsights.com/vietnam-linked

    #Vietnam #Apis #DataLeak #TravelIndustry #Elasticsearch

  4. Elastic: 95% of its 87 CVEs remain unpatched—dangerous for a SIEM staple. Avg CVSS 6.41, max 9.9, but zero KEV exploits so far. Trust Score C. Patch hygiene is your blind spot, not their code. valtersit.com/vendors/elastic/ #cybersecurity #infosec #Elasticsearch

  5. How to Install #Zammad on #AlmaLinux #VPS (10-Minute Quick-Start Guide) This article provides a guide on how to install Zammad on #AlmaLinux VPS.

    If you're looking to run a robust open-source #helpdesk on your AlmaLinux VPS, Zammad is a great pick. It's modern, feature-packed, and supports everything from ticketing to chat and reporting. This guide ...
    Continued 👉 blog.radwebhosting.com/install #selfhosting #letsencrypt #certbot #ticket #elasticsearch #opensource #customersupportplatform #selfhosted

  6. How to Install #Zammad on #AlmaLinux #VPS (10-Minute Quick-Start Guide) This article provides a guide on how to install Zammad on #AlmaLinux VPS.

    If you're looking to run a robust open-source #helpdesk on your AlmaLinux VPS, Zammad is a great pick. It's modern, feature-packed, and supports everything from ticketing to chat and reporting. This guide ...
    Continued 👉 blog.radwebhosting.com/install #selfhosting #letsencrypt #certbot #ticket #elasticsearch #opensource #customersupportplatform #selfhosted

  7. How to Install #Zammad on #AlmaLinux #VPS (10-Minute Quick-Start Guide) This article provides a guide on how to install Zammad on #AlmaLinux VPS.

    If you're looking to run a robust open-source #helpdesk on your AlmaLinux VPS, Zammad is a great pick. It's modern, feature-packed, and supports everything from ticketing to chat and reporting. This guide ...
    Continued 👉 blog.radwebhosting.com/install #selfhosting #letsencrypt #certbot #ticket #elasticsearch #opensource #customersupportplatform #selfhosted

  8. Wenn ich nachsehen möchte, ob im #Formatstring für das Datum das kleine s für Sekunden und das große S für Millisekunden steht, dann frage ich das einen beliebigen #GPTbot (den, der nicht sagt #Quota exceded, weil ich mich nicht per #Api-Key identifiziert habe). Warum?

    In #Wikipedia steht die Antwort möglicherweise. Es dauert aber, herauszufinden, in welchem Artikel, Listenartikel oder Unterartikel. Die #Suche von Wikipedia verwendet zwar #ElasticSearch, aber um die Vorteile von dieser starken Engine auch zu erhalten, hätten 100000e Menschen, die Wikipedia-Artikel auch verschlagworten müssen (#wikidata). Ausserdem kann es sein, dass etwas so praktisches wie formatstrings als #unenzyklpädisch eingestuft wurde und daher entfernt.

    In #Stackexchange muss ich mehrfach bestätigen, dass ich ein Mensch bin, finde dann einen Artikel, der unbeantwortet geschlossen wurde, weil #Duplikat. Dann zwei veraltete, die inzwischen falsch sind, dann welche mit einem nicht mehr funktionierenden link auf die Lösung.

    Bei #archive_org, archive.is und #AnnasArchive muss ich die #URL des gesuchten Artikels wissen, um suchen zu können.

    Eine #Suchmaschine sucht nicht. Eine Suchmaschine liest die "Sutemap.XML" Dateien aus, die websitebetreiber online stellen für die #crawler der Suchmaschinen. Ich finde also fünf Jahre alte Artikel auf Websites die seit fünf Jahren nicht mehr gepflegt werden. Und maximal ein jahr alte Artikel, die meine Frage nicht beantworten aber in der #sitemap stehen. Die 100 Websites, die die richtige Antwort in einem zwei bis vier Jahre alte Artikel enthalten, finde ich nicht, weil diese Artikel nicht mehr in der sitemap stehen.

    Die GPTbots haben Wikipedia, stackexchange, Archiv.org, Annas archive und alle Websites gescrapt und dabei #robots.txt und sitemap ignoriert. Ich bekomme die richtige Antwort und zwar schneller als mit allen zuvor genannten Varianten.

    Oder ich suche in #Grokipedia. Grokipedia besteht aus 1Million statischen seiten im #CDN von #Cloudflare die von wikipedia gescrapt wurden. Die suche ist ein GPTbot und 57mal besser als die suche in wikipedia.

    @malteengeler @awinkler @evawolfangel @bkastl @Raymond @wikipedia