home.social

#sentencetransformers — Public Fediverse posts

Live and recent posts from across the Fediverse tagged #sentencetransformers, aggregated by home.social.

fetched live
  1. От капстоуна к продакшену: fail‑fast, structured logs, Prometheus и Docker‑образ 8.15GB → 1.35GB

    У меня есть RAG‑сервис: проверяет фактологические утверждения в бизнес‑отчётах против реальных источников — SEC EDGAR, World Bank, FRED, Wikipedia. Это капстоун LLM Zoomcamp (DataTalksClub). Курс закончился, оценку поставили (peer review, 42/42), а я решил дотянуть проект до состояния «не стыдно показать на собеседовании как рабочий код», а не просто «закрыл критерии оценки курса».

    habr.com/ru/articles/1071230/

    #docker_image_size #onnx #sentencetransformers #fastapi #prometheus #grafana #structlog #mlops #RAG

  2. Хотел перестать копировать из Wordstat. Получилась мультиагентная система с Ensemble Voting

    Началось с того что мне надоело копировать данные из Wordstat в Excel. Закончилось мультиагентной системой с Ensemble Voting, арбитражным агентом и 5% мусора на выходе. Ни одного из этих слов в моих планах не было.

    habr.com/ru/articles/1015348/

    #SEO #кластеризация_семантики #Python #NLP #LLM #DeepSeek #Яндекс_Директ #SentenceTransformers #семантическое_ядро #автоматизация

  3. Хотел перестать копировать из Wordstat. Получилась мультиагентная система с Ensemble Voting Началось с того что мне на...

    #SEO #кластеризация #семантики #Python #NLP #LLM #DeepSeek #Яндекс #Директ #SentenceTransformers #семантическое

    Origin | Interest | Match
  4. Хотел перестать копировать из Wordstat. Получилась мультиагентная система с Ensemble Voting Ни одного из этих слов в м...

    #deepseek #llm #nlp #python #SentenceTransformers #seo #автоматизация #кластеризация #семантики #семантическое #ядро

    Origin | Interest | Match
  5. Малоресурсный язык ломает коммерческие embedding: R@1 0,83 (LaBSE) vs 0,21 (OpenAI) на армянском EPG

    Платные модели embedding не гарантируют качество на малоресурсных языках. На задаче кроссязыкового сопоставления EPG-заголовков (EN/RU/HY) бесплатная LaBSE набирает R@1 = 0,83, а OpenAI text-embedding-3-large -- 0,21. Протестировано 19 моделей, код и данные открыты.

    habr.com/ru/articles/1008422/

    #embedding #openai #малоресурсный_язык #sentencetransformers #tokenizer #iptv #epg #benchmark #эмбеддинг

  6. Лучший перевод Шекспира с точки зрения математики

    За переводы сонетов Шекспира брались многие мастера и любители. Мне стало интересным провести лексико-семантический анализ нескольких переводов 74 сонета и сравнить их с оригиналом. Я взял авторов, авторитет которых как поэтов и переводчиков вне сомнения Маршака и Пастернака. И двух переводчиков, не известных как поэты - Николая Гербеля и Модеста Чайковского. Я захотел проверить, кто из переводчиков точнее всего передал смысл, ритм и эмоции оригинала, используя алгоритмы машинного обучения.

    habr.com/ru/articles/996614/

    #python #nlp #nlpмодели #nltk_python #проза #поэзия #литература_художественная #sentencetransformers #sbert

  7. Мой локальный агент помнит проект лучше меня. Контекст — 32K токенов. Расскажу, как

    Мой агент на Llama 3.1 8B в третий раз спросил, как меня зовут. Я представился 200 сообщений назад. Контекст переполнился — начало разговора уехало. Большие контексты не спасают: дорого, «Lost in the Middle», локально не влезает. Суммаризация теряет детали. Я сделал по-другому — три типа внешней памяти: Redis для фактов, ChromaDB для семантического поиска, файлы для документов. Контекст маленький, память большая. Внутри — код на Python и грабли, на которые я уже наступил.

    habr.com/ru/articles/994618/

    #LLM #AIагенты #память_LLM #RAG #Redis #ChromaDB #векторный_поиск #sentencetransformers #llama #локальные_модели

  8. I'm happy to share that I'll be speaking at PyCon Italia 2025 🎉

    I'll show you how to implement a semantic search with Python, Django and PostgreSQL 🤖

    See you in Bologna from 29 May 2025 🇮🇹

    Info 👇
    paulox.net/2025/05/29/pycon-it

    CC @pycon

  9. 𝗦𝗲𝗺𝗮𝗻𝘁𝗶𝗰𝗙𝗶𝗻𝗱𝗲𝗿 - A browser-based semantic search engine you can use to query your own texts!

    Demo: geo.rocks/semanticfinder/
    Blog Post: geo.rocks/post/semanticfinder-
    GitHub: github.com/do-me/SemanticFinde

    Built with amazing open-source software: (all-MiniLM-L6-v2), .js, and .

  10. Create a semantic search engine with only a vector database and a light-weight frontend - keep the inference server client-side!

    Tutorial with demo: geo.rocks/post/qdrant-transfor

    Powered by amazing open-source software from , .js and !