home.social

#sentencetransformers — Public Fediverse posts

Live and recent posts from across the Fediverse tagged #sentencetransformers, aggregated by home.social.

fetched live
  1. От капстоуна к продакшену: fail‑fast, structured logs, Prometheus и Docker‑образ 8.15GB → 1.35GB

    У меня есть RAG‑сервис: проверяет фактологические утверждения в бизнес‑отчётах против реальных источников — SEC EDGAR, World Bank, FRED, Wikipedia. Это капстоун LLM Zoomcamp (DataTalksClub). Курс закончился, оценку поставили (peer review, 42/42), а я решил дотянуть проект до состояния «не стыдно показать на собеседовании как рабочий код», а не просто «закрыл критерии оценки курса».

    habr.com/ru/articles/1071230/

    #docker_image_size #onnx #sentencetransformers #fastapi #prometheus #grafana #structlog #mlops #RAG

  2. От капстоуна к продакшену: fail‑fast, structured logs, Prometheus и Docker‑образ 8.15GB → 1.35GB

    У меня есть RAG‑сервис: проверяет фактологические утверждения в бизнес‑отчётах против реальных источников — SEC EDGAR, World Bank, FRED, Wikipedia. Это капстоун LLM Zoomcamp (DataTalksClub). Курс закончился, оценку поставили (peer review, 42/42), а я решил дотянуть проект до состояния «не стыдно показать на собеседовании как рабочий код», а не просто «закрыл критерии оценки курса».

    habr.com/ru/articles/1071230/

    #docker_image_size #onnx #sentencetransformers #fastapi #prometheus #grafana #structlog #mlops #RAG

  3. От капстоуна к продакшену: fail‑fast, structured logs, Prometheus и Docker‑образ 8.15GB → 1.35GB

    У меня есть RAG‑сервис: проверяет фактологические утверждения в бизнес‑отчётах против реальных источников — SEC EDGAR, World Bank, FRED, Wikipedia. Это капстоун LLM Zoomcamp (DataTalksClub). Курс закончился, оценку поставили (peer review, 42/42), а я решил дотянуть проект до состояния «не стыдно показать на собеседовании как рабочий код», а не просто «закрыл критерии оценки курса».

    habr.com/ru/articles/1071230/

    #docker_image_size #onnx #sentencetransformers #fastapi #prometheus #grafana #structlog #mlops #RAG

  4. Хотел перестать копировать из Wordstat. Получилась мультиагентная система с Ensemble Voting

    Началось с того что мне надоело копировать данные из Wordstat в Excel. Закончилось мультиагентной системой с Ensemble Voting, арбитражным агентом и 5% мусора на выходе. Ни одного из этих слов в моих планах не было.

    habr.com/ru/articles/1015348/

    #SEO #кластеризация_семантики #Python #NLP #LLM #DeepSeek #Яндекс_Директ #SentenceTransformers #семантическое_ядро #автоматизация

  5. Хотел перестать копировать из Wordstat. Получилась мультиагентная система с Ensemble Voting

    Началось с того что мне надоело копировать данные из Wordstat в Excel. Закончилось мультиагентной системой с Ensemble Voting, арбитражным агентом и 5% мусора на выходе. Ни одного из этих слов в моих планах не было.

    habr.com/ru/articles/1015348/

    #SEO #кластеризация_семантики #Python #NLP #LLM #DeepSeek #Яндекс_Директ #SentenceTransformers #семантическое_ядро #автоматизация

  6. Хотел перестать копировать из Wordstat. Получилась мультиагентная система с Ensemble Voting

    Началось с того что мне надоело копировать данные из Wordstat в Excel. Закончилось мультиагентной системой с Ensemble Voting, арбитражным агентом и 5% мусора на выходе. Ни одного из этих слов в моих планах не было.

    habr.com/ru/articles/1015348/

    #SEO #кластеризация_семантики #Python #NLP #LLM #DeepSeek #Яндекс_Директ #SentenceTransformers #семантическое_ядро #автоматизация

  7. Хотел перестать копировать из Wordstat. Получилась мультиагентная система с Ensemble Voting Началось с того что мне на...

    #SEO #кластеризация #семантики #Python #NLP #LLM #DeepSeek #Яндекс #Директ #SentenceTransformers #семантическое

    Origin | Interest | Match
  8. Хотел перестать копировать из Wordstat. Получилась мультиагентная система с Ensemble Voting Ни одного из этих слов в м...

    #deepseek #llm #nlp #python #SentenceTransformers #seo #автоматизация #кластеризация #семантики #семантическое #ядро

    Origin | Interest | Match
  9. Малоресурсный язык ломает коммерческие embedding: R@1 0,83 (LaBSE) vs 0,21 (OpenAI) на армянском EPG

    Платные модели embedding не гарантируют качество на малоресурсных языках. На задаче кроссязыкового сопоставления EPG-заголовков (EN/RU/HY) бесплатная LaBSE набирает R@1 = 0,83, а OpenAI text-embedding-3-large -- 0,21. Протестировано 19 моделей, код и данные открыты.

    habr.com/ru/articles/1008422/

    #embedding #openai #малоресурсный_язык #sentencetransformers #tokenizer #iptv #epg #benchmark #эмбеддинг

  10. Малоресурсный язык ломает коммерческие embedding: R@1 0,83 (LaBSE) vs 0,21 (OpenAI) на армянском EPG

    Платные модели embedding не гарантируют качество на малоресурсных языках. На задаче кроссязыкового сопоставления EPG-заголовков (EN/RU/HY) бесплатная LaBSE набирает R@1 = 0,83, а OpenAI text-embedding-3-large -- 0,21. Протестировано 19 моделей, код и данные открыты.

    habr.com/ru/articles/1008422/

    #embedding #openai #малоресурсный_язык #sentencetransformers #tokenizer #iptv #epg #benchmark #эмбеддинг

  11. Малоресурсный язык ломает коммерческие embedding: R@1 0,83 (LaBSE) vs 0,21 (OpenAI) на армянском EPG

    Платные модели embedding не гарантируют качество на малоресурсных языках. На задаче кроссязыкового сопоставления EPG-заголовков (EN/RU/HY) бесплатная LaBSE набирает R@1 = 0,83, а OpenAI text-embedding-3-large -- 0,21. Протестировано 19 моделей, код и данные открыты.

    habr.com/ru/articles/1008422/

    #embedding #openai #малоресурсный_язык #sentencetransformers #tokenizer #iptv #epg #benchmark #эмбеддинг

  12. If you are building an application that requires search, I recommend using Elasticsearch early on. In addition to the usual full-text search, Elasticsearch allows you to perform a hybrid search: combine the results of text and vector search.
    Of course, for small amounts of data, you can use PostgreSQL tsvector with the pgvector extension, but in the long term, Elasticsearch will provide good performance.

    #Elasticsearch #Search #tsvector #pgvector #KNN #Embedding #SentenceTransformers #AI

  13. Лучший перевод Шекспира с точки зрения математики

    За переводы сонетов Шекспира брались многие мастера и любители. Мне стало интересным провести лексико-семантический анализ нескольких переводов 74 сонета и сравнить их с оригиналом. Я взял авторов, авторитет которых как поэтов и переводчиков вне сомнения Маршака и Пастернака. И двух переводчиков, не известных как поэты - Николая Гербеля и Модеста Чайковского. Я захотел проверить, кто из переводчиков точнее всего передал смысл, ритм и эмоции оригинала, используя алгоритмы машинного обучения.

    habr.com/ru/articles/996614/

    #python #nlp #nlpмодели #nltk_python #проза #поэзия #литература_художественная #sentencetransformers #sbert

  14. Лучший перевод Шекспира с точки зрения математики

    За переводы сонетов Шекспира брались многие мастера и любители. Мне стало интересным провести лексико-семантический анализ нескольких переводов 74 сонета и сравнить их с оригиналом. Я взял авторов, авторитет которых как поэтов и переводчиков вне сомнения Маршака и Пастернака. И двух переводчиков, не известных как поэты - Николая Гербеля и Модеста Чайковского. Я захотел проверить, кто из переводчиков точнее всего передал смысл, ритм и эмоции оригинала, используя алгоритмы машинного обучения.

    habr.com/ru/articles/996614/

    #python #nlp #nlpмодели #nltk_python #проза #поэзия #литература_художественная #sentencetransformers #sbert

  15. Лучший перевод Шекспира с точки зрения математики

    За переводы сонетов Шекспира брались многие мастера и любители. Мне стало интересным провести лексико-семантический анализ нескольких переводов 74 сонета и сравнить их с оригиналом. Я взял авторов, авторитет которых как поэтов и переводчиков вне сомнения Маршака и Пастернака. И двух переводчиков, не известных как поэты - Николая Гербеля и Модеста Чайковского. Я захотел проверить, кто из переводчиков точнее всего передал смысл, ритм и эмоции оригинала, используя алгоритмы машинного обучения.

    habr.com/ru/articles/996614/

    #python #nlp #nlpмодели #nltk_python #проза #поэзия #литература_художественная #sentencetransformers #sbert

  16. Мой локальный агент помнит проект лучше меня. Контекст — 32K токенов. Расскажу, как

    Мой агент на Llama 3.1 8B в третий раз спросил, как меня зовут. Я представился 200 сообщений назад. Контекст переполнился — начало разговора уехало. Большие контексты не спасают: дорого, «Lost in the Middle», локально не влезает. Суммаризация теряет детали. Я сделал по-другому — три типа внешней памяти: Redis для фактов, ChromaDB для семантического поиска, файлы для документов. Контекст маленький, память большая. Внутри — код на Python и грабли, на которые я уже наступил.

    habr.com/ru/articles/994618/

    #LLM #AIагенты #память_LLM #RAG #Redis #ChromaDB #векторный_поиск #sentencetransformers #llama #локальные_модели

  17. Мой локальный агент помнит проект лучше меня. Контекст — 32K токенов. Расскажу, как

    Мой агент на Llama 3.1 8B в третий раз спросил, как меня зовут. Я представился 200 сообщений назад. Контекст переполнился — начало разговора уехало. Большие контексты не спасают: дорого, «Lost in the Middle», локально не влезает. Суммаризация теряет детали. Я сделал по-другому — три типа внешней памяти: Redis для фактов, ChromaDB для семантического поиска, файлы для документов. Контекст маленький, память большая. Внутри — код на Python и грабли, на которые я уже наступил.

    habr.com/ru/articles/994618/

    #LLM #AIагенты #память_LLM #RAG #Redis #ChromaDB #векторный_поиск #sentencetransformers #llama #локальные_модели

  18. Мой локальный агент помнит проект лучше меня. Контекст — 32K токенов. Расскажу, как

    Мой агент на Llama 3.1 8B в третий раз спросил, как меня зовут. Я представился 200 сообщений назад. Контекст переполнился — начало разговора уехало. Большие контексты не спасают: дорого, «Lost in the Middle», локально не влезает. Суммаризация теряет детали. Я сделал по-другому — три типа внешней памяти: Redis для фактов, ChromaDB для семантического поиска, файлы для документов. Контекст маленький, память большая. Внутри — код на Python и грабли, на которые я уже наступил.

    habr.com/ru/articles/994618/

    #LLM #AIагенты #память_LLM #RAG #Redis #ChromaDB #векторный_поиск #sentencetransformers #llama #локальные_модели

  19. I'm happy to share that I'll be speaking at PyCon Italia 2025 🎉

    I'll show you how to implement a semantic search with Python, Django and PostgreSQL 🤖

    See you in Bologna from 29 May 2025 🇮🇹

    Info 👇
    paulox.net/2025/05/29/pycon-it

    #PyCon #PyConItalia #PyConIT #Python #SemanticSearch #Django #PostgreSQL #PGvector #SentenceTransformers #OpenSource #FreeSoftware #AI #FOSS

    CC @pycon

  20. I'm happy to share that I'll be speaking at PyCon Italia 2025 🎉

    I'll show you how to implement a semantic search with Python, Django and PostgreSQL 🤖

    See you in Bologna from 29 May 2025 🇮🇹

    Info 👇
    paulox.net/2025/05/29/pycon-it

    CC @pycon

  21. I'm happy to share that I'll be speaking at PyCon Italia 2025 🎉

    I'll show you how to implement a semantic search with Python, Django and PostgreSQL 🤖

    See you in Bologna from 29 May 2025 🇮🇹

    Info 👇
    paulox.net/2025/05/29/pycon-it

    #PyCon #PyConItalia #PyConIT #Python #SemanticSearch #Django #PostgreSQL #PGvector #SentenceTransformers #OpenSource #FreeSoftware #AI #FOSS

    CC @pycon

  22. I'm happy to share that I'll be speaking at PyCon Italia 2025 🎉

    I'll show you how to implement a semantic search with Python, Django and PostgreSQL 🤖

    See you in Bologna from 29 May 2025 🇮🇹

    Info 👇
    paulox.net/2025/05/29/pycon-it

    #PyCon #PyConItalia #PyConIT #Python #SemanticSearch #Django #PostgreSQL #PGvector #SentenceTransformers #OpenSource #FreeSoftware #AI #FOSS

    CC @pycon

  23. I'm happy to share that I'll be speaking at PyCon Italia 2025 🎉

    I'll show you how to implement a semantic search with Python, Django and PostgreSQL 🤖

    See you in Bologna from 29 May 2025 🇮🇹

    Info 👇
    paulox.net/2025/05/29/pycon-it

    #PyCon #PyConItalia #PyConIT #Python #SemanticSearch #Django #PostgreSQL #PGvector #SentenceTransformers #OpenSource #FreeSoftware #AI #FOSS

    CC @pycon

  24. 𝗦𝗲𝗺𝗮𝗻𝘁𝗶𝗰𝗙𝗶𝗻𝗱𝗲𝗿 - A browser-based semantic search engine you can use to query your own texts!

    Demo: geo.rocks/semanticfinder/
    Blog Post: geo.rocks/post/semanticfinder-
    GitHub: github.com/do-me/SemanticFinde

    Built with amazing open-source software: #SentenceTransformers (all-MiniLM-L6-v2), #transformers.js, #CodeMirror and #Bootstrap. #SemanticFinder

  25. 𝗦𝗲𝗺𝗮𝗻𝘁𝗶𝗰𝗙𝗶𝗻𝗱𝗲𝗿 - A browser-based semantic search engine you can use to query your own texts!

    Demo: geo.rocks/semanticfinder/
    Blog Post: geo.rocks/post/semanticfinder-
    GitHub: github.com/do-me/SemanticFinde

    Built with amazing open-source software: (all-MiniLM-L6-v2), .js, and .

  26. Create a semantic search engine with only a vector database and a light-weight frontend - keep the inference server client-side!

    Tutorial with demo: geo.rocks/post/qdrant-transfor

    Powered by amazing open-source software from #Qdrant, #transformers.js and #SentenceTransformers!

  27. Create a semantic search engine with only a vector database and a light-weight frontend - keep the inference server client-side!

    Tutorial with demo: geo.rocks/post/qdrant-transfor

    Powered by amazing open-source software from , .js and !