#sentencetransformers — Public Fediverse posts
Live and recent posts from across the Fediverse tagged #sentencetransformers, aggregated by home.social.
-
От капстоуна к продакшену: fail‑fast, structured logs, Prometheus и Docker‑образ 8.15GB → 1.35GB
У меня есть RAG‑сервис: проверяет фактологические утверждения в бизнес‑отчётах против реальных источников — SEC EDGAR, World Bank, FRED, Wikipedia. Это капстоун LLM Zoomcamp (DataTalksClub). Курс закончился, оценку поставили (peer review, 42/42), а я решил дотянуть проект до состояния «не стыдно показать на собеседовании как рабочий код», а не просто «закрыл критерии оценки курса».
https://habr.com/ru/articles/1071230/
#docker_image_size #onnx #sentencetransformers #fastapi #prometheus #grafana #structlog #mlops #RAG
-
От капстоуна к продакшену: fail‑fast, structured logs, Prometheus и Docker‑образ 8.15GB → 1.35GB
У меня есть RAG‑сервис: проверяет фактологические утверждения в бизнес‑отчётах против реальных источников — SEC EDGAR, World Bank, FRED, Wikipedia. Это капстоун LLM Zoomcamp (DataTalksClub). Курс закончился, оценку поставили (peer review, 42/42), а я решил дотянуть проект до состояния «не стыдно показать на собеседовании как рабочий код», а не просто «закрыл критерии оценки курса».
https://habr.com/ru/articles/1071230/
#docker_image_size #onnx #sentencetransformers #fastapi #prometheus #grafana #structlog #mlops #RAG
-
От капстоуна к продакшену: fail‑fast, structured logs, Prometheus и Docker‑образ 8.15GB → 1.35GB
У меня есть RAG‑сервис: проверяет фактологические утверждения в бизнес‑отчётах против реальных источников — SEC EDGAR, World Bank, FRED, Wikipedia. Это капстоун LLM Zoomcamp (DataTalksClub). Курс закончился, оценку поставили (peer review, 42/42), а я решил дотянуть проект до состояния «не стыдно показать на собеседовании как рабочий код», а не просто «закрыл критерии оценки курса».
https://habr.com/ru/articles/1071230/
#docker_image_size #onnx #sentencetransformers #fastapi #prometheus #grafana #structlog #mlops #RAG
-
Хотел перестать копировать из Wordstat. Получилась мультиагентная система с Ensemble Voting
Началось с того что мне надоело копировать данные из Wordstat в Excel. Закончилось мультиагентной системой с Ensemble Voting, арбитражным агентом и 5% мусора на выходе. Ни одного из этих слов в моих планах не было.
https://habr.com/ru/articles/1015348/
#SEO #кластеризация_семантики #Python #NLP #LLM #DeepSeek #Яндекс_Директ #SentenceTransformers #семантическое_ядро #автоматизация
-
Хотел перестать копировать из Wordstat. Получилась мультиагентная система с Ensemble Voting
Началось с того что мне надоело копировать данные из Wordstat в Excel. Закончилось мультиагентной системой с Ensemble Voting, арбитражным агентом и 5% мусора на выходе. Ни одного из этих слов в моих планах не было.
https://habr.com/ru/articles/1015348/
#SEO #кластеризация_семантики #Python #NLP #LLM #DeepSeek #Яндекс_Директ #SentenceTransformers #семантическое_ядро #автоматизация
-
Хотел перестать копировать из Wordstat. Получилась мультиагентная система с Ensemble Voting
Началось с того что мне надоело копировать данные из Wordstat в Excel. Закончилось мультиагентной системой с Ensemble Voting, арбитражным агентом и 5% мусора на выходе. Ни одного из этих слов в моих планах не было.
https://habr.com/ru/articles/1015348/
#SEO #кластеризация_семантики #Python #NLP #LLM #DeepSeek #Яндекс_Директ #SentenceTransformers #семантическое_ядро #автоматизация
-
Хотел перестать копировать из Wordstat. Получилась мультиагентная система с Ensemble Voting Началось с того что мне на...
#SEO #кластеризация #семантики #Python #NLP #LLM #DeepSeek #Яндекс #Директ #SentenceTransformers #семантическое
Origin | Interest | Match -
Хотел перестать копировать из Wordstat. Получилась мультиагентная система с Ensemble Voting Ни одного из этих слов в м...
#deepseek #llm #nlp #python #SentenceTransformers #seo #автоматизация #кластеризация #семантики #семантическое #ядро
Origin | Interest | Match -
Малоресурсный язык ломает коммерческие embedding: R@1 0,83 (LaBSE) vs 0,21 (OpenAI) на армянском EPG
Платные модели embedding не гарантируют качество на малоресурсных языках. На задаче кроссязыкового сопоставления EPG-заголовков (EN/RU/HY) бесплатная LaBSE набирает R@1 = 0,83, а OpenAI text-embedding-3-large -- 0,21. Протестировано 19 моделей, код и данные открыты.
https://habr.com/ru/articles/1008422/
#embedding #openai #малоресурсный_язык #sentencetransformers #tokenizer #iptv #epg #benchmark #эмбеддинг
-
Малоресурсный язык ломает коммерческие embedding: R@1 0,83 (LaBSE) vs 0,21 (OpenAI) на армянском EPG
Платные модели embedding не гарантируют качество на малоресурсных языках. На задаче кроссязыкового сопоставления EPG-заголовков (EN/RU/HY) бесплатная LaBSE набирает R@1 = 0,83, а OpenAI text-embedding-3-large -- 0,21. Протестировано 19 моделей, код и данные открыты.
https://habr.com/ru/articles/1008422/
#embedding #openai #малоресурсный_язык #sentencetransformers #tokenizer #iptv #epg #benchmark #эмбеддинг
-
Малоресурсный язык ломает коммерческие embedding: R@1 0,83 (LaBSE) vs 0,21 (OpenAI) на армянском EPG
Платные модели embedding не гарантируют качество на малоресурсных языках. На задаче кроссязыкового сопоставления EPG-заголовков (EN/RU/HY) бесплатная LaBSE набирает R@1 = 0,83, а OpenAI text-embedding-3-large -- 0,21. Протестировано 19 моделей, код и данные открыты.
https://habr.com/ru/articles/1008422/
#embedding #openai #малоресурсный_язык #sentencetransformers #tokenizer #iptv #epg #benchmark #эмбеддинг
-
If you are building an application that requires search, I recommend using Elasticsearch early on. In addition to the usual full-text search, Elasticsearch allows you to perform a hybrid search: combine the results of text and vector search.
Of course, for small amounts of data, you can use PostgreSQL tsvector with the pgvector extension, but in the long term, Elasticsearch will provide good performance.#Elasticsearch #Search #tsvector #pgvector #KNN #Embedding #SentenceTransformers #AI
-
Лучший перевод Шекспира с точки зрения математики
За переводы сонетов Шекспира брались многие мастера и любители. Мне стало интересным провести лексико-семантический анализ нескольких переводов 74 сонета и сравнить их с оригиналом. Я взял авторов, авторитет которых как поэтов и переводчиков вне сомнения Маршака и Пастернака. И двух переводчиков, не известных как поэты - Николая Гербеля и Модеста Чайковского. Я захотел проверить, кто из переводчиков точнее всего передал смысл, ритм и эмоции оригинала, используя алгоритмы машинного обучения.
https://habr.com/ru/articles/996614/
#python #nlp #nlpмодели #nltk_python #проза #поэзия #литература_художественная #sentencetransformers #sbert
-
Лучший перевод Шекспира с точки зрения математики
За переводы сонетов Шекспира брались многие мастера и любители. Мне стало интересным провести лексико-семантический анализ нескольких переводов 74 сонета и сравнить их с оригиналом. Я взял авторов, авторитет которых как поэтов и переводчиков вне сомнения Маршака и Пастернака. И двух переводчиков, не известных как поэты - Николая Гербеля и Модеста Чайковского. Я захотел проверить, кто из переводчиков точнее всего передал смысл, ритм и эмоции оригинала, используя алгоритмы машинного обучения.
https://habr.com/ru/articles/996614/
#python #nlp #nlpмодели #nltk_python #проза #поэзия #литература_художественная #sentencetransformers #sbert
-
Лучший перевод Шекспира с точки зрения математики
За переводы сонетов Шекспира брались многие мастера и любители. Мне стало интересным провести лексико-семантический анализ нескольких переводов 74 сонета и сравнить их с оригиналом. Я взял авторов, авторитет которых как поэтов и переводчиков вне сомнения Маршака и Пастернака. И двух переводчиков, не известных как поэты - Николая Гербеля и Модеста Чайковского. Я захотел проверить, кто из переводчиков точнее всего передал смысл, ритм и эмоции оригинала, используя алгоритмы машинного обучения.
https://habr.com/ru/articles/996614/
#python #nlp #nlpмодели #nltk_python #проза #поэзия #литература_художественная #sentencetransformers #sbert
-
Мой локальный агент помнит проект лучше меня. Контекст — 32K токенов. Расскажу, как
Мой агент на Llama 3.1 8B в третий раз спросил, как меня зовут. Я представился 200 сообщений назад. Контекст переполнился — начало разговора уехало. Большие контексты не спасают: дорого, «Lost in the Middle», локально не влезает. Суммаризация теряет детали. Я сделал по-другому — три типа внешней памяти: Redis для фактов, ChromaDB для семантического поиска, файлы для документов. Контекст маленький, память большая. Внутри — код на Python и грабли, на которые я уже наступил.
https://habr.com/ru/articles/994618/
#LLM #AIагенты #память_LLM #RAG #Redis #ChromaDB #векторный_поиск #sentencetransformers #llama #локальные_модели
-
Мой локальный агент помнит проект лучше меня. Контекст — 32K токенов. Расскажу, как
Мой агент на Llama 3.1 8B в третий раз спросил, как меня зовут. Я представился 200 сообщений назад. Контекст переполнился — начало разговора уехало. Большие контексты не спасают: дорого, «Lost in the Middle», локально не влезает. Суммаризация теряет детали. Я сделал по-другому — три типа внешней памяти: Redis для фактов, ChromaDB для семантического поиска, файлы для документов. Контекст маленький, память большая. Внутри — код на Python и грабли, на которые я уже наступил.
https://habr.com/ru/articles/994618/
#LLM #AIагенты #память_LLM #RAG #Redis #ChromaDB #векторный_поиск #sentencetransformers #llama #локальные_модели
-
Мой локальный агент помнит проект лучше меня. Контекст — 32K токенов. Расскажу, как
Мой агент на Llama 3.1 8B в третий раз спросил, как меня зовут. Я представился 200 сообщений назад. Контекст переполнился — начало разговора уехало. Большие контексты не спасают: дорого, «Lost in the Middle», локально не влезает. Суммаризация теряет детали. Я сделал по-другому — три типа внешней памяти: Redis для фактов, ChromaDB для семантического поиска, файлы для документов. Контекст маленький, память большая. Внутри — код на Python и грабли, на которые я уже наступил.
https://habr.com/ru/articles/994618/
#LLM #AIагенты #память_LLM #RAG #Redis #ChromaDB #векторный_поиск #sentencetransformers #llama #локальные_модели
-
🔗 Learn more:
• Official website → https://sbert.net/
• Original paper → https://aclanthology.org/D19-1410.pdf
• GitHub repository → https://github.com/UKPLab/sentence-transformers📰 Read the full announcements:
TU Darmstadt Press Release
→ https://www.tu-darmstadt.de/universitaet/aktuelles_meldungen/einzelansicht_528832.de.jspHugging Face Blog Post
→ https://huggingface.co/blog/sentence-transformers-joins-hf(2/2)
#UKPLab #HuggingFace #SentenceTransformers #NLP #AIresearch #OpenSource 🚀
-
🔗 Learn more:
• Official website → https://sbert.net/
• Original paper → https://aclanthology.org/D19-1410.pdf
• GitHub repository → https://github.com/UKPLab/sentence-transformers📰 Read the full announcements:
TU Darmstadt Press Release
→ https://www.tu-darmstadt.de/universitaet/aktuelles_meldungen/einzelansicht_528832.de.jspHugging Face Blog Post
→ https://huggingface.co/blog/sentence-transformers-joins-hf(2/2)
#UKPLab #HuggingFace #SentenceTransformers #NLP #AIresearch #OpenSource 🚀
-
🔗 Learn more:
• Official website → https://sbert.net/
• Original paper → https://aclanthology.org/D19-1410.pdf
• GitHub repository → https://github.com/UKPLab/sentence-transformers📰 Read the full announcements:
TU Darmstadt Press Release
→ https://www.tu-darmstadt.de/universitaet/aktuelles_meldungen/einzelansicht_528832.de.jspHugging Face Blog Post
→ https://huggingface.co/blog/sentence-transformers-joins-hf(2/2)
#UKPLab #HuggingFace #SentenceTransformers #NLP #AIresearch #OpenSource 🚀
-
🔗 Learn more:
• Official website → https://sbert.net/
• Original paper → https://aclanthology.org/D19-1410.pdf
• GitHub repository → https://github.com/UKPLab/sentence-transformers📰 Read the full announcements:
TU Darmstadt Press Release
→ https://www.tu-darmstadt.de/universitaet/aktuelles_meldungen/einzelansicht_528832.de.jspHugging Face Blog Post
→ https://huggingface.co/blog/sentence-transformers-joins-hf(2/2)
#UKPLab #HuggingFace #SentenceTransformers #NLP #AIresearch #OpenSource 🚀
-
🔗 Learn more:
• Official website → https://sbert.net/
• Original paper → https://aclanthology.org/D19-1410.pdf
• GitHub repository → https://github.com/UKPLab/sentence-transformers📰 Read the full announcements:
TU Darmstadt Press Release
→ https://www.tu-darmstadt.de/universitaet/aktuelles_meldungen/einzelansicht_528832.de.jspHugging Face Blog Post
→ https://huggingface.co/blog/sentence-transformers-joins-hf(2/2)
#UKPLab #HuggingFace #SentenceTransformers #NLP #AIresearch #OpenSource 🚀
-
I'm happy to share that I'll be speaking at PyCon Italia 2025 🎉
I'll show you how to implement a semantic search with Python, Django and PostgreSQL 🤖
See you in Bologna from 29 May 2025 🇮🇹
Info 👇
https://www.paulox.net/2025/05/29/pycon-italia-2025/#PyCon #PyConItalia #PyConIT #Python #SemanticSearch #Django #PostgreSQL #PGvector #SentenceTransformers #OpenSource #FreeSoftware #AI #FOSS
CC @pycon
-
I'm happy to share that I'll be speaking at PyCon Italia 2025 🎉
I'll show you how to implement a semantic search with Python, Django and PostgreSQL 🤖
See you in Bologna from 29 May 2025 🇮🇹
Info 👇
https://www.paulox.net/2025/05/29/pycon-italia-2025/#PyCon #PyConItalia #PyConIT #Python #SemanticSearch #Django #PostgreSQL #PGvector #SentenceTransformers #OpenSource #FreeSoftware #AI #FOSS
CC @pycon
-
I'm happy to share that I'll be speaking at PyCon Italia 2025 🎉
I'll show you how to implement a semantic search with Python, Django and PostgreSQL 🤖
See you in Bologna from 29 May 2025 🇮🇹
Info 👇
https://www.paulox.net/2025/05/29/pycon-italia-2025/#PyCon #PyConItalia #PyConIT #Python #SemanticSearch #Django #PostgreSQL #PGvector #SentenceTransformers #OpenSource #FreeSoftware #AI #FOSS
CC @pycon
-
I'm happy to share that I'll be speaking at PyCon Italia 2025 🎉
I'll show you how to implement a semantic search with Python, Django and PostgreSQL 🤖
See you in Bologna from 29 May 2025 🇮🇹
Info 👇
https://www.paulox.net/2025/05/29/pycon-italia-2025/#PyCon #PyConItalia #PyConIT #Python #SemanticSearch #Django #PostgreSQL #PGvector #SentenceTransformers #OpenSource #FreeSoftware #AI #FOSS
CC @pycon
-
I'm happy to share that I'll be speaking at PyCon Italia 2025 🎉
I'll show you how to implement a semantic search with Python, Django and PostgreSQL 🤖
See you in Bologna from 29 May 2025 🇮🇹
Info 👇
https://www.paulox.net/2025/05/29/pycon-italia-2025/#PyCon #PyConItalia #PyConIT #Python #SemanticSearch #Django #PostgreSQL #PGvector #SentenceTransformers #OpenSource #FreeSoftware #AI #FOSS
CC @pycon
-
𝗦𝗲𝗺𝗮𝗻𝘁𝗶𝗰𝗙𝗶𝗻𝗱𝗲𝗿 - A browser-based semantic search engine you can use to query your own texts!
Demo: https://geo.rocks/semanticfinder/
Blog Post: https://geo.rocks/post/semanticfinder-semantic-search-frontend-only/
GitHub: https://github.com/do-me/SemanticFinder/Built with amazing open-source software: #SentenceTransformers (all-MiniLM-L6-v2), #transformers.js, #CodeMirror and #Bootstrap. #SemanticFinder
-
𝗦𝗲𝗺𝗮𝗻𝘁𝗶𝗰𝗙𝗶𝗻𝗱𝗲𝗿 - A browser-based semantic search engine you can use to query your own texts!
Demo: https://geo.rocks/semanticfinder/
Blog Post: https://geo.rocks/post/semanticfinder-semantic-search-frontend-only/
GitHub: https://github.com/do-me/SemanticFinder/Built with amazing open-source software: #SentenceTransformers (all-MiniLM-L6-v2), #transformers.js, #CodeMirror and #Bootstrap. #SemanticFinder
-
Create a semantic search engine with only a vector database and a light-weight frontend - keep the inference server client-side!
Tutorial with demo: https://geo.rocks/post/qdrant-transformers-js-semantic-search/
Powered by amazing open-source software from #Qdrant, #transformers.js and #SentenceTransformers!
-
Create a semantic search engine with only a vector database and a light-weight frontend - keep the inference server client-side!
Tutorial with demo: https://geo.rocks/post/qdrant-transformers-js-semantic-search/
Powered by amazing open-source software from #Qdrant, #transformers.js and #SentenceTransformers!