#sentencetransformers — Public Fediverse posts
Live and recent posts from across the Fediverse tagged #sentencetransformers, aggregated by home.social.
-
От капстоуна к продакшену: fail‑fast, structured logs, Prometheus и Docker‑образ 8.15GB → 1.35GB
У меня есть RAG‑сервис: проверяет фактологические утверждения в бизнес‑отчётах против реальных источников — SEC EDGAR, World Bank, FRED, Wikipedia. Это капстоун LLM Zoomcamp (DataTalksClub). Курс закончился, оценку поставили (peer review, 42/42), а я решил дотянуть проект до состояния «не стыдно показать на собеседовании как рабочий код», а не просто «закрыл критерии оценки курса».
https://habr.com/ru/articles/1071230/
#docker_image_size #onnx #sentencetransformers #fastapi #prometheus #grafana #structlog #mlops #RAG
-
Хотел перестать копировать из Wordstat. Получилась мультиагентная система с Ensemble Voting
Началось с того что мне надоело копировать данные из Wordstat в Excel. Закончилось мультиагентной системой с Ensemble Voting, арбитражным агентом и 5% мусора на выходе. Ни одного из этих слов в моих планах не было.
https://habr.com/ru/articles/1015348/
#SEO #кластеризация_семантики #Python #NLP #LLM #DeepSeek #Яндекс_Директ #SentenceTransformers #семантическое_ядро #автоматизация
-
Хотел перестать копировать из Wordstat. Получилась мультиагентная система с Ensemble Voting Началось с того что мне на...
#SEO #кластеризация #семантики #Python #NLP #LLM #DeepSeek #Яндекс #Директ #SentenceTransformers #семантическое
Origin | Interest | Match -
Хотел перестать копировать из Wordstat. Получилась мультиагентная система с Ensemble Voting Ни одного из этих слов в м...
#deepseek #llm #nlp #python #SentenceTransformers #seo #автоматизация #кластеризация #семантики #семантическое #ядро
Origin | Interest | Match -
Малоресурсный язык ломает коммерческие embedding: R@1 0,83 (LaBSE) vs 0,21 (OpenAI) на армянском EPG
Платные модели embedding не гарантируют качество на малоресурсных языках. На задаче кроссязыкового сопоставления EPG-заголовков (EN/RU/HY) бесплатная LaBSE набирает R@1 = 0,83, а OpenAI text-embedding-3-large -- 0,21. Протестировано 19 моделей, код и данные открыты.
https://habr.com/ru/articles/1008422/
#embedding #openai #малоресурсный_язык #sentencetransformers #tokenizer #iptv #epg #benchmark #эмбеддинг
-
Лучший перевод Шекспира с точки зрения математики
За переводы сонетов Шекспира брались многие мастера и любители. Мне стало интересным провести лексико-семантический анализ нескольких переводов 74 сонета и сравнить их с оригиналом. Я взял авторов, авторитет которых как поэтов и переводчиков вне сомнения Маршака и Пастернака. И двух переводчиков, не известных как поэты - Николая Гербеля и Модеста Чайковского. Я захотел проверить, кто из переводчиков точнее всего передал смысл, ритм и эмоции оригинала, используя алгоритмы машинного обучения.
https://habr.com/ru/articles/996614/
#python #nlp #nlpмодели #nltk_python #проза #поэзия #литература_художественная #sentencetransformers #sbert
-
Мой локальный агент помнит проект лучше меня. Контекст — 32K токенов. Расскажу, как
Мой агент на Llama 3.1 8B в третий раз спросил, как меня зовут. Я представился 200 сообщений назад. Контекст переполнился — начало разговора уехало. Большие контексты не спасают: дорого, «Lost in the Middle», локально не влезает. Суммаризация теряет детали. Я сделал по-другому — три типа внешней памяти: Redis для фактов, ChromaDB для семантического поиска, файлы для документов. Контекст маленький, память большая. Внутри — код на Python и грабли, на которые я уже наступил.
https://habr.com/ru/articles/994618/
#LLM #AIагенты #память_LLM #RAG #Redis #ChromaDB #векторный_поиск #sentencetransformers #llama #локальные_модели
-
🔗 Learn more:
• Official website → https://sbert.net/
• Original paper → https://aclanthology.org/D19-1410.pdf
• GitHub repository → https://github.com/UKPLab/sentence-transformers📰 Read the full announcements:
TU Darmstadt Press Release
→ https://www.tu-darmstadt.de/universitaet/aktuelles_meldungen/einzelansicht_528832.de.jspHugging Face Blog Post
→ https://huggingface.co/blog/sentence-transformers-joins-hf(2/2)
#UKPLab #HuggingFace #SentenceTransformers #NLP #AIresearch #OpenSource 🚀
-
I'm happy to share that I'll be speaking at PyCon Italia 2025 🎉
I'll show you how to implement a semantic search with Python, Django and PostgreSQL 🤖
See you in Bologna from 29 May 2025 🇮🇹
Info 👇
https://www.paulox.net/2025/05/29/pycon-italia-2025/#PyCon #PyConItalia #PyConIT #Python #SemanticSearch #Django #PostgreSQL #PGvector #SentenceTransformers #OpenSource #FreeSoftware #AI #FOSS
CC @pycon
-
𝗦𝗲𝗺𝗮𝗻𝘁𝗶𝗰𝗙𝗶𝗻𝗱𝗲𝗿 - A browser-based semantic search engine you can use to query your own texts!
Demo: https://geo.rocks/semanticfinder/
Blog Post: https://geo.rocks/post/semanticfinder-semantic-search-frontend-only/
GitHub: https://github.com/do-me/SemanticFinder/Built with amazing open-source software: #SentenceTransformers (all-MiniLM-L6-v2), #transformers.js, #CodeMirror and #Bootstrap. #SemanticFinder
-
Create a semantic search engine with only a vector database and a light-weight frontend - keep the inference server client-side!
Tutorial with demo: https://geo.rocks/post/qdrant-transformers-js-semantic-search/
Powered by amazing open-source software from #Qdrant, #transformers.js and #SentenceTransformers!