#rag — Public Fediverse posts
Live and recent posts from across the Fediverse tagged #rag, aggregated by home.social.
-
Astra Studio: создаем enterprise веб-приложение для взаимодействия с ИИ с нуля.Часть 1: Архитектура и философия проекта
Astra Studio - веб приложение для взаимодействия с LLM, MCP, RAG, Agents. Статья представляет собой подробный обзор архитектуры и философии проекта Astra Studio — платформы с открытым исходным кодом для создания корпоративных веб-приложений на базе искусственного интеллекта. Основной акцент сделан на решении ключевой проблемы регулируемых отраслей: необходимости внедрения современных больших языковых моделей (LLM) при строгом запрете на передачу данных во внешние облачные сервисы. Автор, Константин Некрасов, объясняет мотивацию создания собственного решения, указывая на недостатки существующих инструментов (Open WebUI, Dify, LangFlow), которые либо не обеспечивают полноценной локальной работы, либо лишены продвинутых функций RAG и корпоративной интеграции. В тексте детально описана микросервисная архитектура системы, состоящая из девяти основных компонентов: Backend на FastAPI: оркестрация агентов, аутентификация, управление проектами. Frontend на React 19 + Material-UI: адаптивный интерфейс с глубокой кастомизацией. Сервис LLM: абстракция над различными провайдерами (Ollama, vLLM, API). Система RAG (два сервиса): векторный поиск (pgvector), лексический поиск (BM25), гибридный и графовый поиск, а также уникальное иерархическое индексирование для больших документов. OCR (Sura OCR): распознавание текста со сканов. Голосовые сервисы: WhisperX (распознавание), диаризация спикеров, Silero TTS (синтез речи). Хранилища: MongoDB, PostgreSQL, MinIO. Особое внимание уделено агентной архитектуре на базе LangGraph, включающей агента-оркестратора и специализированных агентов (работа с документами, память, MCP, планирование). Описана интеграция с протоколом Model Context Protocol (MCP) для подключения внешних систем (GitHub, базы данных, CRM) без изменения кода платформы, а также возможности генерации изображений через ComfyUI. Статья затрагивает вопросы безопасности: интеграцию с LDAP/SSO, JWT-токены, изоляцию данных между проектами, аудит действий и защиту от brute-force атак. Приведены инструкции по развертыванию через Docker Compose, минимальные системные требования и roadmap развития проекта, включая планы по выпуску Helm-чартов для Kubernetes.
https://habr.com/ru/articles/1060596/
#AI #webapp #llm #astrachat #astra_chat #большие_языковые_модели #бям #агенты #rag #mcp
-
Astra Studio: создаем enterprise веб-приложение для взаимодействия с ИИ с нуля.Часть 1: Архитектура и философия проекта
Astra Studio - веб приложение для взаимодействия с LLM, MCP, RAG, Agents. Статья представляет собой подробный обзор архитектуры и философии проекта Astra Studio — платформы с открытым исходным кодом для создания корпоративных веб-приложений на базе искусственного интеллекта. Основной акцент сделан на решении ключевой проблемы регулируемых отраслей: необходимости внедрения современных больших языковых моделей (LLM) при строгом запрете на передачу данных во внешние облачные сервисы. Автор, Константин Некрасов, объясняет мотивацию создания собственного решения, указывая на недостатки существующих инструментов (Open WebUI, Dify, LangFlow), которые либо не обеспечивают полноценной локальной работы, либо лишены продвинутых функций RAG и корпоративной интеграции. В тексте детально описана микросервисная архитектура системы, состоящая из девяти основных компонентов: Backend на FastAPI: оркестрация агентов, аутентификация, управление проектами. Frontend на React 19 + Material-UI: адаптивный интерфейс с глубокой кастомизацией. Сервис LLM: абстракция над различными провайдерами (Ollama, vLLM, API). Система RAG (два сервиса): векторный поиск (pgvector), лексический поиск (BM25), гибридный и графовый поиск, а также уникальное иерархическое индексирование для больших документов. OCR (Sura OCR): распознавание текста со сканов. Голосовые сервисы: WhisperX (распознавание), диаризация спикеров, Silero TTS (синтез речи). Хранилища: MongoDB, PostgreSQL, MinIO. Особое внимание уделено агентной архитектуре на базе LangGraph, включающей агента-оркестратора и специализированных агентов (работа с документами, память, MCP, планирование). Описана интеграция с протоколом Model Context Protocol (MCP) для подключения внешних систем (GitHub, базы данных, CRM) без изменения кода платформы, а также возможности генерации изображений через ComfyUI. Статья затрагивает вопросы безопасности: интеграцию с LDAP/SSO, JWT-токены, изоляцию данных между проектами, аудит действий и защиту от brute-force атак. Приведены инструкции по развертыванию через Docker Compose, минимальные системные требования и roadmap развития проекта, включая планы по выпуску Helm-чартов для Kubernetes.
https://habr.com/ru/articles/1060596/
#AI #webapp #llm #astrachat #astra_chat #большие_языковые_модели #бям #агенты #rag #mcp
-
Astra Studio: создаем enterprise веб-приложение для взаимодействия с ИИ с нуля.Часть 1: Архитектура и философия проекта
Astra Studio - веб приложение для взаимодействия с LLM, MCP, RAG, Agents. Статья представляет собой подробный обзор архитектуры и философии проекта Astra Studio — платформы с открытым исходным кодом для создания корпоративных веб-приложений на базе искусственного интеллекта. Основной акцент сделан на решении ключевой проблемы регулируемых отраслей: необходимости внедрения современных больших языковых моделей (LLM) при строгом запрете на передачу данных во внешние облачные сервисы. Автор, Константин Некрасов, объясняет мотивацию создания собственного решения, указывая на недостатки существующих инструментов (Open WebUI, Dify, LangFlow), которые либо не обеспечивают полноценной локальной работы, либо лишены продвинутых функций RAG и корпоративной интеграции. В тексте детально описана микросервисная архитектура системы, состоящая из девяти основных компонентов: Backend на FastAPI: оркестрация агентов, аутентификация, управление проектами. Frontend на React 19 + Material-UI: адаптивный интерфейс с глубокой кастомизацией. Сервис LLM: абстракция над различными провайдерами (Ollama, vLLM, API). Система RAG (два сервиса): векторный поиск (pgvector), лексический поиск (BM25), гибридный и графовый поиск, а также уникальное иерархическое индексирование для больших документов. OCR (Sura OCR): распознавание текста со сканов. Голосовые сервисы: WhisperX (распознавание), диаризация спикеров, Silero TTS (синтез речи). Хранилища: MongoDB, PostgreSQL, MinIO. Особое внимание уделено агентной архитектуре на базе LangGraph, включающей агента-оркестратора и специализированных агентов (работа с документами, память, MCP, планирование). Описана интеграция с протоколом Model Context Protocol (MCP) для подключения внешних систем (GitHub, базы данных, CRM) без изменения кода платформы, а также возможности генерации изображений через ComfyUI. Статья затрагивает вопросы безопасности: интеграцию с LDAP/SSO, JWT-токены, изоляцию данных между проектами, аудит действий и защиту от brute-force атак. Приведены инструкции по развертыванию через Docker Compose, минимальные системные требования и roadmap развития проекта, включая планы по выпуску Helm-чартов для Kubernetes.
https://habr.com/ru/articles/1060596/
#AI #webapp #llm #astrachat #astra_chat #большие_языковые_модели #бям #агенты #rag #mcp
-
Why bigger context windows often make AI agents less accurate. Learn about lost-in-the-middle, context rot, reranking, and smarter context engineering. https://hackernoon.com/why-bigger-context-windows-make-ai-agents-worse-not-better #rag
-
Why bigger context windows often make AI agents less accurate. Learn about lost-in-the-middle, context rot, reranking, and smarter context engineering. https://hackernoon.com/why-bigger-context-windows-make-ai-agents-worse-not-better #rag
-
Не всё надо решать LLM. Где в продакшене побеждают бустинги, эмбеддинги и правила
Нам очень хотелось поговорить о том, в каких местах важно оставаться приверженцами классического ML, а где хотелось бы идти в сторону инноваций, внедрять в компании LLM, автоматизировать процессы с помощью различных AI-подходов и идти в будущее, о котором все сейчас говорят. Обзор дискуссии, где обсуждаем: когда нужны большие языковые модели, а когда задачу проще, дешевле и надёжнее решить другими технологиями.
https://habr.com/ru/articles/1060154/
#llm #машинное_обучение #классический_ml #rag #гибридные_архитектуры #production #инференс #валидация_llm #дрейф_данных
-
From the Leanpub Blog: Leanpub Book LAUNCH 🚀 Systems Thinking for Agentic AI: A Software Architect’s Guide to Building Reliable LLM and Agent Systems by Ediz Najim
#books #leanpublishing #selfpublishing #AgenticAI #LLMArchitecture #SystemsThinking #RAG #SoftwareArchitecture
-
From the Leanpub Blog: Leanpub Book LAUNCH 🚀 Systems Thinking for Agentic AI: A Software Architect’s Guide to Building Reliable LLM and Agent Systems by Ediz Najim
#books #leanpublishing #selfpublishing #AgenticAI #LLMArchitecture #SystemsThinking #RAG #SoftwareArchitecture
-
NEW! Leanpub Book LAUNCH 🚀 Systems Thinking for Agentic AI: A Software Architect’s Guide to Building Reliable LLM and Agent Systems by Ediz Najim
#books #leanpublishing #selfpublishing #AgenticAI #LLMArchitecture #SystemsThinking #RAG #SoftwareArchitecture
-
NEW! Leanpub Book LAUNCH 🚀 Systems Thinking for Agentic AI: A Software Architect’s Guide to Building Reliable LLM and Agent Systems by Ediz Najim
#books #leanpublishing #selfpublishing #AgenticAI #LLMArchitecture #SystemsThinking #RAG #SoftwareArchitecture
-
How I Stopped Losing Notes While Turning Recordings Into Searchable Text https://www.cloudcomputing-news.net/news/how-i-stopped-losing-notes-while-turning-recordings-into-searchable-text/?utm_source=dlvr.it&utm_medium=mastodon #Cloud #Automation #Data #RAG #AIArchitecture #AgenticAI #DataPlatforms #DigitalTransformation
-
How do you build an #AI shopping assistant that goes beyond the #LLM?
DoorDash's "Ask DoorDash" combines LLMs, specialized agents, persistent memory, and a shared Model Context Protocol (MCP) layer.
The results: roughly 24% higher grocery checkout conversion in early production tests, while an automated evaluation framework running 2,000+ checks daily cut regression testing from 6 hours to 20 minutes.
Learn more 👉 https://bit.ly/4f6dSFJ
#AIAgents #MCP #RAG #SoftwareArchitecture #Microservices #InfoQ
-
How do you build an #AI shopping assistant that goes beyond the #LLM?
DoorDash's "Ask DoorDash" combines LLMs, specialized agents, persistent memory, and a shared Model Context Protocol (MCP) layer.
The results: roughly 24% higher grocery checkout conversion in early production tests, while an automated evaluation framework running 2,000+ checks daily cut regression testing from 6 hours to 20 minutes.
Learn more 👉 https://bit.ly/4f6dSFJ
#AIAgents #MCP #RAG #SoftwareArchitecture #Microservices #InfoQ
-
Alle reden über #AI-Performance. Kaum jemand fragt: Wo liegt der echte Engpass? Cornelius May & Eldar Sultanow verbinden #GPU-Grenzen, #JVM-Tuning & #RAG-Orchestrierung zu einem klaren Bild.
Optimierst du die falsche Stelle?➡️ https://javapro.io
-
Alle reden über #AI-Performance. Kaum jemand fragt: Wo liegt der echte Engpass? Cornelius May & Eldar Sultanow verbinden #GPU-Grenzen, #JVM-Tuning & #RAG-Orchestrierung zu einem klaren Bild.
Optimierst du die falsche Stelle?➡️ https://javapro.io
-
Domain-routed agents vs naive RAG: экономика и риски архитектурного выбора
Классический RAG хорошо ищет отдельные факты, но может пропускать исключения и связи между разными разделами документации. Я проверил альтернативный подход: мультиагентный граф, в котором роутер направляет запрос экспертам по отдельным доменам знаний. В статье — архитектура на LangGraph, сравнение с наивным RAG на датасете из 40 вопросов, метрики качества, задержки и стоимость запросов. А главное — разбор, когда дорогой в эксплуатации агент может оказаться выгоднее дешёвого RAG за счёт экономии инженерного времени.
https://habr.com/ru/articles/1059564/
#RAG #LangGraph #агенты #мультиагентные_системы #ИИ #Python #архитектура #NLP #LLM #llmархитектура
-
LLM-wiki против RAG: Оцениваем и сравниваем
Про LLM-wiki здесь уже было несколько хороших статей ( 1 , 2 и 3 ), поэтому подробно останавливаться на идее Andrej Karpathy не буду. В двух словах: вместо RAG-ретривера - wiki-агент, вместо чанков из сырых документов - связанные концепт-страницы, вместо обновления - перекомпиляция и поиск «битых» ссылок. Насколько LLM-wiki лучше, или может быть хуже чем RAG, пусть даже простейший, с обычным векторным поиском? И как их можно сравнивать? Кажется, общепринятой методики оценки ещё не сложилось. Тем не менее я попробовал, и получил неожиданные результаты. Об этом и расскажу, а ещё о методике оценки, о wiki-агенте для тестов, о том что получилось, что - нет, и даже сколько это стоило.
https://habr.com/ru/articles/1058252/
#llm #llmагенты #wiki #rag #оценка_качества #claudecode #langchain #rag_система #wilcoxon_scores
-
Архитектура RAG с виртуальной файловой системой и LLM-роутером
Классический RAG (Retrieval-Augmented Generation) решает задачу поиска релевантного контекста в векторных базах данных. Однако при работе с большими объемами знаний возникают вопросы структурирования, управления и актуализации информации. В данной статье рассматривается альтернативный подход: использование LLM-роутера и виртуальной файловой системы (VFS) для организации базы знаний. Реализация выполнена на базе модели Qwen2.5-3B-instruct-q5_0 и представляет собой концептуальный прототип.
-
120 выдуманных ссылок против 8: что агентный поиск делает с галлюцинациями LLM на строительных нормах
Один контрольный эксперимент — и один красивый ложный вывод, который мы чуть не опубликовали После прошлой статьи о том, почему нормативные документы пришлось превратить в граф, а не просто загрузить их в векторную базу , нас несколько раз спросили одно и то же: «А если взять GPT или другую топовую модель — неужели она действительно не сможет ответить на вопросы по СП и ГОСТ?» А недавно тот же аргумент прозвучал в куда более жёсткой форме — на очной защите нашего проекта перед экспертами одной государственной грантовой программы по ИИ. Тезис звучал так: сервис для работы с нормативкой от маленькой команды обречён, потому что крупнейшие компании вкладывают в свои модели несопоставимо больше, — и поддерживать нишевую разработку на этом фоне нет смысла. Аргумент понятен и звучит убедительно. Спорить с ним словами бесполезно — нужны данные. Так что считайте это исследование нашим развёрнутым ответом. Ниже — 3000 слепых оценок того, что фронтир-модели умеют на строительных нормах «из коробки», и что меняется, если поверх той же самой модели поставить доменный агентный поисковый контур. Только не ждите вывода «наша система лучше всех LLM вообще» — его не будет. Мы показываем другое: там, где ответ обязан быть проверяемым по нормативному корпусу, агентный контур резко снижает число неподтверждённых ссылок — на одном и том же генераторе. Заодно расскажем, как мы сами едва не попались — на методике, а не на моделях.
https://habr.com/ru/articles/1059006/
#rag #llm #нормативные_документы #гост #строительство #нейросети #сп_снип #верификация
-
PixelRAG is an open-source visual RAG framework that helps local AI models understand documents by analyzing screenshots instead of relying only on extracted text.
It preserves tables, charts, diagrams, and page layouts for more accurate retrieval, and can run locally with your own PDFs and webpages.
More details: https://digitalescapetools.com/tools/tool.html?id=pixelrag
-
PixelRAG is an open-source visual RAG framework that helps local AI models understand documents by analyzing screenshots instead of relying only on extracted text.
It preserves tables, charts, diagrams, and page layouts for more accurate retrieval, and can run locally with your own PDFs and webpages.
More details: https://digitalescapetools.com/tools/tool.html?id=pixelrag
-
У ИИ есть душа? Даём LLM характер и эмоции
Если вы когда‑нибудь общались с популярными чат‑ботами или заглядывали на Character.ai, легко поддаться иллюзии, будто на той стороне экрана сидит живой человек. ИИ искусно шутит, сопереживает, злится и подыгрывает. Ведёт себя почти как человек. Но может ли за всем этим скрываться настоящее сознание и душа? Если говорить кратко и прямо — за экраном только пустота и холодные математические расчеты. Любая современная языковая модель представляет собой сложный калькулятор статистики, который предсказывает следующее, наиболее вероятное и приятное вам слово. Но не более того. У LLM нет ни характера, ни настроения, ни личности. То есть ничего того, что свойственно человеческой психике. Красивый фасад «души» быстро рассыпается в долгих диалогах. В текстовых ролевых играх (AI‑roleplay) это заметно сильнее всего: через 20–30 реплик бот теряет нить разговора, забывает детали и начинает безвольно поддакивать игроку. Но неужели нельзя сделать ИИ хоть немного человечнее? Дать ему сознание? Возможно ли подарить языковой модели стабильный характер и живые эмоции без необходимости её переобучать? Рассказываем, как мы обошли ограничения нейросетей с помощью внешней программы.
https://habr.com/ru/articles/1058960/
#characterai #roleplaying #психология_ии #сознание_ии #llm #sillytavern #rpg #геймдев #rag #нейросети
-
🤖 Workshop at the Workshop-Tage 2026: Designing Thinking Machines – The Future of AI with Graph-Based AI Agents by Ornella Vaccarelli
LLMs often sound confident even when they're wrong. In this hands-on workshop you'll learn how to combine Retrieval-Augmented Generation (RAG) with graph-based reasoning to build AI agents that don't just answer, but retrieve, reason, and verify before responding.
🔍 In this full-day workshop you'll build a complete RAG pipeline with an open-source LLM. From document ingestion and chunking to embeddings and retrieval, then upgrade it into a graph-based AI agent that decides when to search, how to combine sources, and when to verify. You'll wrap up with practical tips on evaluation, reliability, and data privacy.
📅 Tuesday, September 8, 2026, from 🕘 9:00 AM
🌍 Workshop language: English
Basic Python knowledge required. No ML/AI background needed, we build everything together step by step.
👉 Register here: https://eventfrog.ch/de/p/wissenschaft-und-technik/designing-thinking-machines-the-future-of-ai-with-graphs-ba-7467543980420388095.html
#WorkshopTage2026 #CHOpen #OpenSource #AgenticCoding #AI #RAG #AIAgents #DevOps
-
🤖 Workshop at the Workshop-Tage 2026: Designing Thinking Machines – The Future of AI with Graph-Based AI Agents by Ornella Vaccarelli
LLMs often sound confident even when they're wrong. In this hands-on workshop you'll learn how to combine Retrieval-Augmented Generation (RAG) with graph-based reasoning to build AI agents that don't just answer, but retrieve, reason, and verify before responding.
🔍 In this full-day workshop you'll build a complete RAG pipeline with an open-source LLM. From document ingestion and chunking to embeddings and retrieval, then upgrade it into a graph-based AI agent that decides when to search, how to combine sources, and when to verify. You'll wrap up with practical tips on evaluation, reliability, and data privacy.
📅 Tuesday, September 8, 2026, from 🕘 9:00 AM
🌍 Workshop language: English
Basic Python knowledge required. No ML/AI background needed, we build everything together step by step.
👉 Register here: https://eventfrog.ch/de/p/wissenschaft-und-technik/designing-thinking-machines-the-future-of-ai-with-graphs-ba-7467543980420388095.html
#WorkshopTage2026 #CHOpen #OpenSource #AgenticCoding #AI #RAG #AIAgents #DevOps
-
Запрещаем AI выдумывать методы КОМПАС-3D: 200К пар обучения, модель на 34М и KOMPAS Guard в одном процессе
Чтобы AI-агент понимал инженера, индустрия предлагает поставить между ними еще одну большую языковую модель. Мы поставили модель на 34 млн параметров, в несколько десятков раз меньше, и она справляется лучше. Секрет в данных. 200 тысяч пар «формулировка задачи → элемент КОМПАС API», где негативные примеры подбирались специально коварные: одноименные методы разных интерфейсов, соседние get/set одного свойства, кандидаты, которых базовая модель ошибочно ставила на первое место. Дообучение заняло меньше пяти часов на одной видеокарте, а Hit@5 на запросах, где метод описан задачей, а не именем, вырос с 5,8% до 79,6%. Но поиск это только вход. Дальше каждый кандидат проходит через граф типов, константы берутся из настоящих DLL, код сверяет компилятор, а недокументированное поведение агент выясняет экспериментами в живом CAD: пишет зонд, запускает в песочнице, читает результат. Выдать догадку за факт ему негде, на каждом шаге его встречает проверка. В статье реальные логи, метрики трех бенчмарков, включая неудобные для нас, и объяснение, почему в продакшен пошла именно первая версия модели, а не две следующие.
https://habr.com/ru/articles/1058800/
#КОМПАС3D #LLMагенты #семантический_поиск #эмбеддинги #дообучение_модели #галлюцинации_LLM #CAD #RAG #COM_API #бенчмарки
-
Запрещаем AI выдумывать методы КОМПАС-3D: 200К пар обучения, модель на 34М и KOMPAS Guard в одном процессе
Чтобы AI-агент понимал инженера, индустрия предлагает поставить между ними еще одну большую языковую модель. Мы поставили модель на 34 млн параметров, в несколько десятков раз меньше, и она справляется лучше. Секрет в данных. 200 тысяч пар «формулировка задачи → элемент КОМПАС API», где негативные примеры подбирались специально коварные: одноименные методы разных интерфейсов, соседние get/set одного свойства, кандидаты, которых базовая модель ошибочно ставила на первое место. Дообучение заняло меньше пяти часов на одной видеокарте, а Hit@5 на запросах, где метод описан задачей, а не именем, вырос с 5,8% до 79,6%. Но поиск это только вход. Дальше каждый кандидат проходит через граф типов, константы берутся из настоящих DLL, код сверяет компилятор, а недокументированное поведение агент выясняет экспериментами в живом CAD: пишет зонд, запускает в песочнице, читает результат. Выдать догадку за факт ему негде, на каждом шаге его встречает проверка. В статье реальные логи, метрики трех бенчмарков, включая неудобные для нас, и объяснение, почему в продакшен пошла именно первая версия модели, а не две следующие.
https://habr.com/ru/articles/1058800/
#КОМПАС3D #LLMагенты #семантический_поиск #эмбеддинги #дообучение_модели #галлюцинации_LLM #CAD #RAG #COM_API #бенчмарки
-
Запрещаем AI выдумывать методы КОМПАС-3D: 200К пар обучения, модель на 34М и KOMPAS Guard в одном процессе
Чтобы AI-агент понимал инженера, индустрия предлагает поставить между ними еще одну большую языковую модель. Мы поставили модель на 34 млн параметров, в несколько десятков раз меньше, и она справляется лучше. Секрет в данных. 200 тысяч пар «формулировка задачи → элемент КОМПАС API», где негативные примеры подбирались специально коварные: одноименные методы разных интерфейсов, соседние get/set одного свойства, кандидаты, которых базовая модель ошибочно ставила на первое место. Дообучение заняло меньше пяти часов на одной видеокарте, а Hit@5 на запросах, где метод описан задачей, а не именем, вырос с 5,8% до 79,6%. Но поиск это только вход. Дальше каждый кандидат проходит через граф типов, константы берутся из настоящих DLL, код сверяет компилятор, а недокументированное поведение агент выясняет экспериментами в живом CAD: пишет зонд, запускает в песочнице, читает результат. Выдать догадку за факт ему негде, на каждом шаге его встречает проверка. В статье реальные логи, метрики трех бенчмарков, включая неудобные для нас, и объяснение, почему в продакшен пошла именно первая версия модели, а не две следующие.
https://habr.com/ru/articles/1058800/
#КОМПАС3D #LLMагенты #семантический_поиск #эмбеддинги #дообучение_модели #галлюцинации_LLM #CAD #RAG #COM_API #бенчмарки
-
Version 0.18.0 of my #debian13 #chatbot completed this morning - huge UI change! 🌊
Hoping to get 1.0 out before August! 🥂
https://llgit.llamachile.tube/gramps/cAIc
#AI, #ClusterOrchestration, #RAG, #cAIc, #GPUs, #CPUs, #Inference, #Homelab, #TechInnovation, #HardwareCompatibility
-
Version 0.18.0 of my #debian13 #chatbot completed this morning - huge UI change! 🌊
Hoping to get 1.0 out before August! 🥂
https://llgit.llamachile.tube/gramps/cAIc
#AI, #ClusterOrchestration, #RAG, #cAIc, #GPUs, #CPUs, #Inference, #Homelab, #TechInnovation, #HardwareCompatibility
-
Version 0.18.0 of my #debian13 #chatbot completed this morning - huge UI change! 🌊
Hoping to get 1.0 out before August! 🥂
https://llgit.llamachile.tube/gramps/cAIc
#AI, #ClusterOrchestration, #RAG, #cAIc, #GPUs, #CPUs, #Inference, #Homelab, #TechInnovation, #HardwareCompatibility
-
Version 0.18.0 of my #debian13 #chatbot completed this morning - huge UI change! 🌊
Hoping to get 1.0 out before August! 🥂
https://llgit.llamachile.tube/gramps/cAIc
#AI, #ClusterOrchestration, #RAG, #cAIc, #GPUs, #CPUs, #Inference, #Homelab, #TechInnovation, #HardwareCompatibility
-
52 открытых урока второй половины июля: LLM, C++, Playwright, Kubernetes, TOGAF и не только
Во второй половине июля у OTUS пройдут открытые уроки по разработке, AI/ML, DevOps, тестированию, архитектуре и управлению ИТ‑командами. В подборке — практические темы: LLM и RAG, C++, Java, Go, Kubernetes, Playwright, сети ЦОД, TOGAF и не только. Собрали расписание по направлениям, чтобы было проще выбрать нужный урок и быстро перейти к регистрации. Выбрать урок
https://habr.com/ru/companies/otus/articles/1057668/
#открытые_уроки #бесплатные_вебинары #LLM #RAG #C++ #Java #Kubernetes #Playwright #DevOps #тестирование
-
🧩 Building a chatbot with memory in 2026:
Step 1: Short-term memory → Conversation history in context
Step 2: Long-term memory → User facts in vector DB (pgvector)
Step 3: Episodic memory → Summarise past sessions
Step 4: Semantic memory → RAG over your knowledge baseThe magic: combine all 4 layers.
This is how you build AI that feels like it "knows" you.
#AI #LLM #RAG #GenerativeAI #FullStack #ChatBot #MachineLearning
-
🧩 Building a chatbot with memory in 2026:
Step 1: Short-term memory → Conversation history in context
Step 2: Long-term memory → User facts in vector DB (pgvector)
Step 3: Episodic memory → Summarise past sessions
Step 4: Semantic memory → RAG over your knowledge baseThe magic: combine all 4 layers.
This is how you build AI that feels like it "knows" you.
#AI #LLM #RAG #GenerativeAI #FullStack #ChatBot #MachineLearning
-
Как принудить нейросеть рассказать про ваш продукт. Часть 2 из 3
Начну с тезиса, который большинство классических сеошников и маркетологов, честно говоря, не очень любят. Но именно с него начинается понимание, что такое GEO на самом деле. Нейросеть не рекламирует ваш продукт — она пересказывает ценность вашей компании своими словами. Она не повторяет ваши рекламные лозунги, сколько бы раз вы их где-нибудь ни написали. То есть если вы сто раз напишете, что ваш сервис самый сервисный, качество самое качественное, а ассортимент самый многообразный — модель, скорее всего, вас даже не упомянет. Не потому, что вы плохие. А потому, что ей про вас нечего пересказать. Это сказано везде — значит, не сказано нигде.
https://habr.com/ru/articles/1056752/
#GEO #нейросети #нейровыдача #граундинг #фактчекинг #личный_бренд #Карта_смыслов #EEAT #AIпоиск #RAG
-
Google suggests the Open Knowledge Format (OKF): An open standard structuring data catalogs, metrics, and runbooks into simple Markdown & YAML files. It replaces messy corporate wikis with a clean, Git-backed knowledge graph optimized directly for LLMs and RAG.
Benefits:
* Vendor-neutral & open source
* Supercharges RAG with clean context
* Low-barrier knowledge graphsSpec & code:
https://github.com/GoogleCloudPlatform/knowledge-catalog
#OpenKnowledgeFormat #RAG #AI #LLMs #Google #OKF -
Google suggests the Open Knowledge Format (OKF): An open standard structuring data catalogs, metrics, and runbooks into simple Markdown & YAML files. It replaces messy corporate wikis with a clean, Git-backed knowledge graph optimized directly for LLMs and RAG.
Benefits:
* Vendor-neutral & open source
* Supercharges RAG with clean context
* Low-barrier knowledge graphsSpec & code:
https://github.com/GoogleCloudPlatform/knowledge-catalog
#OpenKnowledgeFormat #RAG #AI #LLMs #Google #OKF -
Метод, которого не существовало: как я собрал локальный RAG для CAD API
Последние годы инжиниринг живёт под одним лозунгом: то же самое, но дешевле и быстрее. Заказчики сокращают бюджеты и сроки, подрядчики ищут, какие процессы можно оптимизировать, и автоматизация проектирования становится одним из первых кандидатов. Рутинных операций в проектировании много, и значительную часть из них можно передать скриптам и небольшим программным утилитам.
https://habr.com/ru/articles/1057612/
#Smart3D #CAD_API #RAG #LLM #C# #NET #генерация_кода #векторный_поиск #локальная_языковая_модель #промышленная_автоматизация
-
Контекстная инженерия: что это такое, как работать с контекстом и почему за это начали платить
Вы собрали диалоговую систему — агента с RAG, инструментами и памятью. На коротких диалогах всё работает: модель выбирает нужный инструмент и достаёт данные. Но через несколько десятков итераций агент уже путает инструменты, тянет в ответ старые вызовы и опирается на ошибку, которая раньше попала в контекст. Новый промпт не всегда решает проблему: важно управлять тем, какая информация попадает к модели перед каждым следующим шагом. Это и называют контекстной инженерией. Разбираемся, чем она отличается от промпт-инжиниринга, RAG и MCP, почему агент начинает ошибаться и какие приёмы помогают собрать контекст так, чтобы модель не путалась в длинных сценариях. Показать на коде →
https://habr.com/ru/companies/netologyru/articles/1052454/
#контекстная_инженерия #context_engineering #llm #ииагенты #rag #mcp #промптинжиниринг #контекстное_окно #большие_языковые_модели #tool_calls
-
Контекстная инженерия: что это такое, как работать с контекстом и почему за это начали платить
Вы собрали диалоговую систему — агента с RAG, инструментами и памятью. На коротких диалогах всё работает: модель выбирает нужный инструмент и достаёт данные. Но через несколько десятков итераций агент уже путает инструменты, тянет в ответ старые вызовы и опирается на ошибку, которая раньше попала в контекст. Новый промпт не всегда решает проблему: важно управлять тем, какая информация попадает к модели перед каждым следующим шагом. Это и называют контекстной инженерией. Разбираемся, чем она отличается от промпт-инжиниринга, RAG и MCP, почему агент начинает ошибаться и какие приёмы помогают собрать контекст так, чтобы модель не путалась в длинных сценариях. Показать на коде →
https://habr.com/ru/companies/netologyru/articles/1052454/
#контекстная_инженерия #context_engineering #llm #ииагенты #rag #mcp #промптинжиниринг #контекстное_окно #большие_языковые_модели #tool_calls
-
Контекстная инженерия: что это такое, как работать с контекстом и почему за это начали платить
Вы собрали диалоговую систему — агента с RAG, инструментами и памятью. На коротких диалогах всё работает: модель выбирает нужный инструмент и достаёт данные. Но через несколько десятков итераций агент уже путает инструменты, тянет в ответ старые вызовы и опирается на ошибку, которая раньше попала в контекст. Новый промпт не всегда решает проблему: важно управлять тем, какая информация попадает к модели перед каждым следующим шагом. Это и называют контекстной инженерией. Разбираемся, чем она отличается от промпт-инжиниринга, RAG и MCP, почему агент начинает ошибаться и какие приёмы помогают собрать контекст так, чтобы модель не путалась в длинных сценариях. Показать на коде →
https://habr.com/ru/companies/netologyru/articles/1052454/
#контекстная_инженерия #context_engineering #llm #ииагенты #rag #mcp #промптинжиниринг #контекстное_окно #большие_языковые_модели #tool_calls
-
Как я писал in-memory векторный движок на Go — и в каком месте он обогнал hnswilb
Полгода назад я начал писать in-memory базу с векторным поиском на Go: RESP-протокол, HNSW-индекс, WAL, многопоточность. Рассказываю, что из этого вышло: как я мерил производительность и на каких граблях стоял, что реально ускоряет векторный поиск, а что нет. Все цифры воспроизводимы, код открыт.
https://habr.com/ru/articles/1057136/
#векторные_базы_данных #векторный_поиск #hnsw #golang #go #inmemory #benchmark #квантизация #rag
-
Как я писал in-memory векторный движок на Go — и в каком месте он обогнал hnswilb
Полгода назад я начал писать in-memory базу с векторным поиском на Go: RESP-протокол, HNSW-индекс, WAL, многопоточность. Рассказываю, что из этого вышло: как я мерил производительность и на каких граблях стоял, что реально ускоряет векторный поиск, а что нет. Все цифры воспроизводимы, код открыт.
https://habr.com/ru/articles/1057136/
#векторные_базы_данных #векторный_поиск #hnsw #golang #go #inmemory #benchmark #квантизация #rag
-
Как я писал in-memory векторный движок на Go — и в каком месте он обогнал hnswilb
Полгода назад я начал писать in-memory базу с векторным поиском на Go: RESP-протокол, HNSW-индекс, WAL, многопоточность. Рассказываю, что из этого вышло: как я мерил производительность и на каких граблях стоял, что реально ускоряет векторный поиск, а что нет. Все цифры воспроизводимы, код открыт.
https://habr.com/ru/articles/1057136/
#векторные_базы_данных #векторный_поиск #hnsw #golang #go #inmemory #benchmark #квантизация #rag
-
DS MCP: как дать AI-агенту знание о вашей дизайн-системе
Статья про то, как AI-агенту дали знание о дизайн-системе, чтобы он перестал придумывать несуществующие компоненты и начал верстать из того, что реально есть в проекте. Закрываем очень практичную боль: агент видит макет, умеет писать код, но не понимает, какими компонентами из вашего проекта этот экран нужно собирать. Внутри: Figma MCP, свой DS MCP, React, Jetpack Compose и SwiftUI, поиск по компонентам, ChromaDB, RAG, embeddings, препроцессор для описания дизайн-системы, грабли с чтением файлов, шумом в контексте, устаревающим SKILL.md и честное сравнение подходов по tool calls, токенам и результату. Заходите, читайте и рассказывайте, как вы решаете эту проблему у себя ❤️
https://habr.com/ru/companies/X5Tech/articles/1051322/
#mcp #aiагенты #дизайнсистема #figma_mcp #ds_mcp #rag #chromadb #генерация_верстки #векторный_поиск #frontend
-
【実測比較】日本語RAGのOCR、結局どれを使う? glm-ocr / dots.ocr / Unlimited-OCR / MinerU を社内ドライブの実データでガチ評価
https://qiita.com/engchina/items/6dff7010af1b28e8c30a?utm_campaign=popular_items&utm_medium=feed&utm_source=popular_items -
【実測比較】日本語RAGのOCR、結局どれを使う? glm-ocr / dots.ocr / Unlimited-OCR / MinerU を社内ドライブの実データでガチ評価
https://qiita.com/engchina/items/6dff7010af1b28e8c30a?utm_campaign=popular_items&utm_medium=feed&utm_source=popular_items -
RT @h100envy: Der ehemalige Berkeley-PhD, der SGLang bei xAI leitet, erklärte, wie sie Grok auf 100.000 GPUs in 23 Minuten bedienen – besser als $2000 Inference-at-Scale-Kurse. Aufteilung von Prefill und Decode –> Sharding von Experten über GPUs –> Token-Routing pro Experte –> Überlappung von Kommunikation und Berechnung –> Bedienung zu DeepSeek-API-zerstörenden Preisen. Diese Schleife ist der Grund, warum xAI Grok auf SGLang betreibt und Dritte DeepSeek's eigene API um den Faktor 5 bei den Kosten schlagen. SGLang + Prefill-Decode-Disaggregation + Experten-Parallelität + AMD MI300 – das ist der Stack. Schau dir das Video an und speichere es, dann lies den Artikel unten. Video h100envy (@h100envy) Artikel Loop Engineering: Eine Schleife, die RAG automatisch auf ein Ziel-Recall einstellt. Ein konkreter Fall von Loop-Engineering. Nicht „RAG von Hand einstellen“, sondern eine Schleife bauen, die Konfigurationen selbst sucht, Recall auf einem Eval misst und stoppt, wenn das Ziel erreicht ist. Mit vollständigem Code. RAG-Einstellung – https://nitter.net/h100envy/status/2070852290878009586#m
mehr auf Arint.info
#DeepSeek #Grok #LoopEngineering #RAG #SGLang #xAI #arint_info
-
Мы меняли LLM и промпты, а ошибка оказалась совсем в другом месте
Это бонусный материл в серии о внедрении LLM в клиентские сервисы. Если в прошлых трех статьях я подробно разбирал удачные моменты, архитектуру и правильные шаги, то этот текст решил целиком посвятить разбору наших ошибок и факапов. Сейчас – менее красивая часть и реальный опыт PM: что происходит после демо, когда AI-пилот пытаются превратить в промышленную систему и команда сталкивается со скрытыми техническими проблемами. На демо всё выглядело почти идеально. Бот отвечал живо, бизнес видел прогресс, команда сравнивала модели и крутила промпты. Потом пришли реальные пользователи, реальные данные и реальные ограничения. И выяснилось неприятное: мы лечили не то. В какой-то момент команда уже всерьёз обсуждала замену модели. Казалось, что проблема в качестве генерации: ответы были уверенные, но иногда неверные. После разбора логов оказалось, что в части диалогов LLM вообще не должна была отвечать. Routing отправлял пользователя в ветку answer, хотя API возвращал partial, а сценарий должен был уходить в handoff. Самые дорогие ошибки жили не в LLM. Они жили в routing, API, handoff, базе знаний, метриках и compliance-слое. Модель просто красиво озвучивала проблемы, которые система создала раньше. Перелом случился, когда мы перестали спрашивать: «Почему LLM ответила неправильно?» – и начали спрашивать иначе: «Почему система вообще поставила модель в ситуацию, где правильного ответа у неё быть не могло?» Вывод неприятный, но полезный: сильная LLM не компенсирует слабую архитектуру. Если у системы нет нормального routing, владельца knowledge base и понятного handoff, сравнение моделей часто становится дорогим отвлекающим манёвром.
https://habr.com/ru/companies/svoi_ru/articles/1056376/
#llm #ai_architecture #handoff #Knowledge_Base #AI_in_Fintech #rag #prompt_engineering #routing #api #enterprise_ai