#ollama — Public Fediverse posts
Live and recent posts from across the Fediverse tagged #ollama, aggregated by home.social.
-
Compare AMD ROCm and Vulkan backends for llama.cpp, Ollama, LM Studio, vLLM and TGI, with build commands, verification checks and a practical 2026 verdict.
#LLM #SelfHosting #llamacpp #Ollama #vLLM #Docker #Linux
https://www.glukhov.org/llm-hosting/comparisons/amd-rocm-vs-vulkan-llm-hosting/
-
Compare AMD ROCm and Vulkan backends for llama.cpp, Ollama, LM Studio, vLLM and TGI, with build commands, verification checks and a practical 2026 verdict.
#LLM #SelfHosting #llamacpp #Ollama #vLLM #Docker #Linux
https://www.glukhov.org/llm-hosting/comparisons/amd-rocm-vs-vulkan-llm-hosting/
-
Compare AMD ROCm and Vulkan backends for llama.cpp, Ollama, LM Studio, vLLM and TGI, with build commands, verification checks and a practical 2026 verdict.
#LLM #SelfHosting #llamacpp #Ollama #vLLM #Docker #Linux
https://www.glukhov.org/llm-hosting/comparisons/amd-rocm-vs-vulkan-llm-hosting/
-
Compare AMD ROCm and Vulkan backends for llama.cpp, Ollama, LM Studio, vLLM and TGI, with build commands, verification checks and a practical 2026 verdict.
#LLM #SelfHosting #llamacpp #Ollama #vLLM #Docker #Linux
https://www.glukhov.org/llm-hosting/comparisons/amd-rocm-vs-vulkan-llm-hosting/
-
Compare AMD ROCm and Vulkan backends for llama.cpp, Ollama, LM Studio, vLLM and TGI, with build commands, verification checks and a practical 2026 verdict.
#LLM #SelfHosting #llamacpp #Ollama #vLLM #Docker #Linux
https://www.glukhov.org/llm-hosting/comparisons/amd-rocm-vs-vulkan-llm-hosting/
-
Два года, один человек, 66 контейнеров: как я построил AI‑платформу на железе под столом
Привет, Хабр. 26 августа 2024 года я получил у BotFather первый токен и написал кривой телеграм‑бот с одной моделью — обычная история «хочу ChatGPT без танцев с бубном, сделаю себе сам». Бот был честно плохой: одна модель, никакого контекста, падал от длинных сообщений. Но он работал, им начали пользоваться дети и знакомые, и я решил «немного доделать». «Немного доделать» продолжается второй год. Сейчас это платформа с веб‑приложением, шестью каналами доставки (Telegram, VK, MAX, Discord, веб и — для уведомлений и результатов долгих задач — email), биллингом, голосовым агентом и RAG по документам. А под ней — 66 контейнеров на двух нодах, BGP‑маршрутизация, собственный CI, хелпдеск и GPU‑нода с локальными моделями. Всё на железе, которое стоит под столом и потребляло меньше, чем игровая приставка, — до недавнего появления второй ноды с 3090; теперь приставка нервно курит. Эта статья — про то, во что превращается домашняя инфраструктура, когда backend‑разработчик два года не может остановиться. Пишу это по двум причинам. Во‑первых, когда я начинал, мне отчаянно не хватало такой статьи — целостной картины, как это выглядит, когда селф‑хостишь ВСЁ. Во‑вторых, я почти наверняка делаю что‑то не так, и комментарии Хабра — самый быстрый способ об этом узнать. Не стесняйтесь.
https://habr.com/ru/articles/1080138/
#selfhosted #домашний_сервер #docker #mikrotik #bgp #postgresql #prometheus #gitea #gpu #ollama
-
Два года, один человек, 66 контейнеров: как я построил AI‑платформу на железе под столом
Привет, Хабр. 26 августа 2024 года я получил у BotFather первый токен и написал кривой телеграм‑бот с одной моделью — обычная история «хочу ChatGPT без танцев с бубном, сделаю себе сам». Бот был честно плохой: одна модель, никакого контекста, падал от длинных сообщений. Но он работал, им начали пользоваться дети и знакомые, и я решил «немного доделать». «Немного доделать» продолжается второй год. Сейчас это платформа с веб‑приложением, шестью каналами доставки (Telegram, VK, MAX, Discord, веб и — для уведомлений и результатов долгих задач — email), биллингом, голосовым агентом и RAG по документам. А под ней — 66 контейнеров на двух нодах, BGP‑маршрутизация, собственный CI, хелпдеск и GPU‑нода с локальными моделями. Всё на железе, которое стоит под столом и потребляло меньше, чем игровая приставка, — до недавнего появления второй ноды с 3090; теперь приставка нервно курит. Эта статья — про то, во что превращается домашняя инфраструктура, когда backend‑разработчик два года не может остановиться. Пишу это по двум причинам. Во‑первых, когда я начинал, мне отчаянно не хватало такой статьи — целостной картины, как это выглядит, когда селф‑хостишь ВСЁ. Во‑вторых, я почти наверняка делаю что‑то не так, и комментарии Хабра — самый быстрый способ об этом узнать. Не стесняйтесь.
https://habr.com/ru/articles/1080138/
#selfhosted #домашний_сервер #docker #mikrotik #bgp #postgresql #prometheus #gitea #gpu #ollama
-
Два года, один человек, 66 контейнеров: как я построил AI‑платформу на железе под столом
Привет, Хабр. 26 августа 2024 года я получил у BotFather первый токен и написал кривой телеграм‑бот с одной моделью — обычная история «хочу ChatGPT без танцев с бубном, сделаю себе сам». Бот был честно плохой: одна модель, никакого контекста, падал от длинных сообщений. Но он работал, им начали пользоваться дети и знакомые, и я решил «немного доделать». «Немного доделать» продолжается второй год. Сейчас это платформа с веб‑приложением, шестью каналами доставки (Telegram, VK, MAX, Discord, веб и — для уведомлений и результатов долгих задач — email), биллингом, голосовым агентом и RAG по документам. А под ней — 66 контейнеров на двух нодах, BGP‑маршрутизация, собственный CI, хелпдеск и GPU‑нода с локальными моделями. Всё на железе, которое стоит под столом и потребляло меньше, чем игровая приставка, — до недавнего появления второй ноды с 3090; теперь приставка нервно курит. Эта статья — про то, во что превращается домашняя инфраструктура, когда backend‑разработчик два года не может остановиться. Пишу это по двум причинам. Во‑первых, когда я начинал, мне отчаянно не хватало такой статьи — целостной картины, как это выглядит, когда селф‑хостишь ВСЁ. Во‑вторых, я почти наверняка делаю что‑то не так, и комментарии Хабра — самый быстрый способ об этом узнать. Не стесняйтесь.
https://habr.com/ru/articles/1080138/
#selfhosted #домашний_сервер #docker #mikrotik #bgp #postgresql #prometheus #gitea #gpu #ollama
-
Friendly reminder that smaller local models have a huge role to play in modern workflows! 🤖💡I use local small LLMs (via Ollama) as a dedicated offline brainstorming partner to pitch niche article ideas. I save the larger cloud models strictly for final execution and drafting. Keeps my main machine responsive, costs zero API tokens for ideation, and keeps the workflow super efficient. #LocalAI #Ollama #SelfHosted #StaticSite #WebDev
-
Fit 32K to 128K LLM context into 16 GB VRAM by calculating KV cache cost, choosing cache precision, and tuning llama.cpp, vLLM, or Ollama safely.
#LLM #llamacpp #vLLM #Ollama #GPU #Self-Hosting #SelfHosting #NVidia #Hardware
https://www.glukhov.org/llm-performance/optimization/kv-cache-16gb-long-context/
-
Fit 32K to 128K LLM context into 16 GB VRAM by calculating KV cache cost, choosing cache precision, and tuning llama.cpp, vLLM, or Ollama safely.
#LLM #llamacpp #vLLM #Ollama #GPU #Self-Hosting #SelfHosting #NVidia #Hardware
https://www.glukhov.org/llm-performance/optimization/kv-cache-16gb-long-context/
-
Fit 32K to 128K LLM context into 16 GB VRAM by calculating KV cache cost, choosing cache precision, and tuning llama.cpp, vLLM, or Ollama safely.
#LLM #llamacpp #vLLM #Ollama #GPU #Self-Hosting #SelfHosting #NVidia #Hardware
https://www.glukhov.org/llm-performance/optimization/kv-cache-16gb-long-context/
-
Seems like #Ollama enshitified quite rapidly after its sucessful early years.
-
Никто не просил — а я сделал банку робота-секретаря
Я люблю решать нерешаемые проблемы , делать людям жизнь легче, тестить гипотезы , создавать крутые продукты . Так меня позвали работать в Уралсиб, где я решил создать робота-секретаря, помогающий со встречами и созвонами.
https://habr.com/ru/companies/uralsib/articles/1077456/
#роботсекретарь #транскрибация #whispercpp #диаризация #yandexgpt #WebRTC #ollama #Exchange_Web_Services #DimaTorzok #закрытый_контур
-
This weekend I installed #freebsd on a laptop. My goal is to make this my work laptop. In the past I used Ubuntu/Debian and MacOS. FreeBSD works great. Functional, basic, stable. It was a bit of a search for a simple ai coding agent. I ended up with crush. Works well with my local #ollama installation. But networking revealed it was 'phoning home'. A lot of software does that these days. Not only big tech. The pf firewall made it easy to end this behavior!
-
bei langen sessions hat ab 60k token die verarbeitung der anfragen unerträglich lange gedauert (>10min)
das ist die systemgrenze RAM schreibe geschwindigkeit
hab dann mal noch tiefer gegraben in ollama einstellungen: kv cache steht standarmäßig auf f16 - runterstellen auf q4 macht keinen qualitätsunterschied - braucht aber weniger RAM -> schneller
ki statemant:
Du hast recht, dass Q4-KV-Cache bei Q4-Modellen oft als "mach keinen Unterschied" abgetan wird. Aber die Recherche zeigt: bei Hybrid-Attention-Modellen wie Qwen3.5/3.8 ist es sogar nachweislich verlustfrei (BLEU 1.000, token-identischer Output). Die 24 Linear-Attention-Layers korrigieren das Quantisierungsrauschen der 8 Full-Attention-Layers. Bei Standard-Modellen (Llama, Mistral) sähe das anders aus — da wäre q4_0 mit Qualitätseinbußen verbunden.hier validiert mit code review
qwen3.8:27b Q4 KV Benchmark — Done ✅
Q4 KV-Cache war ein voller Erfolg:Metric ohne Q4 mit Q4 Delta
Gesamtzeit 9178s (2,5h) 5121s (85 min) 1,79x schneller
Task 1 (Core) 57,7 min 26,2 min 2,2x schneller
Task 4 (Persist) 50,3 min 11,9 min 4,2x schneller
Output 706 Zeilen 506 Zeilen etwas kompakter
Halluzinationen 0 0 gleich
Qualität bleibt gleich:
- Alle 4 KRITISCH-Funde gegen den Code verifiziert — 0 Halluzinationen
- Liest selbstständig proxy_server.py, memory.ts, logger.ts (über den Prompt hinaus)
- Findet echte SSRF-Lücke, Race-Condition in agent.ts, Backup-Binärdaten-Verlust, RenderPanel-Bridge-Hijack
- Output ist kompakter, aber dichter und präziser — keine Füll-SectionsFazit: Q4-KV ist ein klarer Win für qwen3.8. Gleiche Tiefe und Genauigkeit, fast halbe Zeit. Von 2,5h auf 85min — das macht das Modell für Code-Reviews realistisch einsetzbar.
-
🧪 LLM Benchmark Showdown: 5 lokale Ollama-Modelle im Vergleich
Getestet auf derselben Hardware (#gmktecevo2 #AMDRyzenAIMaxPlus395 #strixhalo):
• #GSM8K (100 Samples) — Math
• #BFCL (100/Kategorie) — Function Calling
• #MBPP+ (50) — Python Coding
• #HumanEval+ (20) — Python Coding📊 Ergebnisse (Accuracy / Output TK/s / VRAM):
**qwen3.8:27b**
GSM8K 82% | BFCL 91.5% | MBPP+ 100% | HE+ 100%
⚡ 25.5 TK/s | 💾 18 GB VRAM**qwen3.6:27b**
GSM8K 83% | BFCL 93% | MBPP+ 98% | HE+ 75%
⚡ 12.7 TK/s | 💾 33 GB VRAM**qwen3.6:35b**
GSM8K 84% | BFCL 90% | MBPP+ 98% | HE+ 55%
⚡ 61.8 TK/s | 💾 27 GB VRAM**ornith-1.5:35b**
GSM8K 75% | BFCL 92.5% | MBPP+ 78% | HE+ 0%
⚡ 63.6 TK/s | 💾 26 GB VRAM**nemotron-3.5-lightning:30b**
GSM8K 59% | BFCL 74% | MBPP+ 94% | HE+ 0%
⚡ 91.9 TK/s | 💾 26 GB VRAM🏆 Fazit:
qwen3.8:27b ist der klare Sieger — als einziges Modell 100% bei beiden Coding-Benchmarks, bei GSM8K/BFCL gleichauf mit den anderen Qwen-Modellen. Bei 25.5 TK/s und nur 18 GB VRAM das beste Qualität/Speed/Effizienz-Verhältnis.
qwen3.6:27b ist qualitativ nah dran (BFCL sogar 93%), aber mit 12.7 TK/s unerträglich langsam und frisst 33 GB VRAM — fast 2× so viel wie qwen3.8 bei halber Speed.
qwen3.6:35b ist mit 61.8 TK/s 2.4× schneller als qwen3.8, aber HE+ nur 55% (vs 100%). Trading Code-Qualität für Speed.
ornith-1.5:35b und nemotron-3.5-lightning:30b fallen bei Coding komplett durch (HE+ 0%), sind aber die schnellsten Modelle im Feld (64 / 92 TK/s).
💡 TK/s = generierte Tokens/Sekunde (Warm-Run, ollama --verbose).
💾 VRAM = GPU-Speicher bei max context (262K bzw. 1M bei nemotron). -
Come Scegliere il Miglior Mini PC per l'AI Locale nel 2026: Strix Halo vs DGX Spark vs Mac
Un mini PC grande quanto un libro tascabile è oggi in grado di eseguire localmente un modello da 200 miliardi di parametri. Ma la scelta non dipende solo dal prezzo. La capacità della memoria determina quali modelli possono essere caricati, la larghezza di banda influisce sulla velocità di esecuzione e lo stack software — CUDA, ROCm o Metal — stabilisce se gli strumenti che utilizi funzioneranno davvero. Ecco un confronto tra le quattro principali opzioni disponibili nel 2026, con prezzi e benchmark aggiornati.
buysellram.com/blog/how-to-cho…
#AIlocale #LLM #MiniPC #HardwareAI #StrixHalo #DGXSpark #AppleSilicon #EdgeAI #InfrastrutturaAI #Ollama #RyzenAI #AIPC #AMD #NVIDIA #Apple
-
Choosing A mini PC isn't about the lowest price tag. Capacity sets what fits, bandwidth sets how fast it runs, and the software stack — CUDA, ROCm, or Metal — decides whether your tools work at all. Here's how the four real options compare in 2026, with current prices and benchmarks.
https://www.buysellram.com/blog/how-to-choose-the-best-mini-pc-for-local-ai-in-2026/
#LocalAI #LLM #MiniPC #AIhardware #StrixHalo #DGXSpark #AppleSilicon #EdgeAI #AIinfrastructure #Ollama #RyzenAI #AIPC #AMD #NVIDIA -
Токенная разработка: почему я плачу $200 в месяц, а не $800 за устаревшее железо
$800 на видеокарту которая устареет через год или $200/мес с доступом к frontier-моделям? Вот мои цифры
https://habr.com/ru/articles/1030678/
#LLM #API #токены #GPU #локальные_модели #Ollama #tokenomics #AI_разработка #стоимость_разработки
-
AI для умного дома: что уже работает сегодня (часть 1)
В статье — не просто список инструментов, а как они сочетаются , какие подводные камни ждут при развёртывании, какие цифры можно ожидать по производительности и как обойти ограничения Llama 8B без облачных кредитов.
https://habr.com/ru/articles/1014246/
#умный_дом #Home_Assistant #Ollama #OpenClaw #MCP #LLM #локальный_AI #Whisper #n8n #голосовое_управление
-
(Linux news in previous posts)
FOSS NEWS
Mozilla is packing new features into Firefox:
https://betanews.com/article/mozilla-is-packing-new-features-into-firefox/Is Firefox getting a new logo? Mozilla’s socials suggest so…:
https://www.omgubuntu.co.uk/2026/03/is-firefox-about-to-get-a-new-logoSignal introduces group member labels, allowing you to specify your role or responsibility:
https://alternativeto.net/news/2026/3/signal-introduces-group-member-labels-allowing-you-to-specify-your-role-or-responsibility/Blender 5.1 Open-Source 3D Graphics Software Released with Many New Features:
https://9to5linux.com/blender-5-1-open-source-3d-graphics-software-released-with-many-new-featuresLibreOffice 26.8 To Add A Donation Banner To Its Start Center:
https://www.phoronix.com/news/LibreOffice-26-Donation-BannerMozilla Releases Llamafile 0.10 To Enhance Their AI Offering For Easy-To-Use LLMs:
https://www.phoronix.com/news/Mozilla-AI-Llamafile-0.10Ollama integration brings all models to OpenClaw platform:
https://alternativeto.net/news/2026/3/ollama-integration-brings-all-models-to-openclaw-platform/OpenShot 3.5 is (yet again) the ‘biggest’ and ‘fastest’ release ever:
https://www.omgubuntu.co.uk/2026/03/openshot-3-5-releasedBitwarden Send improves security with email verification for paid users:
https://alternativeto.net/news/2026/3/bitwarden-send-improves-security-with-email-verification-for-paid-users/SuperTux 0.7.0 Arcade Game Is Out with Complete Level Design, Revamped Graphics:
https://9to5linux.com/supertux-0-7-0-arcade-game-is-out-with-complete-level-design-revamped-graphicsPlayStation 3 emulator RPCS3 gets easier to use with Steam:
https://www.gamingonlinux.com/2026/03/playstation-3-emulator-rpcs3-gets-easier-to-use-with-steam/OpenTTD devs clarify store changes with Transport Tycoon Deluxe re-release as Atari contribute server funding:
https://www.gamingonlinux.com/2026/03/openttd-devs-clarify-store-changes-with-transport-tycoon-deluxe-re-release-as-atari-contribute-server-funding/GNUnet 0.27 Released For Those With "Some Reasonable Pain Tolerance":
https://www.phoronix.com/news/GNUnet-0.27-ReleasedImmich 2.6 improves map side panel, asset viewer, shared link slugs & presets, and more:
https://alternativeto.net/news/2026/3/immich-2-6-improves-map-side-panel-asset-viewer-shared-link-slugs-and-presets-and-more/(more FOSS news in comments)
#WeeklyNews #OpenSource #FOSSNews #FOSS #OpenSourceNews #News #Firefox #Signal #Blender #LibreOffice #Llamafile #Ollama #OpenShot #Bitwarden #BitwardenSend #SuperTux #RPCS3 #OpenTTD #GNUnet #Immich #Browser #WebBrowser #VideoEditor #VideoEditing #ContentCreation #Gaming #FOSSGame #FOSSGaming #OpenSourceGame #PlayStation #PlayStation3 #FosseryTech
-
Hier mal eine Spezialfrage ins Netzwerk für alle die sich schon mal ein NAS selbst zusammen gebaut haben. Keine Ahnung, ob es Leute hier gibt.
Aktuell plane ich mit i5-14600T und Fraktal 804 - Macht es Sinn hier noch eine Graka mit einzubauen, um eine KI mit Ollama zu betreiben?
Das OS wird auf jeden Fall so Stand heute eine TrueNas Scale.
#nas #ollama #truenasscale #truenas #fraktal #grafikkarte #ki -
Stuck with messy, unstructured data? 😫 (Un)Perplexed Spready and AI to the rescue! ✨ Automate data extraction, categorization, and analysis. Drink coffee while AI works. ☕️ Find out how: https://matasoft.hr/qtrendcontrol/index.php/un-perplexed-spready
#AI #DataManagement #Productivity #SpreadsheetMagic #AIinSpreadsheets #DataDriven #Efficiency #Innovation #Ollama #SpreadsheetAI #DataAnalysis #Privacy #Spreadsheets #LLM #Innovation #AutomationRevolution
#StandardizationMadeEasy #CustomerInsights #ProductAnalysis #SentimentAnalysis #BI -
Need to classify products by description? 🤔 (Un)Perplexed Spready + AI can do it! Use `=ASK_LOCAL2` to compare product features, packaging and more. It's like having an AI assistant in your spreadsheet! 🤩 Check it out: https://matasoft.hr/qtrendcontrol/index.php/un-perplexed-spready
#AIinSpreadsheets #DataDriven #Efficiency #Innovation #AI #Ollama #SpreadsheetAI #DataAnalysis #Privacy #Spreadsheets #Productivity #LLM #Innovation #AutomationRevolution
#StandardizationMadeEasy #CustomerInsights #ProductAnalysis #SentimentAnalysis #MDM -
Run AI models locally within your spreadsheet! 🤯 (Un)Perplexed Spready's `ASK_LOCAL` formulas let you use Ollama models (Mistral, Llama2, OLMo2, Gamma3...) for offline data crunching. 💻 No API fees, complete privacy! 🔒 Try it now: https://matasoft.hr/qtrendcontrol/index.php/un-perplexed-spready
#AI #Ollama #SpreadsheetAI #DataAnalysis #Privacy #Spreadsheets #Productivity #LLM #Innovation #AutomationRevolution
#StandardizationMadeEasy #CustomerInsights #ProductAnalysis #Ollama #DataCategorization #BusinessInteligence #DataAnalytics -
Using Local AI models with .NET Aspire
https://devblogs.microsoft.com/dotnet/local-ai-models-with-dotnet-aspire/ -
How To Setup Ollama LLM AI Chabot With Open WebUI, An Open-source AI User Interface On An Ubuntu VPS https://youtu.be/hGgy2uaUvo4 #Websplaining #Ollama #OpenWebUI #DigitalOcean #AI #LLM #ML #ChatBot #AiChatBot #AiAssistant #OpenSource #AiModels #CharacterAI #CharacterAiModel #BaseModel #WebUI #UI #AiUserInterface #AiDashboard #VPS #Ubuntu #UbuntuLinux #VirtualPrivateServer #Cloud #CloudServer #Droplet #OllamaWithOpenWebUI #VirtualMachine #ArtificialIntelligence #MachineLearning #LargeLanguageModel
-
🔍 LightRAG: Comprehensive RAG System for Enhanced Information Processing #AI
• 🎯 Core Features: Implements four search modes (naive, local, global, hybrid) for context-aware information retrieval and knowledge processing #RAG
• 💾 Storage Options: Integrates with #Neo4j and #Oracle23ai for scalable knowledge graph management and data storage #Database
• 🔄 Model Support: Functions with #OpenAI, #HuggingFace, and #Ollama models for flexible deployment scenarios #LLM
• 🛠️ Development Tools: Features GUI interface, REST API server, and evaluation framework for system testing #DevTools
• 📈 Evaluation Results: Shows improved performance vs. traditional RAG systems in comprehensiveness, diversity & knowledge empowerment #Performance