#ollama — Public Fediverse posts
Live and recent posts from across the Fediverse tagged #ollama, aggregated by home.social.
-
Fit 32K to 128K LLM context into 16 GB VRAM by calculating KV cache cost, choosing cache precision, and tuning llama.cpp, vLLM, or Ollama safely.
#LLM #llamacpp #vLLM #Ollama #GPU #Self-Hosting #SelfHosting #NVidia #Hardware
https://www.glukhov.org/llm-performance/optimization/kv-cache-16gb-long-context/
-
Fit 32K to 128K LLM context into 16 GB VRAM by calculating KV cache cost, choosing cache precision, and tuning llama.cpp, vLLM, or Ollama safely.
#LLM #llamacpp #vLLM #Ollama #GPU #Self-Hosting #SelfHosting #NVidia #Hardware
https://www.glukhov.org/llm-performance/optimization/kv-cache-16gb-long-context/
-
Fit 32K to 128K LLM context into 16 GB VRAM by calculating KV cache cost, choosing cache precision, and tuning llama.cpp, vLLM, or Ollama safely.
#LLM #llamacpp #vLLM #Ollama #GPU #Self-Hosting #SelfHosting #NVidia #Hardware
https://www.glukhov.org/llm-performance/optimization/kv-cache-16gb-long-context/
-
Seems like #Ollama enshitified quite rapidly after its sucessful early years.
-
Никто не просил — а я сделал банку робота-секретаря
Я люблю решать нерешаемые проблемы , делать людям жизнь легче, тестить гипотезы , создавать крутые продукты . Так меня позвали работать в Уралсиб, где я решил создать робота-секретаря, помогающий со встречами и созвонами.
https://habr.com/ru/companies/uralsib/articles/1077456/
#роботсекретарь #транскрибация #whispercpp #диаризация #yandexgpt #WebRTC #ollama #Exchange_Web_Services #DimaTorzok #закрытый_контур
-
This weekend I installed #freebsd on a laptop. My goal is to make this my work laptop. In the past I used Ubuntu/Debian and MacOS. FreeBSD works great. Functional, basic, stable. It was a bit of a search for a simple ai coding agent. I ended up with crush. Works well with my local #ollama installation. But networking revealed it was 'phoning home'. A lot of software does that these days. Not only big tech. The pf firewall made it easy to end this behavior!
-
L'IA locale est la solution idéale et #Hermes associé à #Ollama, un logiciel libre, est une bonne configuration.
https://www.zdnet.fr/pratique/jai-teste-une-tonne-doutils-dia-locale-pour-mon-ordinateur-mais-hermes-ollama-est-desormais-mon-prefere-voici-pourquoi-496755.htm -
bei langen sessions hat ab 60k token die verarbeitung der anfragen unerträglich lange gedauert (>10min)
das ist die systemgrenze RAM schreibe geschwindigkeit
hab dann mal noch tiefer gegraben in ollama einstellungen: kv cache steht standarmäßig auf f16 - runterstellen auf q4 macht keinen qualitätsunterschied - braucht aber weniger RAM -> schneller
ki statemant:
Du hast recht, dass Q4-KV-Cache bei Q4-Modellen oft als "mach keinen Unterschied" abgetan wird. Aber die Recherche zeigt: bei Hybrid-Attention-Modellen wie Qwen3.5/3.8 ist es sogar nachweislich verlustfrei (BLEU 1.000, token-identischer Output). Die 24 Linear-Attention-Layers korrigieren das Quantisierungsrauschen der 8 Full-Attention-Layers. Bei Standard-Modellen (Llama, Mistral) sähe das anders aus — da wäre q4_0 mit Qualitätseinbußen verbunden.hier validiert mit code review
qwen3.8:27b Q4 KV Benchmark — Done ✅
Q4 KV-Cache war ein voller Erfolg:Metric ohne Q4 mit Q4 Delta
Gesamtzeit 9178s (2,5h) 5121s (85 min) 1,79x schneller
Task 1 (Core) 57,7 min 26,2 min 2,2x schneller
Task 4 (Persist) 50,3 min 11,9 min 4,2x schneller
Output 706 Zeilen 506 Zeilen etwas kompakter
Halluzinationen 0 0 gleich
Qualität bleibt gleich:
- Alle 4 KRITISCH-Funde gegen den Code verifiziert — 0 Halluzinationen
- Liest selbstständig proxy_server.py, memory.ts, logger.ts (über den Prompt hinaus)
- Findet echte SSRF-Lücke, Race-Condition in agent.ts, Backup-Binärdaten-Verlust, RenderPanel-Bridge-Hijack
- Output ist kompakter, aber dichter und präziser — keine Füll-SectionsFazit: Q4-KV ist ein klarer Win für qwen3.8. Gleiche Tiefe und Genauigkeit, fast halbe Zeit. Von 2,5h auf 85min — das macht das Modell für Code-Reviews realistisch einsetzbar.
-
🧪 LLM Benchmark Showdown: 5 lokale Ollama-Modelle im Vergleich
Getestet auf derselben Hardware (#gmktecevo2 #AMDRyzenAIMaxPlus395 #strixhalo):
• #GSM8K (100 Samples) — Math
• #BFCL (100/Kategorie) — Function Calling
• #MBPP+ (50) — Python Coding
• #HumanEval+ (20) — Python Coding📊 Ergebnisse (Accuracy / Output TK/s / VRAM):
**qwen3.8:27b**
GSM8K 82% | BFCL 91.5% | MBPP+ 100% | HE+ 100%
⚡ 25.5 TK/s | 💾 18 GB VRAM**qwen3.6:27b**
GSM8K 83% | BFCL 93% | MBPP+ 98% | HE+ 75%
⚡ 12.7 TK/s | 💾 33 GB VRAM**qwen3.6:35b**
GSM8K 84% | BFCL 90% | MBPP+ 98% | HE+ 55%
⚡ 61.8 TK/s | 💾 27 GB VRAM**ornith-1.5:35b**
GSM8K 75% | BFCL 92.5% | MBPP+ 78% | HE+ 0%
⚡ 63.6 TK/s | 💾 26 GB VRAM**nemotron-3.5-lightning:30b**
GSM8K 59% | BFCL 74% | MBPP+ 94% | HE+ 0%
⚡ 91.9 TK/s | 💾 26 GB VRAM🏆 Fazit:
qwen3.8:27b ist der klare Sieger — als einziges Modell 100% bei beiden Coding-Benchmarks, bei GSM8K/BFCL gleichauf mit den anderen Qwen-Modellen. Bei 25.5 TK/s und nur 18 GB VRAM das beste Qualität/Speed/Effizienz-Verhältnis.
qwen3.6:27b ist qualitativ nah dran (BFCL sogar 93%), aber mit 12.7 TK/s unerträglich langsam und frisst 33 GB VRAM — fast 2× so viel wie qwen3.8 bei halber Speed.
qwen3.6:35b ist mit 61.8 TK/s 2.4× schneller als qwen3.8, aber HE+ nur 55% (vs 100%). Trading Code-Qualität für Speed.
ornith-1.5:35b und nemotron-3.5-lightning:30b fallen bei Coding komplett durch (HE+ 0%), sind aber die schnellsten Modelle im Feld (64 / 92 TK/s).
💡 TK/s = generierte Tokens/Sekunde (Warm-Run, ollama --verbose).
💾 VRAM = GPU-Speicher bei max context (262K bzw. 1M bei nemotron). -
[Перевод] Qwen3.8-27B: лучший локальный LLM, который вы, вероятно, не сможете запустить
В этом месяце Alibaba выпустила две модели, и та, о которой все писали, оказалась не той, что мы ждали. Qwen3.8-Max — это API с 2,4 триллионами параметров, и пару недель назад я с большим энтузиазмом написал о ней обзор. Но релиз, которого я действительно ждал, вышел 14 августа: Qwen3.8-27B, Apache 2.0, веса на Hugging Face, модель достаточно компактна, чтобы работать на ноутбуке. Я должен кое в чем признаться. Я не провел полный тест этой модели. Я попробовал, на своем MacBook Air M4 получал около восьми токенов в секунду и потерял терпение где-то на втором запросе. По большей части этот пост посвящен именно моей неудаче, потому что я подозреваю, что у многих из вас вечер сложится так же, как у меня. Что представляет собой Qwen3.8-27B на самом деле 27,78 миллиарда параметров, плотная модель, включающая в себя визуальный энкодер, о котором никто не объявлял заранее. Принимает на вход текст, изображения и видео. Собственный контекст — 262 144 токена, с помощью YaRN можно увеличить его примерно до миллиона, если запускать модель на сервере. Архитектура — это по-настоящему интересная часть, и это не обычный трансформер. На протяжении 64 слоёв Qwen чередует 48 слоёв Gated DeltaNet (линейное внимание) с 16 полными слоями Gated Attention в соотношении 3:1. Только эти 16 слоёв с полным вниманием имеют KV-кэш. Таким образом, на каждый токен приходится около 64 КБ, что составляет примерно четверть от объёма памяти, необходимого для обычной 64-слойной модели с плотным кодированием. Если вы запомните только одно число из этого поста, пусть это будет именно оно. Всё, что касается того, поместится ли эта модель на вашем компьютере, зависит от объёма KV-кэша.
-
Open-WebUI: User-friendly AI Interface, supports Ollama, OpenAI API.
https://github.com/open-webui/open-webui
#GenAI #SelfHosted #LLM #Ollama #AIInterface -
Open-WebUI: User-friendly AI Interface, supports Ollama, OpenAI API.
https://github.com/open-webui/open-webui
#GenAI #SelfHosted #LLM #Ollama #AIInterface -
Come Scegliere il Miglior Mini PC per l'AI Locale nel 2026: Strix Halo vs DGX Spark vs Mac
Un mini PC grande quanto un libro tascabile è oggi in grado di eseguire localmente un modello da 200 miliardi di parametri. Ma la scelta non dipende solo dal prezzo. La capacità della memoria determina quali modelli possono essere caricati, la larghezza di banda influisce sulla velocità di esecuzione e lo stack software — CUDA, ROCm o Metal — stabilisce se gli strumenti che utilizi funzioneranno davvero. Ecco un confronto tra le quattro principali opzioni disponibili nel 2026, con prezzi e benchmark aggiornati.
buysellram.com/blog/how-to-cho…
#AIlocale #LLM #MiniPC #HardwareAI #StrixHalo #DGXSpark #AppleSilicon #EdgeAI #InfrastrutturaAI #Ollama #RyzenAI #AIPC #AMD #NVIDIA #Apple
-
Choosing A mini PC isn't about the lowest price tag. Capacity sets what fits, bandwidth sets how fast it runs, and the software stack — CUDA, ROCm, or Metal — decides whether your tools work at all. Here's how the four real options compare in 2026, with current prices and benchmarks.
https://www.buysellram.com/blog/how-to-choose-the-best-mini-pc-for-local-ai-in-2026/
#LocalAI #LLM #MiniPC #AIhardware #StrixHalo #DGXSpark #AppleSilicon #EdgeAI #AIinfrastructure #Ollama #RyzenAI #AIPC #AMD #NVIDIA -
AMD Ryzen AI Max+ 395 vs Nvidia DGX Spark vs Apple Mac — plus when a GPU tower still beats all three. A practical hardware guide for IT managers, developers, and small-business owners weighing a local LLM machine.
Running large language models locally went from a niche hobby to a real procurement question in 2026. A mini PC the size of a paperback can now hold a 200-billion-parameter model — the kind of workload that used to need a server rack.
But picking one isn't about the lowest price. Three things decide whether a model runs well: memory capacity (what fits), memory bandwidth (how fast it runs), and the software ecosystem — CUDA, ROCm, or Metal — that determines whether your existing tools work at all.
There are four real ways to run a local LLM on your desk: a discrete-GPU tower (fastest, but a VRAM wall), AMD Strix Halo mini PCs (big unified memory, cheap, Windows-native), Nvidia's GB10 boxes like the DGX Spark and Dell Pro Max (CUDA, but now $4,699 and Linux-only), and Apple's Mac mini and Mac Studio (high bandwidth, silent, no CUDA).
This guide breaks down which fits which job — with verified specs and current prices.
An appendix at the end collects what early buyers of the AMD “lunchbox” are actually reporting.
https://www.buysellram.com/blog/how-to-choose-the-best-mini-pc-for-local-ai-in-2026/
#LocalAI #LLM #MiniPC #AIhardware #StrixHalo #DGXSpark #AppleSilicon #EdgeAI #AIinfrastructure #Ollama #RyzenAI #AIPC #AMD #NVIDIA #Apple #technology -
Искусственный интеллект с LangChain. Разработка ИИ-агентов на Python
Представляем новый
https://habr.com/ru/companies/bhv_publishing/articles/1047522/
#langchain #ии #llm #python #нейросети #программирование #rag #gigachat #yandexgpt #ollama
-
Токенная разработка: почему я плачу $200 в месяц, а не $800 за устаревшее железо
$800 на видеокарту которая устареет через год или $200/мес с доступом к frontier-моделям? Вот мои цифры
https://habr.com/ru/articles/1030678/
#LLM #API #токены #GPU #локальные_модели #Ollama #tokenomics #AI_разработка #стоимость_разработки
-
Souveräne Enterprise KI in Tagen statt Monaten mit Infinito.Nexus
Der gezeigte Post steht exemplarisch für eine Entwicklung, die aktuell in vielen Unternehmen zu beobachten ist. Es werden kurzfristig KI Entwicklerinnen und Entwickler gesucht, die ein breites Spektrum abdecken, von LLM Integration über RAG bis hin zu produktiven Pipelines und skalierbaren Cloud und Container Umgebungen. Der Bedarf ist hoch, die Anforderungen komplex und die Zeitfenster meist sehr eng. Dabei zeigt sich immer wieder, dass die eigentliche Herausforderung nicht nur im Finden einzelner Expertinnen und Experten liegt, sondern in der fehlenden technischen Grundlage, um solche Lösungen schnell, sicher und nachhaltig umzusetzen. […] -
🚀 Discover the Slimbook ONE with AI: designed for the new era of computing with artificial intelligence.
Powered by the AMD AI9 HX 370, the Slimbook ONE delivers up to 80 TOPS of AI performance with CPU + NPU. 👀 But that’s not all: by connecting the eGPU dock with an RTX 5060, 5070, or 5080, you can reach up to 1500 TOPS, taking your AI agents and local workflows to the next level.
👉 https://slimbook.com/en/one
#Slimbook #One #eGPU #AIAgents #Ollama #OpenClaw #RyzenAI -
̶К̶у̶п̶а̶н̶и̶е̶ тестирование «красного» ̶к̶о̶н̶я̶ представителя GPU от АМД с приставкой ИИ — RADEON AI PRO R9700
Тестировать друг за другом видеокарты от NVIDIA надоедает, благо разница в последнем поколении только в мощностях процессоров семейства Blackwell, объеме памяти и ширине шины. А вот посмотреть, что предлагают конкуренты, а тем более громко называя это «ИИ», уже интересней. Мы проверили Radeon AI PRO R9700 с 32 Гб памяти на реальных задачах: LLM, генерация графики и видео, 3D-рендеринг, и сравнили с NVIDIA.
https://habr.com/ru/companies/hostkey/articles/991780/
#hostkey #Radeon_AI_PRO_R9700 #ROCm #инференс_LLM #генеративный_ИИ #видеокарта #NVIDIA_RTX #Ollama #RDNA_4 #GDDR6
-
Dự án Local LLM trên Raspberry Pi 5 với Ollama, chạy mượt các model như EXAONE 3.5 2.4B và Qwen3 1.7B chỉ với 4GB RAM. Thiết lập đầy đủ dễ dàng, phù hợp phát triển trợ lý ảo cục bộ.
#RaspberryPi5 #LocalLLM #Ollama #AI #EdgeComputing #TríTuệNhânTạo #IoT #MáyHọc #AIcựcNhẹ #RaspberryPihttps://www.reddit.com/r/LocalLLaMA/comments/1q4t6v5/raspberry_pi_5_local_llm_project/
-
I've done some #vibehosting yesterday... I couldn't be bothered investigating why #fail2ban keeps banning my IP after fetching emails from my email server, so I've decided to delegate my issues to #ollama.
I've set a knowledge base with all the necessary config and log files, etc, and asked #QwQ to investigate... Since it's a #localLLM, I had no issues submitting even the most sensitive information to it.
QwQ did come up with tailored suggestions on how to fix the problem. #openwebui
-
When our backup #pump failed on the #Oregon #homestead, I built a #calculator to figure out what we really needed. It’s a small, #opensource tool born from necessity and a few iterations with #SelfHosted #ai
https://sij.law/thinking-like-a-developer-pt-1/
#python #code #devops #Oregon #water #ollama #qwq #selfhosting #aiml
-
Wow, QwQ 32b by the Qwen team is the first local LLM I've tested that correctly answers my favorite test question. Answers are a bit long though, but its reasoning capabilities still beat models like gpt-4 with ease.
"Please count to ten, skipping any number ending in 'e'."
#ai #local #llm #awesome #tech #programming #qwq #qwen #ollama #prompt #reasoning