#gemma_4 — Public Fediverse posts
Live and recent posts from across the Fediverse tagged #gemma_4, aggregated by home.social.
-
Мини‑ПК на Strix Halo под параллельной нагрузкой: 236 tok/s на 32 одновременных запросах и три ошибки
Один Beelink GTR9 Pro на Ryzen AI Max+ 395 выдал 236 tok/s суммарной генерации на 32 одновременных запросах в коротких прогонах и удержал в среднем 226 tok/s за 30 минут непрерывной нагрузки без тротлинга. По дороге к этим числам я нашёл воспроизводимый провал пропускной способности, который сначала выглядел свойством одной модели, увидел, как спекулятивный декодинг на моём стеке превращается из ускорителя в налог, и трижды чуть не опубликовал неверные выводы. Каждый раз спасали контрольные замеры, все три истории здесь, в статье. Харнессы, конфиги, полные таблицы, значения по каждому ключевому и финальному прогону, поминутные ряды выносливости и телеметрия лежат в открытом репозитории . Логи отдельных запросов харнесс не вёл, поэтому пересчитать можно всё до уровня прогона, но не глубже. Числа сняты на одном конкретном стенде; что из этого переносится на другие стеки, а что нет, оговорено по ходу текста.
https://habr.com/ru/articles/1060520/
#Strix_Halo #Ryzen_AI_Max #llamacpp #локальные_LLM #инференс #бенчмарки #Vulkan #Gemma_4 #Qwen36 #спекулятивный_декодинг
-
Мини‑ПК на Strix Halo под параллельной нагрузкой: 236 tok/s на 32 одновременных запросах и три ошибки
Один Beelink GTR9 Pro на Ryzen AI Max+ 395 выдал 236 tok/s суммарной генерации на 32 одновременных запросах в коротких прогонах и удержал в среднем 226 tok/s за 30 минут непрерывной нагрузки без тротлинга. По дороге к этим числам я нашёл воспроизводимый провал пропускной способности, который сначала выглядел свойством одной модели, увидел, как спекулятивный декодинг на моём стеке превращается из ускорителя в налог, и трижды чуть не опубликовал неверные выводы. Каждый раз спасали контрольные замеры, все три истории здесь, в статье. Харнессы, конфиги, полные таблицы, значения по каждому ключевому и финальному прогону, поминутные ряды выносливости и телеметрия лежат в открытом репозитории . Логи отдельных запросов харнесс не вёл, поэтому пересчитать можно всё до уровня прогона, но не глубже. Числа сняты на одном конкретном стенде; что из этого переносится на другие стеки, а что нет, оговорено по ходу текста.
https://habr.com/ru/articles/1060520/
#Strix_Halo #Ryzen_AI_Max #llamacpp #локальные_LLM #инференс #бенчмарки #Vulkan #Gemma_4 #Qwen36 #спекулятивный_декодинг
-
Мини‑ПК на Strix Halo под параллельной нагрузкой: 236 tok/s на 32 одновременных запросах и три ошибки
Один Beelink GTR9 Pro на Ryzen AI Max+ 395 выдал 236 tok/s суммарной генерации на 32 одновременных запросах в коротких прогонах и удержал в среднем 226 tok/s за 30 минут непрерывной нагрузки без тротлинга. По дороге к этим числам я нашёл воспроизводимый провал пропускной способности, который сначала выглядел свойством одной модели, увидел, как спекулятивный декодинг на моём стеке превращается из ускорителя в налог, и трижды чуть не опубликовал неверные выводы. Каждый раз спасали контрольные замеры, все три истории здесь, в статье. Харнессы, конфиги, полные таблицы, значения по каждому ключевому и финальному прогону, поминутные ряды выносливости и телеметрия лежат в открытом репозитории . Логи отдельных запросов харнесс не вёл, поэтому пересчитать можно всё до уровня прогона, но не глубже. Числа сняты на одном конкретном стенде; что из этого переносится на другие стеки, а что нет, оговорено по ходу текста.
https://habr.com/ru/articles/1060520/
#Strix_Halo #Ryzen_AI_Max #llamacpp #локальные_LLM #инференс #бенчмарки #Vulkan #Gemma_4 #Qwen36 #спекулятивный_декодинг
-
Google、「Gemma 4 E2B for TPU」をお披露目 ~「Pixel 10」TPUでネイティブ動作する軽量AI/100%プライベート・オフラインで動くオフラインモデル。「Tensor SDK」ベータも
https://forest.watch.impress.co.jp/docs/news/2125152.html#forest_watch_impress #Pixel #Gemma #Gemma_4 #Gemma_4_E2B #Google_Tensor
-
Google、「Gemma 4 E2B for TPU」をお披露目 ~「Pixel 10」TPUでネイティブ動作する軽量AI/100%プライベート・オフラインで動くオフラインモデル。「Tensor SDK」ベータも
https://forest.watch.impress.co.jp/docs/news/2125152.html#forest_watch_impress #Pixel #Gemma #Gemma_4 #Gemma_4_E2B #Google_Tensor
-
Google、「Gemma 4 E2B for TPU」をお披露目 ~「Pixel 10」TPUでネイティブ動作する軽量AI/100%プライベート・オフラインで動くオフラインモデル。「Tensor SDK」ベータも
https://forest.watch.impress.co.jp/docs/news/2125152.html#forest_watch_impress #Pixel #Gemma #Gemma_4 #Gemma_4_E2B #Google_Tensor
-
Google、ローカルAIが4倍速くなるテキスト生成モデル「DiffusionGemma」を実験的に発表、逐次ではなく一括で生成/「GeForce RTX 5090」で700トークン/秒超を達成
https://forest.watch.impress.co.jp/docs/news/2116179.html#forest_watch_impress #Gemma #Google_DeepMind #Gemma_4 #DiffusionGemma #genai #文章生成 #AIコーディング #Gemini
-
Google、ローカルAIが4倍速くなるテキスト生成モデル「DiffusionGemma」を実験的に発表、逐次ではなく一括で生成/「GeForce RTX 5090」で700トークン/秒超を達成
https://forest.watch.impress.co.jp/docs/news/2116179.html#forest_watch_impress #Gemma #Google_DeepMind #Gemma_4 #DiffusionGemma #genai #文章生成 #AIコーディング #Gemini
-
Google、ローカルAIが4倍速くなるテキスト生成モデル「DiffusionGemma」を実験的に発表、逐次ではなく一括で生成/「GeForce RTX 5090」で700トークン/秒超を達成
https://forest.watch.impress.co.jp/docs/news/2116179.html#forest_watch_impress #Gemma #Google_DeepMind #Gemma_4 #DiffusionGemma #genai #文章生成 #AIコーディング #Gemini
-
「Gemma 4」のメモリ消費を大幅削減する「QAT」、品質はそのままスマホ上でも十分動作/最小の「E2B」は約1GB、最大の「31B」も1/4にまでメモリ削減
https://forest.watch.impress.co.jp/docs/news/2115073.html#forest_watch_impress #Gemma #Google_DeepMind #Gemma_4 #QAT #genai #文章生成 #AIコーディング #AIエージェント #Gemini
-
「Gemma 4」のメモリ消費を大幅削減する「QAT」、品質はそのままスマホ上でも十分動作/最小の「E2B」は約1GB、最大の「31B」も1/4にまでメモリ削減
https://forest.watch.impress.co.jp/docs/news/2115073.html#forest_watch_impress #Gemma #Google_DeepMind #Gemma_4 #QAT #genai #文章生成 #AIコーディング #AIエージェント #Gemini
-
「Gemma 4」のメモリ消費を大幅削減する「QAT」、品質はそのままスマホ上でも十分動作/最小の「E2B」は約1GB、最大の「31B」も1/4にまでメモリ削減
https://forest.watch.impress.co.jp/docs/news/2115073.html#forest_watch_impress #Gemma #Google_DeepMind #Gemma_4 #QAT #genai #文章生成 #AIコーディング #AIエージェント #Gemini
-
Специалист против универсала: GLM‑OCR читает таблицы, которые Gemma 4 выдумывала
Просишь локальную модель оцифровать таблицу с картинки — а она часть чисел тихо выдумывает. Да так гладко, что беглым взглядом не заметишь. Большая Gemma на мыльном скрине сочинила целую строку зарплат, а крошечная GLM-OCR на 0.9B ту же строку прочитала верно. Собрал из двух моделей один пайплайн и разобрался, где кому верить.
https://habr.com/ru/articles/1044522/
#GLMOCR #OCR #Gemma_4 #llamacpp #локальные_LLM #мультимодальные_модели #извлечение_данных_из_таблиц #распознавание_документов #пайплайн_моделей #MacBook_M3
-
Специалист против универсала: GLM‑OCR читает таблицы, которые Gemma 4 выдумывала
Просишь локальную модель оцифровать таблицу с картинки — а она часть чисел тихо выдумывает. Да так гладко, что беглым взглядом не заметишь. Большая Gemma на мыльном скрине сочинила целую строку зарплат, а крошечная GLM-OCR на 0.9B ту же строку прочитала верно. Собрал из двух моделей один пайплайн и разобрался, где кому верить.
https://habr.com/ru/articles/1044522/
#GLMOCR #OCR #Gemma_4 #llamacpp #локальные_LLM #мультимодальные_модели #извлечение_данных_из_таблиц #распознавание_документов #пайплайн_моделей #MacBook_M3
-
Специалист против универсала: GLM‑OCR читает таблицы, которые Gemma 4 выдумывала
Просишь локальную модель оцифровать таблицу с картинки — а она часть чисел тихо выдумывает. Да так гладко, что беглым взглядом не заметишь. Большая Gemma на мыльном скрине сочинила целую строку зарплат, а крошечная GLM-OCR на 0.9B ту же строку прочитала верно. Собрал из двух моделей один пайплайн и разобрался, где кому верить.
https://habr.com/ru/articles/1044522/
#GLMOCR #OCR #Gemma_4 #llamacpp #локальные_LLM #мультимодальные_модели #извлечение_данных_из_таблиц #распознавание_документов #пайплайн_моделей #MacBook_M3
-
Локальная Gemma 4 на MacBook читает графики и таблицы — и врёт красивее, чем говорит правду
MacBook M3, 16 ГБ, никакого облака. Поставил свежую Gemma 4, написал инструмент: кидаешь картинку с графиком или таблицей — получаешь CSV. Три кейса из семи — идеально. На остальных модель начала врать, причём аккуратнее, чем говорила правду: вместо рваных реальных чисел подсовывала гладкие выдуманные. Разобрал по шагам — сетап на маке, грабли с llama.cpp, сам инструмент — и собрал карту, где локальному зрению можно верить, а где оно тихо галлюцинирует
https://habr.com/ru/articles/1044400/
#Gemma_4 #llamacpp #локальные_LLM #мультимодальные_модели #OCR #извлечение_данных_из_графиков #visionмодели #MacBook_M3 #GGUF #визуализация_данных
-
Локальная Gemma 4 на MacBook читает графики и таблицы — и врёт красивее, чем говорит правду
MacBook M3, 16 ГБ, никакого облака. Поставил свежую Gemma 4, написал инструмент: кидаешь картинку с графиком или таблицей — получаешь CSV. Три кейса из семи — идеально. На остальных модель начала врать, причём аккуратнее, чем говорила правду: вместо рваных реальных чисел подсовывала гладкие выдуманные. Разобрал по шагам — сетап на маке, грабли с llama.cpp, сам инструмент — и собрал карту, где локальному зрению можно верить, а где оно тихо галлюцинирует
https://habr.com/ru/articles/1044400/
#Gemma_4 #llamacpp #локальные_LLM #мультимодальные_модели #OCR #извлечение_данных_из_графиков #visionмодели #MacBook_M3 #GGUF #визуализация_данных
-
Локальная Gemma 4 на MacBook читает графики и таблицы — и врёт красивее, чем говорит правду
MacBook M3, 16 ГБ, никакого облака. Поставил свежую Gemma 4, написал инструмент: кидаешь картинку с графиком или таблицей — получаешь CSV. Три кейса из семи — идеально. На остальных модель начала врать, причём аккуратнее, чем говорила правду: вместо рваных реальных чисел подсовывала гладкие выдуманные. Разобрал по шагам — сетап на маке, грабли с llama.cpp, сам инструмент — и собрал карту, где локальному зрению можно верить, а где оно тихо галлюцинирует
https://habr.com/ru/articles/1044400/
#Gemma_4 #llamacpp #локальные_LLM #мультимодальные_модели #OCR #извлечение_данных_из_графиков #visionмодели #MacBook_M3 #GGUF #визуализация_данных
-
Google、「Gemma 4 12B」を発表 ~16GBメモリのノートPCでもオンデバイス動作、上位モデルに迫る性能/エンコーダーフリーの新アーキテクチャー採用で実現
https://forest.watch.impress.co.jp/docs/news/2114296.html#forest_watch_impress #Gemma #Google_DeepMind #Gemma_4 #Gemma_4_12B #genai #文章生成 #AIコーディング #AIエージェント #Gemini
-
Google、「Gemma 4 12B」を発表 ~16GBメモリのノートPCでもオンデバイス動作、上位モデルに迫る性能/エンコーダーフリーの新アーキテクチャー採用で実現
https://forest.watch.impress.co.jp/docs/news/2114296.html#forest_watch_impress #Gemma #Google_DeepMind #Gemma_4 #Gemma_4_12B #genai #文章生成 #AIコーディング #AIエージェント #Gemini
-
Google、「Gemma 4 12B」を発表 ~16GBメモリのノートPCでもオンデバイス動作、上位モデルに迫る性能/エンコーダーフリーの新アーキテクチャー採用で実現
https://forest.watch.impress.co.jp/docs/news/2114296.html#forest_watch_impress #Gemma #Google_DeepMind #Gemma_4 #Gemma_4_12B #genai #文章生成 #AIコーディング #AIエージェント #Gemini
-
Google、「Gemma 4 12B」を発表 ~16GBメモリのノートPCでもオンデバイス動作、上位モデルに迫る性能/エンコーダーフリーの新アーキテクチャー採用で実現
https://forest.watch.impress.co.jp/docs/news/2114296.html#forest_watch_impress #Gemma #Google_DeepMind #Gemma_4 #Gemma_4_12B #genai #文章生成 #AIコーディング #AIエージェント #Gemini
-
Google、「Gemma 4 12B」を発表 ~16GBメモリのノートPCでもオンデバイス動作、上位モデルに迫る性能/エンコーダーフリーの新アーキテクチャー採用で実現
https://forest.watch.impress.co.jp/docs/news/2114296.html#forest_watch_impress #Gemma #Google_DeepMind #Gemma_4 #Gemma_4_12B #genai #文章生成 #AIコーディング #AIエージェント #Gemini
-
Новая модель с 12 млн токенов контекста, и обман Grok на $175 тыс
13-й выпуск IT-новостей от OpenIDE! Неделя получилась плотной: Grok потерял $175 тыс. без единой строки эксплойт-кода, европейские регуляторы выписали крупный GDPR-штраф «дочке» Яндекса, а Anthropic подписала сделку с куда более неожиданным партнёром. А ещё обновления маркетплейса OpenIDE, новая архитектура SubQ и 423 закрытых бага в Mozilla благодаря Claude Mythos.
https://habr.com/ru/companies/haulmont/articles/1034742/
#prompt_injection #Grok #Anthropic #Colossus #Claude_Code #Gemma_4 #Firefox #Mozilla #Claude_Mythos #OpenIDE
-
Новая модель с 12 млн токенов контекста, и обман Grok на $175 тыс
13-й выпуск IT-новостей от OpenIDE! Неделя получилась плотной: Grok потерял $175 тыс. без единой строки эксплойт-кода, европейские регуляторы выписали крупный GDPR-штраф «дочке» Яндекса, а Anthropic подписала сделку с куда более неожиданным партнёром. А ещё обновления маркетплейса OpenIDE, новая архитектура SubQ и 423 закрытых бага в Mozilla благодаря Claude Mythos.
https://habr.com/ru/companies/haulmont/articles/1034742/
#prompt_injection #Grok #Anthropic #Colossus #Claude_Code #Gemma_4 #Firefox #Mozilla #Claude_Mythos #OpenIDE
-
Новая модель с 12 млн токенов контекста, и обман Grok на $175 тыс
13-й выпуск IT-новостей от OpenIDE! Неделя получилась плотной: Grok потерял $175 тыс. без единой строки эксплойт-кода, европейские регуляторы выписали крупный GDPR-штраф «дочке» Яндекса, а Anthropic подписала сделку с куда более неожиданным партнёром. А ещё обновления маркетплейса OpenIDE, новая архитектура SubQ и 423 закрытых бага в Mozilla благодаря Claude Mythos.
https://habr.com/ru/companies/haulmont/articles/1034742/
#prompt_injection #Grok #Anthropic #Colossus #Claude_Code #Gemma_4 #Firefox #Mozilla #Claude_Mythos #OpenIDE
-
Топ локальных нейросетей ︎◍ 2026: подборка ИИ для запуска из дома
Сознаюсь: когда я впервые попытался запустить большую языковую модель на своём ноутбуке, всё закончилось вертушкой кулера, жутким лагом и системным сообщением “Недостаточно памяти”. Казалось, что домашний ИИ – удел владельцев космических станций с жидким азотом. Но прошло совсем немного времени, и ситуация изменилась до неузнаваемости. Теперь достаточно обычной RTX 3060 и получаса свободного вечера, чтобы завести себе персонального ассистента, который работает на даче без интернета и умеет шутить (или хотя бы пытается). Я расскажу обо всём по порядку – без воды и фанатизма. Что вообще запускать, на чём запускать, какие подводные камни ждут и почему “самая новая модель” дома – далеко не всегда лучший выбор. Поехали! Готовьте отвёртку и VRAM – мы начинаем!
https://habr.com/ru/companies/bothub/articles/1028906/
#gemma_4 #qwen36 #qwen35 #gptoss30b #mistral_7b #phi4 #deepseek_v32 #whisper #nemotron_cascade_2
-
Топ локальных нейросетей ︎◍ 2026: подборка ИИ для запуска из дома
Сознаюсь: когда я впервые попытался запустить большую языковую модель на своём ноутбуке, всё закончилось вертушкой кулера, жутким лагом и системным сообщением “Недостаточно памяти”. Казалось, что домашний ИИ – удел владельцев космических станций с жидким азотом. Но прошло совсем немного времени, и ситуация изменилась до неузнаваемости. Теперь достаточно обычной RTX 3060 и получаса свободного вечера, чтобы завести себе персонального ассистента, который работает на даче без интернета и умеет шутить (или хотя бы пытается). Я расскажу обо всём по порядку – без воды и фанатизма. Что вообще запускать, на чём запускать, какие подводные камни ждут и почему “самая новая модель” дома – далеко не всегда лучший выбор. Поехали! Готовьте отвёртку и VRAM – мы начинаем!
https://habr.com/ru/companies/bothub/articles/1028906/
#gemma_4 #qwen36 #qwen35 #gptoss30b #mistral_7b #phi4 #deepseek_v32 #whisper #nemotron_cascade_2
-
Топ локальных нейросетей ︎◍ 2026: подборка ИИ для запуска из дома
Сознаюсь: когда я впервые попытался запустить большую языковую модель на своём ноутбуке, всё закончилось вертушкой кулера, жутким лагом и системным сообщением “Недостаточно памяти”. Казалось, что домашний ИИ – удел владельцев космических станций с жидким азотом. Но прошло совсем немного времени, и ситуация изменилась до неузнаваемости. Теперь достаточно обычной RTX 3060 и получаса свободного вечера, чтобы завести себе персонального ассистента, который работает на даче без интернета и умеет шутить (или хотя бы пытается). Я расскажу обо всём по порядку – без воды и фанатизма. Что вообще запускать, на чём запускать, какие подводные камни ждут и почему “самая новая модель” дома – далеко не всегда лучший выбор. Поехали! Готовьте отвёртку и VRAM – мы начинаем!
https://habr.com/ru/companies/bothub/articles/1028906/
#gemma_4 #qwen36 #qwen35 #gptoss30b #mistral_7b #phi4 #deepseek_v32 #whisper #nemotron_cascade_2
-
Как мы перестали мерить качество ответов RAG-поиска «на глаз» и начали нормально сравнивать
Если вы делаете RAG-поиск по документации или базе знаний, то рано или поздно упираетесь в проблему: хорошо найти — это еще не хорошо ответить. База знаний, RAG, найденные чанки, LLM строит ответ. Но пользователь не знает ни про DCG, ни про Recall@10, ни про чанки вообще. Он видит только то, что написано в итоговом ответе. А проблемы начинаются именно здесь: модель может что-то проигнорировать, ответить на другом языке, добавить что-то от себя или выдать уверенный текст с иероглифами посередине. В прошлой статье мы разбирали, как улучшали сам retrieval: чанкование, метаданные, гибридный поиск, реранкинг. Но после того как с поиском более-менее разобрались, встал другой вопрос — как вообще понять, хороший ли ответ получает пользователь? Привет, меня зовут Дима, я делаю ИИ-функции в
-
Как мы перестали мерить качество ответов RAG-поиска «на глаз» и начали нормально сравнивать
Если вы делаете RAG-поиск по документации или базе знаний, то рано или поздно упираетесь в проблему: хорошо найти — это еще не хорошо ответить. База знаний, RAG, найденные чанки, LLM строит ответ. Но пользователь не знает ни про DCG, ни про Recall@10, ни про чанки вообще. Он видит только то, что написано в итоговом ответе. А проблемы начинаются именно здесь: модель может что-то проигнорировать, ответить на другом языке, добавить что-то от себя или выдать уверенный текст с иероглифами посередине. В прошлой статье мы разбирали, как улучшали сам retrieval: чанкование, метаданные, гибридный поиск, реранкинг. Но после того как с поиском более-менее разобрались, встал другой вопрос — как вообще понять, хороший ли ответ получает пользователь? Привет, меня зовут Дима, я делаю ИИ-функции в
-
Как мы перестали мерить качество ответов RAG-поиска «на глаз» и начали нормально сравнивать
Если вы делаете RAG-поиск по документации или базе знаний, то рано или поздно упираетесь в проблему: хорошо найти — это еще не хорошо ответить. База знаний, RAG, найденные чанки, LLM строит ответ. Но пользователь не знает ни про DCG, ни про Recall@10, ни про чанки вообще. Он видит только то, что написано в итоговом ответе. А проблемы начинаются именно здесь: модель может что-то проигнорировать, ответить на другом языке, добавить что-то от себя или выдать уверенный текст с иероглифами посередине. В прошлой статье мы разбирали, как улучшали сам retrieval: чанкование, метаданные, гибридный поиск, реранкинг. Но после того как с поиском более-менее разобрались, встал другой вопрос — как вообще понять, хороший ли ответ получает пользователь? Привет, меня зовут Дима, я делаю ИИ-функции в
-
[Перевод] Запускаю Gemma 4 локально в LM Studio: 51 токен/с и Claude Code без интернета
Ещё вчера для запуска 26-миллиардной нейросети нужен был дата-центр. Сегодня достаточно ноутбука и одной консольной команды. Встречайте: Google Gemma 4 26B-A4B. Модель, которая ломает старые правила. Архитектура mixture-of-experts (128 экспертов, 8 активных на токен) позволяет ей работать на скромных 48 ГБ объединённой памяти, выдавая при этом качество, сопоставимое с гигантами вроде Qwen 3.5 на 397B параметров. А LM Studio 0.4.0 только что сделала локальный запуск таких моделей по-настоящему удобным . Фоновый демон llmster , консольная утилита lms , непрерывный батчинг и – внимание! – эндпойнт, совместимый с Anthropic . Это значит, что вы можете направить Claude Code на свою локальную Gemma 4. Хотите узнать, как заставить эту связку летать? Как правильно рассчитать память под контекст в 256K токенов и почему спекулятивное декодирование — плохая идея для MoE? А главное — сколько это всё жрёт энергии и греет ли ваш Mac? Поехали!
-
[Перевод] Запускаю Gemma 4 локально в LM Studio: 51 токен/с и Claude Code без интернета
Ещё вчера для запуска 26-миллиардной нейросети нужен был дата-центр. Сегодня достаточно ноутбука и одной консольной команды. Встречайте: Google Gemma 4 26B-A4B. Модель, которая ломает старые правила. Архитектура mixture-of-experts (128 экспертов, 8 активных на токен) позволяет ей работать на скромных 48 ГБ объединённой памяти, выдавая при этом качество, сопоставимое с гигантами вроде Qwen 3.5 на 397B параметров. А LM Studio 0.4.0 только что сделала локальный запуск таких моделей по-настоящему удобным . Фоновый демон llmster , консольная утилита lms , непрерывный батчинг и – внимание! – эндпойнт, совместимый с Anthropic . Это значит, что вы можете направить Claude Code на свою локальную Gemma 4. Хотите узнать, как заставить эту связку летать? Как правильно рассчитать память под контекст в 256K токенов и почему спекулятивное декодирование — плохая идея для MoE? А главное — сколько это всё жрёт энергии и греет ли ваш Mac? Поехали!
-
[Перевод] Запускаю Gemma 4 локально в LM Studio: 51 токен/с и Claude Code без интернета
Ещё вчера для запуска 26-миллиардной нейросети нужен был дата-центр. Сегодня достаточно ноутбука и одной консольной команды. Встречайте: Google Gemma 4 26B-A4B. Модель, которая ломает старые правила. Архитектура mixture-of-experts (128 экспертов, 8 активных на токен) позволяет ей работать на скромных 48 ГБ объединённой памяти, выдавая при этом качество, сопоставимое с гигантами вроде Qwen 3.5 на 397B параметров. А LM Studio 0.4.0 только что сделала локальный запуск таких моделей по-настоящему удобным . Фоновый демон llmster , консольная утилита lms , непрерывный батчинг и – внимание! – эндпойнт, совместимый с Anthropic . Это значит, что вы можете направить Claude Code на свою локальную Gemma 4. Хотите узнать, как заставить эту связку летать? Как правильно рассчитать память под контекст в 256K токенов и почему спекулятивное декодирование — плохая идея для MoE? А главное — сколько это всё жрёт энергии и греет ли ваш Mac? Поехали!
-
Тонкая настройка Gemma 4 на Cloud Run Jobs: использование серверных GPU для классификации пород животных
В этом поколении открытых моделей улучшены возможности рассуждения и эффективность архитектуры. Ниже будет инструкция по дообучению модели на собственных данных. | Если вам интересна тема AI-агентов и внедрения нейросетей, заглядывайте в мой Telegram-канал ДругОпенсурса . Там я публикую свежие новости и разборы инструментов в числе первых. |
https://habr.com/ru/articles/1022346/
#gemma_4 #lora #cloud_run #google_cloud #мультимодальные_модели #машинное+обучение
-
Тонкая настройка Gemma 4 на Cloud Run Jobs: использование серверных GPU для классификации пород животных
В этом поколении открытых моделей улучшены возможности рассуждения и эффективность архитектуры. Ниже будет инструкция по дообучению модели на собственных данных. | Если вам интересна тема AI-агентов и внедрения нейросетей, заглядывайте в мой Telegram-канал ДругОпенсурса . Там я публикую свежие новости и разборы инструментов в числе первых. |
https://habr.com/ru/articles/1022346/
#gemma_4 #lora #cloud_run #google_cloud #мультимодальные_модели #машинное+обучение
-
Тонкая настройка Gemma 4 на Cloud Run Jobs: использование серверных GPU для классификации пород животных
В этом поколении открытых моделей улучшены возможности рассуждения и эффективность архитектуры. Ниже будет инструкция по дообучению модели на собственных данных. | Если вам интересна тема AI-агентов и внедрения нейросетей, заглядывайте в мой Telegram-канал ДругОпенсурса . Там я публикую свежие новости и разборы инструментов в числе первых. |
https://habr.com/ru/articles/1022346/
#gemma_4 #lora #cloud_run #google_cloud #мультимодальные_модели #машинное+обучение
-
Локальный AI в Obsidian без подписок: рабочая связка с Ollama, Gemma 4 и Infio Copilot
Я хотел собрать локального AI-ассистента для Obsidian, который умеет работать по моим заметкам без интернета и подписок. В итоге протестировал несколько подходов, остановился на связке с Obsidian + Ollama + Gemma 4 и посмотрел, насколько это вообще пригодно для повседневной работы.
https://habr.com/ru/articles/1022080/
#obsidian #ollama #gemma_4 #llm #rag #embeddings #markdown #knowledge_base #ai
-
Локальный AI в Obsidian без подписок: рабочая связка с Ollama, Gemma 4 и Infio Copilot
Я хотел собрать локального AI-ассистента для Obsidian, который умеет работать по моим заметкам без интернета и подписок. В итоге протестировал несколько подходов, остановился на связке с Obsidian + Ollama + Gemma 4 и посмотрел, насколько это вообще пригодно для повседневной работы.
https://habr.com/ru/articles/1022080/
#obsidian #ollama #gemma_4 #llm #rag #embeddings #markdown #knowledge_base #ai
-
Локальный AI в Obsidian без подписок: рабочая связка с Ollama, Gemma 4 и Infio Copilot
Я хотел собрать локального AI-ассистента для Obsidian, который умеет работать по моим заметкам без интернета и подписок. В итоге протестировал несколько подходов, остановился на связке с Obsidian + Ollama + Gemma 4 и посмотрел, насколько это вообще пригодно для повседневной работы.
https://habr.com/ru/articles/1022080/
#obsidian #ollama #gemma_4 #llm #rag #embeddings #markdown #knowledge_base #ai
-
Утечка Claude Code, Cursor 3 и конец халявы от Anthropic
Восьмой выпуск еженедельных IT-новостей от OpenIDE. Самая громкая неделя за всё время выпусков: Anthropic слили полные исходники своего флагманского агента, Cursor выпустил третью версию с полным переосмыслением интерфейса, а ещё Anthropic закрыли лазейку, которой пользовались все любители OpenClaw.
https://habr.com/ru/companies/haulmont/articles/1020298/
#Claude_Code #утечка_исходников #Cursor_3 #Gemma_4 #Qwen_36_Plus #GLM5V_Turbo #OpenClaw #AIагенты
-
Утечка Claude Code, Cursor 3 и конец халявы от Anthropic
Восьмой выпуск еженедельных IT-новостей от OpenIDE. Самая громкая неделя за всё время выпусков: Anthropic слили полные исходники своего флагманского агента, Cursor выпустил третью версию с полным переосмыслением интерфейса, а ещё Anthropic закрыли лазейку, которой пользовались все любители OpenClaw.
https://habr.com/ru/companies/haulmont/articles/1020298/
#Claude_Code #утечка_исходников #Cursor_3 #Gemma_4 #Qwen_36_Plus #GLM5V_Turbo #OpenClaw #AIагенты
-
Утечка Claude Code, Cursor 3 и конец халявы от Anthropic
Восьмой выпуск еженедельных IT-новостей от OpenIDE. Самая громкая неделя за всё время выпусков: Anthropic слили полные исходники своего флагманского агента, Cursor выпустил третью версию с полным переосмыслением интерфейса, а ещё Anthropic закрыли лазейку, которой пользовались все любители OpenClaw.
https://habr.com/ru/companies/haulmont/articles/1020298/
#Claude_Code #утечка_исходников #Cursor_3 #Gemma_4 #Qwen_36_Plus #GLM5V_Turbo #OpenClaw #AIагенты
-
Google DeepMind、「Gemma 4」を発表 ~ライセンスは商用可能な「Apache 2.0」に/他のローカルモデルの1/20サイズで同等のパフォーマンス
https://forest.watch.impress.co.jp/docs/news/2099445.html#forest_watch_impress #Gemma #Gemma_4 #genai #文章生成 #AIコーディング #AIエージェント #Gemini
-
Google DeepMind、「Gemma 4」を発表 ~ライセンスは商用可能な「Apache 2.0」に/他のローカルモデルの1/20サイズで同等のパフォーマンス
https://forest.watch.impress.co.jp/docs/news/2099445.html#forest_watch_impress #Gemma #Gemma_4 #genai #文章生成 #AIコーディング #AIエージェント #Gemini
-
Google DeepMind、「Gemma 4」を発表 ~ライセンスは商用可能な「Apache 2.0」に/他のローカルモデルの1/20サイズで同等のパフォーマンス
https://forest.watch.impress.co.jp/docs/news/2099445.html#forest_watch_impress #Gemma #Gemma_4 #genai #文章生成 #AIコーディング #AIエージェント #Gemini
-
Gemma 4 от Google, утечка Claude Code, Cursor 3.0, нейросеть от Netflix и исследование эмоций Claude
Привет, это новый выпуск «Нейро-дайджеста» — коротких и полезных обзоров ключевых событий в мире искусственного интеллекта и технологий. Неделя насыщенная: Google выпустила Gemma 4, Anthropic дважды засветилась с утечками c Mythos, Capybara и исходниками Claude Code. Cursor теперь делают упор на ИИ-агентов, а Netflix неожиданно врывается в ИИ-гонку. Всё самое важное — в одном месте. Поехали! Читать дайджест →
https://habr.com/ru/companies/timeweb/articles/1019292/
#дайджест #новости #ии #сатоши_накамото #биткоин #gemma_4 #google #anthropic #IT #нейросети
-
Gemma 4 от Google, утечка Claude Code, Cursor 3.0, нейросеть от Netflix и исследование эмоций Claude
Привет, это новый выпуск «Нейро-дайджеста» — коротких и полезных обзоров ключевых событий в мире искусственного интеллекта и технологий. Неделя насыщенная: Google выпустила Gemma 4, Anthropic дважды засветилась с утечками c Mythos, Capybara и исходниками Claude Code. Cursor теперь делают упор на ИИ-агентов, а Netflix неожиданно врывается в ИИ-гонку. Всё самое важное — в одном месте. Поехали! Читать дайджест →
https://habr.com/ru/companies/timeweb/articles/1019292/
#дайджест #новости #ии #сатоши_накамото #биткоин #gemma_4 #google #anthropic #IT #нейросети
-
Gemma 4 от Google, утечка Claude Code, Cursor 3.0, нейросеть от Netflix и исследование эмоций Claude
Привет, это новый выпуск «Нейро-дайджеста» — коротких и полезных обзоров ключевых событий в мире искусственного интеллекта и технологий. Неделя насыщенная: Google выпустила Gemma 4, Anthropic дважды засветилась с утечками c Mythos, Capybara и исходниками Claude Code. Cursor теперь делают упор на ИИ-агентов, а Netflix неожиданно врывается в ИИ-гонку. Всё самое важное — в одном месте. Поехали! Читать дайджест →
https://habr.com/ru/companies/timeweb/articles/1019292/
#дайджест #новости #ии #сатоши_накамото #биткоин #gemma_4 #google #anthropic #IT #нейросети