home.social

#deepseek_r1 — Public Fediverse posts

Live and recent posts from across the Fediverse tagged #deepseek_r1, aggregated by home.social.

fetched live
  1. А что, так можно было? Как (а главное — зачем) установить нейросеть на компьютер

    Большинство нейросетей сегодня работают онлайн: вы открываете сайт, пишете запрос и получаете ответ с удаленного сервера. Но некоторые современные модели можно скачать на компьютер и запускать прямо на своем железе — даже без подключения к интернету. Это называется локальным запуском нейросети . Вы скачиваете файлы модели, устанавливаете специальную программу и после этого общаетесь с ИИ примерно так же, как с обычным онлайн-чатом. Причем для этого не обязательно иметь игровой ПК за несколько тысяч долларов. Существуют компактные версии моделей, которые способны работать даже на обычных домашних компьютерах и ноутбуках.

    habr.com/ru/articles/1068830/

    #deepseek #chatgpt #нейросеть #нейросеть_локально #нейросеть_онлайн #нейросети #deepseek_r1 #deepseek_v3 #deepseekr1 #deepseek_ai

  2. Нет, тренировка DeepSeek R1 не стоила $294 тыс. Реальная цифра в десятки раз выше

    В интернете широко обсуждают опубликованный в Nature отчет авторов DeepSeek, в котором якобы заявляется, что обучение модели R1 обошлось компании всего в 294 тысячи долларов. Цифра выглядит сенсационной, ведь конкуренты тратят на создание своих моделей в тысячи раз большие суммы: например, для Claude Sonnet 3.7 давали оценку в несколько десятков миллионов долларов. Если бы взятая из Nature цифра была правдой, то получилось бы так, что у конкурентов нет никаких шансов перед командой DeepSeek. Но это не так.

    habr.com/ru/articles/948882/

    #DeepSeek #DeepSeek_R1 #deepseek_v3 #deepseek_v31

  3. Локальная LLM: гадкий утенок в мире прекрасных лебедей

    Всем привет! Я — Иван, инженер по разработке AI-систем CodeInside. Мы разрабатываем и внедряем кастомные AI-решения — от интеллектуальных поисковых систем на основе RAG до специализированных AI-агентов и ассистентов для автоматизации процессов в бизнесе и промышленности. В этой статье я расскажу о результатах тестирования локальных и облачных LLM в RAG-сценариях. Мы сравнили их точность, полноту, достоверность и скорость работы, чтобы понять, насколько локальные модели готовы к реальным задачам и в каких случаях они могут быть не хуже — а иногда и лучше — облачных аналогов.

    habr.com/ru/articles/937228/

    #llm #llama_33_70b #gpt41_mini #gemini_25_flash #deepseek_r1 #Mistral_Small_3224B #Qwen3Coder30BA3B #onpremise #облачные_llm #локальные_llm

  4. Запускаем самый маленький квант DeepSeek R1 671B на игровом ПК и смотрим вменяемая ли она на огромном контексте (160к)

    Релиз DeepSeek R2 официально отложен и пока R1 не потерял актуальность, попробуем запустить модель на домашнем ПК. Оригинальная DeepSeek R1 имеет размер 700гб, так как она обучалась в fp8, но если бы она обучалась в стандартных f16, её вес был бы 1400гб, а мы попробуем версию в 10 раз меньше. Запустим самый маленький 1.66-битный IQ1_S_R4 квант полноценной модели размером 130гб на игровом ПК, отдельно с 4090 и 4060ti. Загрузим туда очень-очень много контекста и проверим, такой квант всё ещё способен давать разумные ответы или нет.

    habr.com/ru/articles/921540/

    #llamacpp #ik_llama #deepseek #локальные_нейросети #deepseek_r1 #deepseek_v3

  5. Виртуальные ассистенты: обзор самых «умных» нейросетей для ответов на вопросы

    Ни для кого не секрет, что спрос на AI-ассистентов только растёт с каждым днём, причём растёт он практически во всех сферах жизни человека. Нейросети используют в копирайтинге, в бизнесе, ими пользуются программисты, у них ищут спасения студенты и школьники, когда материал непонятен или когда огромный текст нужен срочно, — словом, эти виртуальные помощники плотно вошли в нашу повседневную жизнь. Ну а в современной повседневной жизни новые вопросы возникают порой быстрее, чем мы успеваем найти верный и полный ответ на предыдущие, и было бы прекрасно знать, какие же нейросети наиболее умные, чтобы использовать их для ответов на вопросы, согласитесь. И сегодня мы с вами сравним 7 нейросетей и выделим из них топ-3.

    habr.com/ru/companies/bothub/a

    #нейросети #промты #deepseek_r1 #сравнение #gpt_o1 #grok_3 #llama_4 #claude_opus_4 #perplexity_ai #gigachat_20

  6. Ускорение DeepSeek-R1 с подвохом: Когда токены в секунду врут о реальной скорости

    Токены летят быстрее, а результат — медленнее: парадокс квантизации DeepSeek-R1. Замеры 4 версий модели доказали: уменьшение размера ускоряет генерацию отдельных токенов, но что происходит с общим временем ответа?

    habr.com/ru/articles/919452/

    #deepseek #deepseek_r1 #deepseek_r10528 #ai #llm #llmмодели #gguf #кодогенерация #local_ai #llamacpp

  7. Локальный DeepSeek-R1: Когда скорость улитки – не приговор, а точка старта

    Локальный DeepSeek-R1-0528 на скромном железе? Реально. Со скоростью улитки? Первоначально – да. Но итог моего эксперимента: эту 'улитку' можно заставить работать вдвое быстрее.

    habr.com/ru/articles/916966/

    #deepseek #ai #llm #local_ai #epyc #deepseek_r1 #deepseek_v3 #llamacpp #huggingface #gguf

  8. Проверка текста на орфографию: рейтинг лучших AI-корректоров, часть 1

    Вы когда‑нибудь ловили себя на том, что отправляете важное письмо или сообщение, а спустя мгновение замечаете ошибку? Такое ощущение, словно невидимая красная ручка уже начала зачёркивать текст... В статье я исследую инструменты, способные сберечь от этих неприятностей. Всё это нацелено на одну задачу: найти лучший инструмент для проверки орфографии и пунктуации . Эта тема важна для всех, кто взаимодействует с текстом, независимо от того, редактируете ли вы роман, готовите отчёт или пишете пост в соцсетях (да, даже твиты требуют идеальной подачи). Для обзора я выбрал 13 самых популярных онлайн‑сервисов, приложений и нейросетей , чтобы определить, кто лучше сможет проверить правописание (орфографию и пунктуацию). Мы разберём их по косточкам, выявим силу и слабость каждого участника и, конечно, определим победителя. (Ну правда, почему ошибки всегда выпрыгивают на глаза только после отправки?)

    habr.com/ru/companies/bothub/a

    #нейросети #корректура #проверка_орфографии #проверка_пунктуации #исправление_ошибок #deepseek_r1 #claude_37_sonnet #grok_3 #chatgpt_4o #chatgpt_41

  9. Рейтинг 6 нейросетей для сокращения текста, ч. 2: кто король краткости?

    Тонны текста и в финале — чувство, что застряли в бесконечном произведении? Нейросети уже здесь, чтобы вытянуть вас из хаоса. Во второй части обзора — больше инструментов и тестов. Я рассмотрел DeepSeek‑R1, который превращает расшифровки в читабельные статьи, а также нейросеть ChatGPT-4o в генерации аннотаций и Grok-3, который успешно создал цепочку телеграм‑постов из видеовыступления. Результаты — под катом. Ещё здесь рассмотрен Notion (тот самый для ведения заметок) — который тоже поддерживает ИИ‑редактирование. В этой части речь пойдёт о том, как максимально эффективно использовать каждый из этих инструментов. Давайте убедимся, что даже самая неуютная стена текста может быть превращена в лаконичный и удобный контент.

    habr.com/ru/companies/bothub/a

    #нейросети #сокращение_текста #рерайт #промты #deepseek_r1 #chatgpt_4o #grok_3 #notion

  10. Как обучить русскоязычную модель рассуждений — LRM?

    Ранее на моем YouTube-канале уже были видео о моделях рассуждений — OpenAI o1/o3, DeepSeek R1 . Эти модели обучены с помощью стратегии reinforcement learning находить решения для задач, требующих логических рассуждений. Способность строить цепочки рассуждений, ведущих к решению поставленной задачи, открывают возможность применения таких моделей в математике, программировании и других подобных направлениях.​ Однако упомянутые модели имеют одно ограничение — они выполняют рассуждения на английском языке. И даже если вы укажете в промпте требуемый язык ответа, отличный от этих двух, то только вывод модели будет на этом языке, а вот сама цепочка останется на том, на котором модель обучена “думать”. Соответственно, чтобы заставить модель думать на русском, нужно применять файнтюнинг. Есть интересный пример — коллекция моделей R1 Multilingual от японской компании Lightblue , которая ранее создала открытый мультиязычный файнтюнг Llama 3 - Suzume . Эта новая коллекция содержит модели рассуждений на базе DeepSeek-R1-Distill-Qwen , дистиллированных с помощью DeepSeek R1 версий Qwen . Что более важно - эти модели получены путем файнтюнинга на мультиязычном CoT (Chain-of-Thoughts), и данные CoT опубликованы на HuggingFace . Датасет содержит данные на более чем 30 языках, включая русский. Данные получены следующим образом: Выполнена выборка промптов из открытых англоязычных датасетов с последующим переводом на различные языки. Для перевода использовалась GPT-4o, которая, кстати, хорошо показала себя при создании моего собственного датасета и русскоязычного файнтюна Llama 3 на нем. Далее авторы мультиязычного CoT-датасета сгенерировали ответы на полученные промпты с помощью deepseek-ai/DeepSeek-R1-Distill-Llama-70B восемь раз, и отфильтровали блоки <think> не на том языке, либо с нарушениями правил языка или логическими ошибками. Это достаточно интересный момент, так как разработчики полностью опубликовали код для генерации своего датасета, включая фильтрацию сгенерированных цепочек рассуждений. Если с автоматическим определением языка цепочки все достаточно просто, то для проверки ее соответствия нормам языка и, самое главное, логической корректности, пришлось опять-таки задействовать LLM. Принцип такой же, как и при использовании модели-судьи для выполнения автоматизированных evaluation-тестов.

    habr.com/ru/articles/901780/

    #llm #chatgpt #deepseek_r1 #deepseek #lrm #llama3

  11. Claude 3.7 Sonnet: Пора сдвинуть ChatGPT и Deepseek с лидирующих позиций

    Последние месяцы рынок генеративного AI буквально кипит — одна за другой выходят мощные новинки. ChatGPT-4.5 от OpenAI , GROK-3 от X , свежие релизы от Google Gemini — и Anthropic не осталась в стороне, представив свою разработку: Claude 3.7 Sonnet. Как заявляют разработчики , новый AI не просто стал быстрее и умнее своих предшественников, он первым внедрил «гибридную модель рассуждений». В этой статье я хочу оценить способности новой модели и, разумеется, выяснить на практике, действительно ли Claude 3.7 Sonnet соответствует всему, что наобещали разработчики. Приятного прочтения)

    habr.com/ru/companies/bothub/a

    #ai #искусственный_интеллект #claude_37_sonnet #claude_35 #deepseek_r1 #gpt

  12. ChatGPT-4.5: бенчмарки, генерация художественных текстов и сравнение с DeepSeek-r1

    В конце февраля OpenAI официально представила ChatGPT-4.5 — самую крупную и продвинутую модель для диалогового взаимодействия на сегодняшний день. 4.5 обладает улучшенными навыками общения и письма, расширенным кругозором и, как заявляет компания, «более утончённой личностью» в сравнении с предыдущими версиями. Но что это вообще за модель? OpenAI не слишком хорошо объяснила, что она из себя представляет. Поэтому давайте разберёмся сами, как показывает себя эта новейшая и пока ещё не до конца понятная нейросеть компании в различных тестах и генерации контента.

    habr.com/ru/companies/bothub/a

    #ии #ai #chatgpt_45 #chatgpt_4o #deepseek_r1 #grok_3 #бенчмарк

  13. Битва титанов: DeepSeek VS ChatGPT

    Привет, Хабр! Ну что ж, пожалуй, вы уже все знаете и о том, что такое DeepSeek, и о его бешеной популярности. Предлагаю разобраться, почему он вызвал такой большой интерес среди пользователей и разработчиков.

    habr.com/ru/companies/reksoft/

    #deepseek #deepseek_r1 #chatgpt #moe #openai #codeforces

  14. Так ли хороша DeepSeek-R1, как о ней говорят

    Во всем AI-мире сейчас говорят о новой китайской языковой модели DeepSeek и, конечно, наша команда развития AI не могла пройти мимо этой темы. Мы сравнили ответы новой модели на реальные запросы к нашей технической поддержке с ответами других популярных моделей. Что из этого получилось и какие выводы мы сделали расскажу я — Максим Михайлов, продуктовый менеджер Узнать подробности

    habr.com/ru/companies/cloud_ru

    #llmмодели #deepseek #qwen25max #o3mini #o1mini #openai #gpt4 #deepseek_r1 #сравнение

  15. DeepSeek AI: что есть у Китая, чего нет у США

    ИИ-гонка США и Китая носит нелинейный характер: анализируя особенности китайского подхода, которые внесли вклад в возможность DeepSeek нагнать OpenAI GPT, обнаруживаешь, что развилка в подходах возникает не на уровне самих проектов, и даже не на уровне индустрии, а на уровне государственной политики. Т.е. это не просто гонка команд, как на хакатоне, где разрыв сводится к человеческо-менеджерскому фактору (квалификации разработчиков и менеджеров), а буквально соревнование систем: Китай в этой гонке выставил не просто свою команду на своей машине, а прокладывает свой собственный маршрут в том же направлении. А гордые и независимые корпорации из Кремниевой Долины, десятилетиями пиарившие себя как эпицентр инноваций на планете Земля, вдруг в одночасье показались неповоротливыми мамонтами, жравшими непомерно много денег относительно их реальных достижений, пока неизвестный раньше ИИ-разработчик DeepSeek, как юркий «Тысячелетний сокол» проскочив под носом неповоротливого имперского Звёздного разрушителя, одним махом срезал им самооценку, буквально, на триллион. Вопрос: откуда у Китая взялась такая прыть?

    habr.com/ru/articles/882882/

    #DeepSeek #DeepSeek_R1 #Китай #Кремниевая_Долина

  16. Дипсик не работает: Обходим ошибку Deepseek service is busy хитрым способом

    DeepSeek всё чаще оказывается недоступен из-за перегруженности серверов. В этой статье решим проблему оригинальным способом – установим Дипсик локально, чтобы он работал вообще без подключения к Интернету.

    habr.com/ru/articles/878498/

    #deepseek_r1 #deepseek_v3 #deepseek_ai #deepseek #дипсик #нейросети #ии_помощник #ииассистент #ии_чатбот

  17. Так ли страшен DeepSeek, как его малюет Cerebras?

    В последнее время две темы в новостях о новейших достижениях в области ИИ привлекали наибольшее внимание специалистов и досужей публики, которая желает все знать — китайский проект DeepSeek и производитель оборудования для ИИ американская компания Cerebras. Здесь, на Хабре своевременно появлялись публикации по обеим темам. Я сходил по некоторым ссылкам к первоисточникам, приведенным в этих публикациях для проверки фактов. Вы тоже можете это сделать, если захотите. Для тех, кто не следил, напоминаю, что с успехами DeepSeek связывают недавнее обрушение фондового рынка Америки на триллион долларов, из которых шестьсот миллиардов пришлось на флагман в производстве оборудования для ИИ — компанию NVIDIA, поскольку сервис DeepSeek китайского базирования работает на платформе, не использующей NVIDIA. Мы еще не успели пережить крах Intel, а тут такое. Cerebras Systems тоже приходит к владельцам и управляющим NVIDIA в страшных снах, поскольку предлагают альтернативное GPU архитектурам решение для ИИ платформ, особенно облачных — компьютеры на кристалле по технологии wafer scale integration. Некоторые горячие головы называют Cerebras убийцей NVIDIA. Убийца или нет, но черный лебедь точно. А два черных лебедя — это тяжело даже для компании с капитализацией 2.89 триллиона долларов даже после последнего падения на 17.8% (с тех пор отпрыгнули опять за три триллиона). И вот, последняя новость, два черных лебедя слились в объятьях — 30 января компания Cerebras объявила о том, что разместит на серверах, расположенных в США, китайскую модель ИИ DeepSeek R1 (оригинал публикации на сайте технологических новостей Venture Beat здесь , ее пересказ в блоге компании BotHub на Хабре — здесь ). Я выделил жирным шрифтом те слова, которые, как мне кажется, отражают главный смысл этой новости. Чуть позже в той же публикации цитируются слова директора по маркетингу продуктов Cerebras Джеймса Ванга (James Wang), который в пересказе BotHub ошибочно называется старшим исполнительным директором. Так вот, этот Джеймс Ванг сказал в эксклюзивном интервью сайту Venture Beat буквально следующее: “Если вы используете API DeepSeek, который сейчас очень популярен, эти данные отправляются прямо в Китай” и это заявление меня слегка удивило своей неполиткорректностью и отсутствием доказательств. Впрочем, на мой взгляд, оно вполне в стиле внешней политики новой администрации США, которая того и гляди начнет торговую войну с Китаем.

    habr.com/ru/companies/idx/arti

    #ИИ #llm #deepseek_r1 #cerebras_systems

  18. i'm taking #deepseek_r1 offline for about 400SGD, it's creepy looking at it's thought processes, but after "thinking" it still fucked up despite it's ability to reason and no more "server busy"

    gave me a 376 word speech, despite it being able to reason that the speech length was 5-7 minutes...

    #kopitiam #singlish

    the skill now is not using AI, but rather, cleaning the AI output so that "our work" passes AI detection tools like #turnitin

    it's ok to "build on the work of AI" 🤣

  19. Запускаем DeepSeek-R1 на обычном сервере с 768Гб ОЗУ в LM-Studio

    Если у вас нет парка видеокарт, но есть сервер с ОЗУ то не отчаивайтесь, вы тоже можете запустить DeepSeek R1 :-) Покажу на практике как легко и просто без использования командной строки запустить полноразмерную модель DeepSeek R1 на сервере с 768 гигами ОЗУ и что из этого получилось. Статья подойдет и для тех кто хочет и на домашнем компе запустить нейросети, но не знает с чего начать.

    habr.com/ru/articles/880328/

    #deepseek_r1 #нейросеть_локально #LM_Studio #ИИ #гайд

  20. DeepSeek и Qwen 2.5 против ChatGPT: как китайские компании запустили новый скачок в мире ИИ

    В последние недели мир искусственного интеллекта (ИИ) был потрясен значительными достижениями китайских компаний, особенно DeepSeek и Alibaba, которые представили свои передовые модели — DeepSeek-R1 и Qwen 2.5-Max соответственно. Конечно же, эти события вызвали широкий резонанс в технологическом сообществе и привели к обсуждению будущего ИИ. Меня зовут Роман Ленц, я начальник отдела анализа данных и машинного обучения ПГК Диджитал — цифровой дочки Первой грузовой компании – крупнейшего частного оператора грузовых железнодорожных перевозок в России. В этой статье мы разберемся, что за «зверь» этот DeepSeek и Qwen и что их появление значит для мира ИИ?

    habr.com/ru/companies/pgk/arti

    #ии #deepseek #deepseek_r1 #qwen25max #chatgpt #ai #иимодель #llm

  21. [Перевод] DeepSeek R1: раскройте возможности моделей DeepSeek R1. Полное руководство для новичков и экспертов

    Если вы новичок, желающий погрузиться в мир ИИ, или эксперт, стремящийся оптимизировать свои рабочие процессы, в этом руководстве вы узнаете обо всем, что нужно знать о моделях DeepSeek R1. Я расскажу вам про установку модели как локально, так и в Azure с помощью каталога моделей и о подключении с помощью API-ключей.

    habr.com/ru/articles/879452/

    #deepseek #deepseek_r1 #deepseek_ai

  22. [Перевод] Взаимодействие с документами с помощью DeepSeek и Ollama: локальный чатбот RAG для диалогов с учетом контекста

    С ростом популярности модели deepseek-r1:1.5b опасения по поводу конфиденциальности облачных решений становятся как никогда актуальными. Этот проект делает еще один шаг вперед, демонстрируя, как построить продвинутую систему RAG локально, используя DeepSeek, LangChain и Streamlit. Используя мощные возможности DeepSeek, эта система гарантирует, что ваши личные данные останутся на вашем компьютере, обеспечивая повышенную конфиденциальность и контроль. Чатбот предоставляет ответы с учетом контекста, включая содержимое документов и историю разговора, а возможность показать или скрыть обоснование ответов моделей DeepSeek добавляет уровень прозрачности, делая работу в целом более безопасной и надежной. Локальный запуск DeepSeek с помощью Ollama не только позволяет обойти проблемы облачного хранения данных, но и позволяет обеспечить более безопасное и конфиденциальное взаимодействие с пользователем. Давайте рассмотрим, как создать этот безопасный, контекстно-ориентированный и ориентированный на конфиденциальность RAG-чатбот на вашем компьютере.

    habr.com/ru/articles/879438/

    #deepseek #deepseek_r1 #deepseek_ai #rag

  23. Опять DeepSeek? Побудем в роли детектива

    Когда про DeepSeek-r1 начали говорить уже из каждого утюга, я долго думал, а стоит ли еще и свои 5 копеек вставлять в эту историю, и подумал, конечно же да! Ведь могу. Если коротко, просыпаюсь в понедельник и вижу сотни постов в час на тему «революции в ИИ», «гигантский скачок в развитии LLM», «Акции big tech компаний падают», «NVIDIA потеряла сотни миллиардов долларов» — все эти статьи и посты имели кое-что общее — упоминание DeepSeek. Первое, что я почувствовал, это, конечно, небольшое недоумение — так он уже несколько дней точно лежит в библиотеке ollama, а до этого еще лежал на hugging face, да еще и я уже и развернул его на домашнем сервере и тестирую, так почему он внезапно то хайповать стал?! Подумал, подумал, и пошел работать, лишь к вечеру вернувшись к этому вопросу. Решил разобраться, откры Хабр и понял, что уже куча опубликованных статей в стиле «⚡️», так что решил подождать чуть более логичных рассуждений обо всей этой истории. В итоге, время шло-шло-шло, я уже состарился на целую неделю, параллельно изучая причины происходящего, но, так и не дождался полноценного разбора произошедшего, так что я решил написать статью в стиле «🐢».

    habr.com/ru/articles/879358/

    #DeepSeek #ai #deepseek_r1 #ml

  24. [Перевод] Сможет ли DeepSeek R-1 ответить на эти 5 сложных для ИИ вопросов?

    Каждый раз, когда появляется новая языковая модель, у меня всегда возникает желание проверить ее с помощью нескольких обманчиво простых, но каверзных вопросов. Это моя личная привычка - своего рода стресс-тест, чтобы проверить, насколько хорошо эти модели справляются с логикой и рассуждениями. Несколько дней назад вышел DeepSeek R-1, и он сразу же стал мировой сенсацией благодаря тому, что это умная ИИ-модель с открытым исходным кодом, и тому, как хорошо она работает с логикой. Бенчмарки показывают, что она сопоставима, а иногда даже лучше, чем модели с закрытым исходным кодом, такие как o1 от OpenAI и Claude 3.5 Sonnet от Anthropic. Учитывая всю шумиху вокруг возможностей DeepSeek R-1 в области рассуждений, давайте посмотрим, насколько хорошо она ответит на эти пять каверзных вопросов:

    habr.com/ru/articles/879334/

    #deepseek #deepseek_r1 #дипсик #chatgpt #chatgpt4

  25. Morning y'all !

    is in the toolkit ! Update n give it a go.. I chose the 32b model, so keep that in mind. Download size will be 20gb & you will need decent enough Hardware to run it.

    If you don't it will open a page for you to choose a smaller model should you need it.

  26. [Перевод] Быстрое локальное развертывание DeepSeek

    В этой статье я поделюсь опытом быстрого локального развертывания модели DeepSeek — решения, которое позволяет не зависеть от облачных сервисов, сохранять конфиденциальность данных и тонко настраивать модель под собственные задачи.

    habr.com/ru/articles/879076/

    #ai #deepseek_r1 #deepseek