home.social

#inference — Public Fediverse posts

Live and recent posts from across the Fediverse tagged #inference, aggregated by home.social.

  1. Chinese chip stocks dropped on the Nvidia approval signal—SMIC down 3.7%, Moore Threads 6.3%, Cambricon 5.7%. ByteDance may order 1 million RTX Pro 5500 cards for multi-card server configurations, but the workstation GPU lacks the high-bandwidth memory needed for major training tasks. implicator.ai/china-signals-ap #semiconductors #markets #inference

  2. Chinese chip stocks dropped on the Nvidia approval signal—SMIC down 3.7%, Moore Threads 6.3%, Cambricon 5.7%. ByteDance may order 1 million RTX Pro 5500 cards for multi-card server configurations, but the workstation GPU lacks the high-bandwidth memory needed for major training tasks. implicator.ai/china-signals-ap #semiconductors #markets #inference

  3. Chinese chip stocks dropped on the Nvidia approval signal—SMIC down 3.7%, Moore Threads 6.3%, Cambricon 5.7%. ByteDance may order 1 million RTX Pro 5500 cards for multi-card server configurations, but the workstation GPU lacks the high-bandwidth memory needed for major training tasks. implicator.ai/china-signals-ap #semiconductors #markets #inference

  4. Chinese chip stocks dropped on the Nvidia approval signal—SMIC down 3.7%, Moore Threads 6.3%, Cambricon 5.7%. ByteDance may order 1 million RTX Pro 5500 cards for multi-card server configurations, but the workstation GPU lacks the high-bandwidth memory needed for major training tasks. implicator.ai/china-signals-ap #semiconductors #markets #inference

  5. Сколько стоит суверенитет

    Коллеги всю неделю обсуждают релиз претрейна huggingface.co/yandex/AliceAI- habr.com/en/companies/yandex/a . В одном из чатов спросили как она отвечает на основополагающий вопрос, и я решил это проверить, что бы узнать сколько стоит инференс подобной модели. Исходя из того что удалось найти, требуется 4 шт A100, вроде бы можно по пробовать на паре, но это требует CPU-offload, а на такие компромиссы, как и квантизации, я идти не готов. GPU я собрался брать в аренду на облаке, название его писать не буду. Первый подход был к Datasphere на Jupiter notebook и это был провал (на 6000₽). Детали не важны - проехали. Потом попытался запросить VM c 4 A100, поднял квоты через тикеты, - вот это всё. И не помогло. Ну то есть в теории это возможно - поймать 4 A100, но мне не удалось. Ещё заявлен какой-то Gen2 - но на него даже квоту не поднимают. Вернулся к Datashpere Jobs , потому что для Jupiter-то их (A100) выделяли! Схема такая:

    habr.com/ru/articles/1087244/

    #alice #llm #a100 #cloud #inference

  6. Сколько стоит суверенитет

    Коллеги всю неделю обсуждают релиз претрейна huggingface.co/yandex/AliceAI- habr.com/en/companies/yandex/a . В одном из чатов спросили как она отвечает на основополагающий вопрос, и я решил это проверить, что бы узнать сколько стоит инференс подобной модели. Исходя из того что удалось найти, требуется 4 шт A100, вроде бы можно по пробовать на паре, но это требует CPU-offload, а на такие компромиссы, как и квантизации, я идти не готов. GPU я собрался брать в аренду на облаке, название его писать не буду. Первый подход был к Datasphere на Jupiter notebook и это был провал (на 6000₽). Детали не важны - проехали. Потом попытался запросить VM c 4 A100, поднял квоты через тикеты, - вот это всё. И не помогло. Ну то есть в теории это возможно - поймать 4 A100, но мне не удалось. Ещё заявлен какой-то Gen2 - но на него даже квоту не поднимают. Вернулся к Datashpere Jobs , потому что для Jupiter-то их (A100) выделяли! Схема такая:

    habr.com/ru/articles/1087244/

    #alice #llm #a100 #cloud #inference

  7. Сколько стоит суверенитет

    Коллеги всю неделю обсуждают релиз претрейна huggingface.co/yandex/AliceAI- habr.com/en/companies/yandex/a . В одном из чатов спросили как она отвечает на основополагающий вопрос, и я решил это проверить, что бы узнать сколько стоит инференс подобной модели. Исходя из того что удалось найти, требуется 4 шт A100, вроде бы можно по пробовать на паре, но это требует CPU-offload, а на такие компромиссы, как и квантизации, я идти не готов. GPU я собрался брать в аренду на облаке, название его писать не буду. Первый подход был к Datasphere на Jupiter notebook и это был провал (на 6000₽). Детали не важны - проехали. Потом попытался запросить VM c 4 A100, поднял квоты через тикеты, - вот это всё. И не помогло. Ну то есть в теории это возможно - поймать 4 A100, но мне не удалось. Ещё заявлен какой-то Gen2 - но на него даже квоту не поднимают. Вернулся к Datashpere Jobs , потому что для Jupiter-то их (A100) выделяли! Схема такая:

    habr.com/ru/articles/1087244/

    #alice #llm #a100 #cloud #inference

  8. The #Global #Memory #Innovation #Forum 2026 (#GMIF 2026) is bringing memory #manufacturers, #storage specialists, #AI-infrastructure #companies, researchers and #investors to #Shenzhen, #China on September 22–23, 2026. Its #theme, “The #Future Built on AI Memory and Storage,” reflects the increasing importance of storage performance as AI #systems move from model training towards large-scale #inference and #commercial deployment. chinaexpohub.com/gmif-2026-bri

  9. The #Global #Memory #Innovation #Forum 2026 (#GMIF 2026) is bringing memory #manufacturers, #storage specialists, #AI-infrastructure #companies, researchers and #investors to #Shenzhen, #China on September 22–23, 2026. Its #theme, “The #Future Built on AI Memory and Storage,” reflects the increasing importance of storage performance as AI #systems move from model training towards large-scale #inference and #commercial deployment. chinaexpohub.com/gmif-2026-bri

  10. The #Global #Memory #Innovation #Forum 2026 (#GMIF 2026) is bringing memory #manufacturers, #storage specialists, #AI-infrastructure #companies, researchers and #investors to #Shenzhen, #China on September 22–23, 2026. Its #theme, “The #Future Built on AI Memory and Storage,” reflects the increasing importance of storage performance as AI #systems move from model training towards large-scale #inference and #commercial deployment. chinaexpohub.com/gmif-2026-bri