home.social

#чанки — Public Fediverse posts

Live and recent posts from across the Fediverse tagged #чанки, aggregated by home.social.

fetched live
  1. Бенчмаркая Enumerable.Chunk: почему батчей меньше, а проход до ×2,7 дольше

    Chunk делит коллекцию на массивы — одна строка кода. Но есть размер чанка, после которого он замедляется в разы при тех же данных и той же памяти. А на массиве и на List<int> внутри разный код, и в самой строке этого не видно.

    habr.com/ru/articles/1067238/

    #EnumerableChunk #LINQ #куча_больших_объектов #LOH #сборщик_мусора #чанки #батчинг #BenchmarkDotNet #NET_10 #аллокации

  2. Бенчмаркая Enumerable.Chunk: почему батчей меньше, а проход до ×2,7 дольше

    Chunk делит коллекцию на массивы — одна строка кода. Но есть размер чанка, после которого он замедляется в разы при тех же данных и той же памяти. А на массиве и на List<int> внутри разный код, и в самой строке этого не видно.

    habr.com/ru/articles/1067238/

    #EnumerableChunk #LINQ #куча_больших_объектов #LOH #сборщик_мусора #чанки #батчинг #BenchmarkDotNet #NET_10 #аллокации

  3. Бенчмаркая Enumerable.Chunk: почему батчей меньше, а проход до ×2,7 дольше

    Chunk делит коллекцию на массивы — одна строка кода. Но есть размер чанка, после которого он замедляется в разы при тех же данных и той же памяти. А на массиве и на List<int> внутри разный код, и в самой строке этого не видно.

    habr.com/ru/articles/1067238/

    #EnumerableChunk #LINQ #куча_больших_объектов #LOH #сборщик_мусора #чанки #батчинг #BenchmarkDotNet #NET_10 #аллокации

  4. Бенчмаркая StringBuilder: подстава на длинном тексте

    StringBuilder делит текст на чанки по 8000 символов — вчетверо ниже порога кучи больших объектов. Запас такой, что попасть туда невозможно. Но чанк на 400 КБ в этой куче возможен и получить его можно разными способами.

    habr.com/ru/articles/1066728/

    #StringBuilder #LOH #куча_больших_объектов #чанки #сборщик_мусора #оптимизация_памяти #аллокации #BenchmarkDotNet #NET_10 #Clear

  5. Бенчмаркая StringBuilder: подстава на длинном тексте

    StringBuilder делит текст на чанки по 8000 символов — вчетверо ниже порога кучи больших объектов. Запас такой, что попасть туда невозможно. Но чанк на 400 КБ в этой куче возможен и получить его можно разными способами.

    habr.com/ru/articles/1066728/

    #StringBuilder #LOH #куча_больших_объектов #чанки #сборщик_мусора #оптимизация_памяти #аллокации #BenchmarkDotNet #NET_10 #Clear

  6. Бенчмаркая StringBuilder: подстава на длинном тексте

    StringBuilder делит текст на чанки по 8000 символов — вчетверо ниже порога кучи больших объектов. Запас такой, что попасть туда невозможно. Но чанк на 400 КБ в этой куче возможен и получить его можно разными способами.

    habr.com/ru/articles/1066728/

    #StringBuilder #LOH #куча_больших_объектов #чанки #сборщик_мусора #оптимизация_памяти #аллокации #BenchmarkDotNet #NET_10 #Clear

  7. Contextual Retrieval: техника, которая чинит главную проблему RAG за 50 центов на тысячу чанков

    Классический RAG часто ошибается не из‑за слабой embedding‑модели, а потому что чанки теряют связь с исходным документом. Разбираем, как Contextual Retrieval возвращает этот контекст перед индексацией и помогает точнее искать нужные фрагменты в корпоративных базах знаний.

    habr.com/ru/companies/otus/art

    #RAG #Contextual_Retrieval #LLM #embeddings #BM25 #reranking #чанки #векторный_поиск #база_знаний #корпоративный_ИИ

  8. Contextual Retrieval: техника, которая чинит главную проблему RAG за 50 центов на тысячу чанков

    Классический RAG часто ошибается не из‑за слабой embedding‑модели, а потому что чанки теряют связь с исходным документом. Разбираем, как Contextual Retrieval возвращает этот контекст перед индексацией и помогает точнее искать нужные фрагменты в корпоративных базах знаний.

    habr.com/ru/companies/otus/art

    #RAG #Contextual_Retrieval #LLM #embeddings #BM25 #reranking #чанки #векторный_поиск #база_знаний #корпоративный_ИИ

  9. Contextual Retrieval: техника, которая чинит главную проблему RAG за 50 центов на тысячу чанков

    Классический RAG часто ошибается не из‑за слабой embedding‑модели, а потому что чанки теряют связь с исходным документом. Разбираем, как Contextual Retrieval возвращает этот контекст перед индексацией и помогает точнее искать нужные фрагменты в корпоративных базах знаний.

    habr.com/ru/companies/otus/art

    #RAG #Contextual_Retrieval #LLM #embeddings #BM25 #reranking #чанки #векторный_поиск #база_знаний #корпоративный_ИИ

  10. Параллельное слияние чанков в Manticore Search

    Начиная с Manticore Search 24.4.0 , компактизация RT-таблиц использует более эффективную модель выполнения. Вместо последовательного слияния пар чанков оптимизация теперь поддерживает два важных улучшения:

    habr.com/ru/articles/1022634/

    #чанки #полнотекстовый_поиск #индексирование_текста #индексирование_данных #многопоточность #балансировка_нагрузки

  11. Параллельное слияние чанков в Manticore Search

    Начиная с Manticore Search 24.4.0 , компактизация RT-таблиц использует более эффективную модель выполнения. Вместо последовательного слияния пар чанков оптимизация теперь поддерживает два важных улучшения:

    habr.com/ru/articles/1022634/

    #чанки #полнотекстовый_поиск #индексирование_текста #индексирование_данных #многопоточность #балансировка_нагрузки

  12. Параллельное слияние чанков в Manticore Search

    Начиная с Manticore Search 24.4.0 , компактизация RT-таблиц использует более эффективную модель выполнения. Вместо последовательного слияния пар чанков оптимизация теперь поддерживает два важных улучшения:

    habr.com/ru/articles/1022634/

    #чанки #полнотекстовый_поиск #индексирование_текста #индексирование_данных #многопоточность #балансировка_нагрузки

  13. Перезапрос упавшей статики

    Статья про то как контролировать загрузку статики у себя в продакшн сборке и предотвратить сайд-эффекты.

    habr.com/ru/articles/1001150/

    #чанки #статика #cdn #webpack

  14. Перезапрос упавшей статики

    Статья про то как контролировать загрузку статики у себя в продакшн сборке и предотвратить сайд-эффекты.

    habr.com/ru/articles/1001150/

    #чанки #статика #cdn #webpack

  15. Перезапрос упавшей статики

    Статья про то как контролировать загрузку статики у себя в продакшн сборке и предотвратить сайд-эффекты.

    habr.com/ru/articles/1001150/

    #чанки #статика #cdn #webpack

  16. Как мы в объектном хранилище отказы реплик обрабатываем

    Когда мы работаем с реплицированными системами, вопрос стратегии переключения между репликами, а тем более ее реализация — это довольно значительная головная боль. Если вашей системе необходимо работать с отказами штатно, то наш опыт может подсказать пару новых идей, как можно сделать отказы контролируемыми. Я Владислав Доронин — Go-разработчик в команде S3 облачной

    habr.com/ru/companies/cloud_ru

    #s3 #объектное_хранилище #чанки #реплики

  17. Как мы в объектном хранилище отказы реплик обрабатываем

    Когда мы работаем с реплицированными системами, вопрос стратегии переключения между репликами, а тем более ее реализация — это довольно значительная головная боль. Если вашей системе необходимо работать с отказами штатно, то наш опыт может подсказать пару новых идей, как можно сделать отказы контролируемыми. Я Владислав Доронин — Go-разработчик в команде S3 облачной

    habr.com/ru/companies/cloud_ru

    #s3 #объектное_хранилище #чанки #реплики

  18. Как мы в объектном хранилище отказы реплик обрабатываем

    Когда мы работаем с реплицированными системами, вопрос стратегии переключения между репликами, а тем более ее реализация — это довольно значительная головная боль. Если вашей системе необходимо работать с отказами штатно, то наш опыт может подсказать пару новых идей, как можно сделать отказы контролируемыми. Я Владислав Доронин — Go-разработчик в команде S3 облачной

    habr.com/ru/companies/cloud_ru

    #s3 #объектное_хранилище #чанки #реплики

  19. RAG — это главное. Почему специализированные LLM реже галлюцинируют

    Когда закрылся Skype , этого почти никто уже и не заметил. Хотя сервис когда-то был синонимом термина «видеосвязь». Но потом видеозвонки внедрили везде — в браузеры, мессенджеры, корпоративный софт, экосистемы, а Skype не успел адаптироваться... Возможно, с LLM происходит нечто подобное. Универсальные LLM впечатляют глубиной эрудиции — но для решения конкретных проблем совершенно непригодны. Хотя они быстро и уверенно отвечают на вопросы, выдавая целые «портянки» текста, часто эти ответы представляют собой галлюцинации или «воду», с выдуманными ссылками.

    habr.com/ru/articles/977260/

    #RetrievalAugmented_Generation #rag #ретривер #чанки #эмбеддинги #корпоративные_данные #copilot #gemini #llm #алиса_про

  20. RAG — это главное. Почему специализированные LLM реже галлюцинируют

    Когда закрылся Skype , этого почти никто уже и не заметил. Хотя сервис когда-то был синонимом термина «видеосвязь». Но потом видеозвонки внедрили везде — в браузеры, мессенджеры, корпоративный софт, экосистемы, а Skype не успел адаптироваться... Возможно, с LLM происходит нечто подобное. Универсальные LLM впечатляют глубиной эрудиции — но для решения конкретных проблем совершенно непригодны. Хотя они быстро и уверенно отвечают на вопросы, выдавая целые «портянки» текста, часто эти ответы представляют собой галлюцинации или «воду», с выдуманными ссылками.

    habr.com/ru/articles/977260/

    #RetrievalAugmented_Generation #rag #ретривер #чанки #эмбеддинги #корпоративные_данные #copilot #gemini #llm #алиса_про

  21. RAG — это главное. Почему специализированные LLM реже галлюцинируют

    Когда закрылся Skype , этого почти никто уже и не заметил. Хотя сервис когда-то был синонимом термина «видеосвязь». Но потом видеозвонки внедрили везде — в браузеры, мессенджеры, корпоративный софт, экосистемы, а Skype не успел адаптироваться... Возможно, с LLM происходит нечто подобное. Универсальные LLM впечатляют глубиной эрудиции — но для решения конкретных проблем совершенно непригодны. Хотя они быстро и уверенно отвечают на вопросы, выдавая целые «портянки» текста, часто эти ответы представляют собой галлюцинации или «воду», с выдуманными ссылками.

    habr.com/ru/articles/977260/

    #RetrievalAugmented_Generation #rag #ретривер #чанки #эмбеддинги #корпоративные_данные #copilot #gemini #llm #алиса_про

  22. RAG: борьба с низким качеством ответов в условия экономии памяти на GPU

    Привет, Хабр! Меня зовут Саприн Семён. Я занимаюсь анализом данных и машинным обучением в компании ПГК Диджитал. Сегодня мы начинаем серию статей, в которой я расскажу о том, как мы с командой разрабатывали ИИ-помощника, а также приведу практические кейсы по улучшению точности ответов с минимальными затратами памяти графических процессоров. Как вы уже могли догадаться, наш ИИ-помощник разработан на основе RAG (Retrieval-Augmented Generation) системы. Хотя принцип работы RAG многим уже знаком и не вызывает того самого «вау», я всё же кратко напомню, как эта система работает, почему она так популярна и почему её ответам можно доверять. В этой статье я расскажу, как мы разрабатывали RAG-систему для юридического отдела нашей компании, с какими вызовами столкнулись и как их преодолевали. Вы узнаете, почему стандартные подходы не всегда работают, и как, погрузившись в специфику данных, мы смогли значительно улучшить качество ответов, сохранив при этом экономию ресурсов GPU.

    habr.com/ru/companies/pgk/arti

    #rag #natural_language_processing #искусственный_интеллект #машинное_обучение #иипомощник #чанки #baseline

  23. RAG: борьба с низким качеством ответов в условия экономии памяти на GPU

    Привет, Хабр! Меня зовут Саприн Семён. Я занимаюсь анализом данных и машинным обучением в компании ПГК Диджитал. Сегодня мы начинаем серию статей, в которой я расскажу о том, как мы с командой разрабатывали ИИ-помощника, а также приведу практические кейсы по улучшению точности ответов с минимальными затратами памяти графических процессоров. Как вы уже могли догадаться, наш ИИ-помощник разработан на основе RAG (Retrieval-Augmented Generation) системы. Хотя принцип работы RAG многим уже знаком и не вызывает того самого «вау», я всё же кратко напомню, как эта система работает, почему она так популярна и почему её ответам можно доверять. В этой статье я расскажу, как мы разрабатывали RAG-систему для юридического отдела нашей компании, с какими вызовами столкнулись и как их преодолевали. Вы узнаете, почему стандартные подходы не всегда работают, и как, погрузившись в специфику данных, мы смогли значительно улучшить качество ответов, сохранив при этом экономию ресурсов GPU.

    habr.com/ru/companies/pgk/arti

    #rag #natural_language_processing #искусственный_интеллект #машинное_обучение #иипомощник #чанки #baseline

  24. RAG: борьба с низким качеством ответов в условия экономии памяти на GPU

    Привет, Хабр! Меня зовут Саприн Семён. Я занимаюсь анализом данных и машинным обучением в компании ПГК Диджитал. Сегодня мы начинаем серию статей, в которой я расскажу о том, как мы с командой разрабатывали ИИ-помощника, а также приведу практические кейсы по улучшению точности ответов с минимальными затратами памяти графических процессоров. Как вы уже могли догадаться, наш ИИ-помощник разработан на основе RAG (Retrieval-Augmented Generation) системы. Хотя принцип работы RAG многим уже знаком и не вызывает того самого «вау», я всё же кратко напомню, как эта система работает, почему она так популярна и почему её ответам можно доверять. В этой статье я расскажу, как мы разрабатывали RAG-систему для юридического отдела нашей компании, с какими вызовами столкнулись и как их преодолевали. Вы узнаете, почему стандартные подходы не всегда работают, и как, погрузившись в специфику данных, мы смогли значительно улучшить качество ответов, сохранив при этом экономию ресурсов GPU.

    habr.com/ru/companies/pgk/arti

    #rag #natural_language_processing #искусственный_интеллект #машинное_обучение #иипомощник #чанки #baseline

  25. Как мы решали задачу сегментирования бизнес-объектов

    Привет! Меня зовут Владимир, я руководитель управления разработки и тестирования в СИГМЕ. Сегодня хочу рассказать, как наша команда дорабатывала CRM-систему заказчика. Она используется для контроля всевозможных коммуникаций с клиентами — от звонков на горячую линию и переписки в мессенджерах до визитов в офисы и почтовых рассылок. Архитектурно CRM спроектирована так, что способна сопровождать оказание практически любых услуг, но исторически сосредоточена на взаимодействии с клиентами энергосбытовых компаний. Перед нами стояла задача написать подсистему, которая позволит настраивать условия и в соответствии с ними сегментировать клиентскую базу. Клиенты, соответствующие заданным условиям, будут попадать в определенный сегмент. Эта функция нужна заказчику, чтобы выстраивать диалог с клиентами с учетом их психологического профиля и предпочтений, а также адресно предлагать услуги.

    habr.com/ru/companies/sigma/ar

    #сегментирование #crmсистемы #чанки #сегментация #хранение_данных #булева_логика #тэг #управление_продуктом #управление_даными #программирование

  26. Как мы решали задачу сегментирования бизнес-объектов

    Привет! Меня зовут Владимир, я руководитель управления разработки и тестирования в СИГМЕ. Сегодня хочу рассказать, как наша команда дорабатывала CRM-систему заказчика. Она используется для контроля всевозможных коммуникаций с клиентами — от звонков на горячую линию и переписки в мессенджерах до визитов в офисы и почтовых рассылок. Архитектурно CRM спроектирована так, что способна сопровождать оказание практически любых услуг, но исторически сосредоточена на взаимодействии с клиентами энергосбытовых компаний. Перед нами стояла задача написать подсистему, которая позволит настраивать условия и в соответствии с ними сегментировать клиентскую базу. Клиенты, соответствующие заданным условиям, будут попадать в определенный сегмент. Эта функция нужна заказчику, чтобы выстраивать диалог с клиентами с учетом их психологического профиля и предпочтений, а также адресно предлагать услуги.

    habr.com/ru/companies/sigma/ar

    #сегментирование #crmсистемы #чанки #сегментация #хранение_данных #булева_логика #тэг #управление_продуктом #управление_даными #программирование

  27. Как мы решали задачу сегментирования бизнес-объектов

    Привет! Меня зовут Владимир, я руководитель управления разработки и тестирования в СИГМЕ. Сегодня хочу рассказать, как наша команда дорабатывала CRM-систему заказчика. Она используется для контроля всевозможных коммуникаций с клиентами — от звонков на горячую линию и переписки в мессенджерах до визитов в офисы и почтовых рассылок. Архитектурно CRM спроектирована так, что способна сопровождать оказание практически любых услуг, но исторически сосредоточена на взаимодействии с клиентами энергосбытовых компаний. Перед нами стояла задача написать подсистему, которая позволит настраивать условия и в соответствии с ними сегментировать клиентскую базу. Клиенты, соответствующие заданным условиям, будут попадать в определенный сегмент. Эта функция нужна заказчику, чтобы выстраивать диалог с клиентами с учетом их психологического профиля и предпочтений, а также адресно предлагать услуги.

    habr.com/ru/companies/sigma/ar

    #сегментирование #crmсистемы #чанки #сегментация #хранение_данных #булева_логика #тэг #управление_продуктом #управление_даными #программирование