home.social

#trino — Public Fediverse posts

Live and recent posts from across the Fediverse tagged #trino, aggregated by home.social.

  1. Одна таблица результатов на 14 движков: как мы перестали дорисовывать то, чего движок не умеет

    Сразу оговорюсь: я из команды LibreDB Studio, и статья — про наши собственные грабли. LibreDB Studio — это self-hosted IDE для СУБД, работающая в браузере: один инстанс разворачивается рядом с базами, а не устанавливается на ноутбук каждого разработчика. Команда открывает URL — и почти сразу упирается в вопрос, который сожрал у нас не один спринт: как показать результат из четырнадцати принципиально разных движков в одной таблице и при этом не начать выдавать пользователю выдумки за реальные данные.

    habr.com/ru/articles/1079790/

    #базы_данных #SQL #NoSQL #IDE #selfhosted #open_source #PostgreSQL #Cassandra #Trino #LibreDB

  2. Одна таблица результатов на 14 движков: как мы перестали дорисовывать то, чего движок не умеет

    Сразу оговорюсь: я из команды LibreDB Studio, и статья — про наши собственные грабли. LibreDB Studio — это self-hosted IDE для СУБД, работающая в браузере: один инстанс разворачивается рядом с базами, а не устанавливается на ноутбук каждого разработчика. Команда открывает URL — и почти сразу упирается в вопрос, который сожрал у нас не один спринт: как показать результат из четырнадцати принципиально разных движков в одной таблице и при этом не начать выдавать пользователю выдумки за реальные данные.

    habr.com/ru/articles/1079790/

    #базы_данных #SQL #NoSQL #IDE #selfhosted #open_source #PostgreSQL #Cassandra #Trino #LibreDB

  3. Одна таблица результатов на 14 движков: как мы перестали дорисовывать то, чего движок не умеет

    Сразу оговорюсь: я из команды LibreDB Studio, и статья — про наши собственные грабли. LibreDB Studio — это self-hosted IDE для СУБД, работающая в браузере: один инстанс разворачивается рядом с базами, а не устанавливается на ноутбук каждого разработчика. Команда открывает URL — и почти сразу упирается в вопрос, который сожрал у нас не один спринт: как показать результат из четырнадцати принципиально разных движков в одной таблице и при этом не начать выдавать пользователю выдумки за реальные данные.

    habr.com/ru/articles/1079790/

    #базы_данных #SQL #NoSQL #IDE #selfhosted #open_source #PostgreSQL #Cassandra #Trino #LibreDB

  4. FIFO на миллионах строк: как подружить бонусы, SQL и асимметричный N×M-граф

    Всем привет! Меня зовут Иван Привалов , я разработчик в команде BI Авито Финтеха и в этой статье расскажу, как мы сделали FIFO-сопоставление между N начислений и M списаний для бонусов. Заодно покажу подвох, без которого SQL быстро превращался в тыкву. Статья будет полезна аналитикам и data-инженерам уровней мидл+, которые работают с финансовыми данными в Trino, Presto и Spark SQL.

    habr.com/ru/companies/avito/ar

    #trino #sql #fifo #мсфо #аналитика_данных #data_quality #etl #финансы #управленческий_учет #бонусы

  5. Бенчмарк бенчмарка Lakehouse-движков, в котором побеждает объективная реальность

    Недавно на хабре вышла статья с громким заголовком “Бенчмарк lakehouse-движков, часть 1: StarRocks и Doris падают под нагрузкой, Presto аутсайдер, CedrusData быстрее всех”. В своей статье авторы из Кверифай Лабс выбрали методику TPC-DS, но вместо 99 запросов остановилась на одном, который к тому же запускается на одной машине. Обосновывается это тем, что на одном конкретном запросе нужно разобрать работу оптимизаторов. По результатам исследования делается вывод, что решение, разработанное авторами, является лучшим, в том числе для запуска одного конкретного запроса на одном узле. Давайте попробуем разобраться, действительно ли это так.

    habr.com/ru/companies/datasapi

    #starrocks #trino #impala #mpp #bigdata #dwh #lakehouse #datalake #s3 #hadoop

  6. Тестирование движков массивно-параллельных вычислений: StarRocks, Trino, Spark. Spark – с DataFusion Comet и Impala

    В сегодняшней, уже третьей по счету, публикации я продолжу делится результатами нагрузочных испытаний вычислительных технологий массивных параллельных вычислений (на Habr уже представлены мои материалы, посвященные сравнению Impala, Trino и Greenplum , в том числе по методике TPC-DS ). В этот раз в список решений добавляется Spark, включая работающий с технологией нативных вычислений DataFusion Comet, и набирающий популярность StarRocks.

    habr.com/ru/companies/datasapi

    #starrocks #trino #lakehouse #impala #spark #bigdata #datalake #dwh #hadoop #s3

  7. Быстрая обработка данных в data lake с помощью SQL

    Кому пришла в голову идея отправлять SQL запросы в data lake? Оказывается, это позволяет компаниям более гибко и эффективно анализировать свои данные за счёт уменьшения потребности в ETL и снижения нагрузки на корпоративное хранилище. Рассмотрим, какие популярные SQL-движки умеют это делать и как им это удаётся. Меня зовут Владимир Озеров , я руковожу компанией Querify Labs. Мы уже порядка 10 лет занимаемся распределённым SQL, делаем всевозможные SQL-движки, в частности CedrusData — коммерческий движок на основе опенсорс проекта Trino. Сегодня поговорим про то, каким образом устроен ряд SQL-движков, которые обрабатывают данные от data lake.

    habr.com/ru/companies/oleg-bun

    #presto #Dremio #sql #анализ_данных #trino #кхд #data_lake #кэширование #файловые_системы #базы_данных