home.social

#данные — Public Fediverse posts

Live and recent posts from across the Fediverse tagged #данные, aggregated by home.social.

fetched live
  1. Нечеткая логика в ИБ: сокращаю очередь уязвимостей в 7,5 раза, сравниваю с CVSS, EPSS и методикой ФСТЭК

    Думаю ни для кого не секрет, что еще задолго до нашего рождения, были сформированы парадоксы кучи и корабля Тесея. Так как оба исследуют проблему изменения границ понятий и идентичности при постепенном удалении или замене элементов, разберу только первый пример. Есть куча песка. Уберем одну песчинку — куча останется кучей. Уберем еще — куча по-прежнему будет кучей. Но если каждый раз убирать по чуть-чуть, то рано или поздно кучу нельзя будет назвать таковой. И, конечно же, границы определения в таком случае сильно размыты. Кто-то мог бы утвердить, что куча начинается от 3 песчинок, но стоит ли такое делать? Не думаю. Эти парадоксы ломают обычную, уже привычную нам логику, и заставляют задуматься над формированием дополнительных условий. Читать далее работу студента <3

    habr.com/ru/articles/1081470/

    #информационная_безопасность #данные #алгоритмы #фстэк #cvss #нечеткая_логика #функции_принадлежности #оценка_уязвимостей #FSTEC #анализ_уязвимостей

  2. Рефакторинг моего Obsidian: как я перестроил хранилище после предыдущей статьи

    Какое-то время назад я выкладывал статью на Хабр про свое obsidian хранилище. Я получил хороший фидбэк и некоторые идеи. Также я понял, что довольно большая часть моего obsidian нуждается в оптимизации и структуризации. В итоге нашел свободный выходной, чтобы немного перестроить хранилище. Я все это сделал и тут расскажу, как теперь выглядит мой obsidian. Кроме простой структуризации и удаления лишнего, я также провел некоторые махинации над кодом dataviewjs своей библиотеки книг и доделал свою домашнюю страницу, добавив интеграцию со своей основной библиотекой и поработав на css составляющей. В общем-то были еще некоторые изменения, но об этом всем будет далее.

    habr.com/ru/articles/1075372/

    #obsidian #javascript #markdown #заметки #менеджмент #продуктивность #хранилище #данные #книги #zettelkasten

  3. Предзаказ на книгу: «Data integration. Объединение данных для улучшения процесса принятия решений»

    Привет, Хаброжители! Совсем недавно мы открыли предзаказ на книгу:«Data integration. Объединение данных для улучшения процесса принятия решений». Мы хотим немного больше вам о ней рассказать. Джей Бортен дает подробное практическое руководство по интеграции данных — от базовых понятий и терминологии до реального сквозного примера, который шаг за шагом превращает разрозненные источники в работающий конвейер на AWS, Qlik, Databricks и Confl uent. Независимо от того, разбираетесь ли вы в теме, впервые приступили к этой задаче или хотите систематизировать уже накопленный опыт, идеи и практические примеры Бортена помогут вам выстроить эффективную работу с данными в компании.

    habr.com/ru/companies/piter/ar

    #data_integration #данные

  4. Где заканчиваются отчёты и начинается безопасность: аудит ИБ без «бумажной пыли»

    Всем привет! Меня зовут Алёна, я руководитель группы аналитики отдела Compliance и безопасности данных в Ozon. Звучит длинно, поэтому мы с командой называем себя просто датасеками — от Data Security. В информационной безопасности я почти 13 лет, из них 4,5 года в Ozon. До этого больше восьми лет работала в интеграторе и занималась в основном персональными данными и банковской безопасностью — вопросами чистого compliance. Сейчас у меня команда из 11 человек, и мы занимаемся безопасностью данных в Ozon. Сегодня хочу поговорить об одной важной теме — аудитах безопасности данных. Речь не про пентесты, нет, у нас совсем другая история. Мы смотрим на безопасность данных — и персональных, и финансовых, и любых других данных, которые нужно защищать по требованиям закона, компании или здравого смысла. Расскажу вам о сложностях и о том, как мы с ними справлялись.

    habr.com/ru/companies/ozontech

    #аудит_безопасности #данные #иб #data_security #compliance #оценка_рисков #логирование #152фз #контроль_доступа #ozon_tech

  5. MCP без облака

    У меня возникла такая задача: есть куча файлов, на которые хорошо бы натравить нейросеть, чтобы она искала ответы прямо по ним, а не выдумывала. Файлы разнородные, среди них тяжелые PDF. Закинуть их в модель целиком не выйдет: контекстное окно забьется раньше, чем она доберется до сути. Нужен способ скармливать модели не весь архив разом, а только нужный кусок. Так мне пришла идея применить MCP «с другой стороны» — не для агента, а для аккуратного доступа к большому архиву локальных документов.

    habr.com/ru/companies/basis/ar

    #rag #model_context_protocol #поиск #pdf #markdown #данные #нейросети #mcp

  6. OneDWH VK: как мы консолидировали данные 35 бизнес-вертикалей

    В нашей компании исторически сложилась децентрализованная модель управления данными. Каждая из бизнес-вертикалей развивала собственные аналитические системы и хранилища, выбирая технологии и инфраструктуру независимо. В результате сформировался ландшафт из разрозненных решений с дублирующей функциональностью и растущим числом физических кластеров. На момент принятия решения о переходе в облако инфраструктура насчитывала более 10 отдельных железных кластеров под Airflow, Hadoop и смежные технологии. Совокупный объём аналитических данных достиг 0,5+ эксабайта (EB). Такая архитектура создавала не только технические, но и бизнес-ограничения. Обмен данными между вертикалями был затруднён: мешали как различия в инфраструктуре, так и юридические тонкости, связанные с оформлением доступа. Поддерживать такой ландшафт становилось всё сложнее. Поэтому в компании решили построить единую платформу для работы с данными, чтобы увеличить скорость и качество принятия решений на основе данных как в runtime, так и в отчётности и А/Б-тестах. Я Василий Ципиди, операционный руководитель OneDWH VK. Вместе с техническим руководителем OneDWH VK – Олегом Виноградовым расскажем сегодня о том, как мы подошли к миграции 0,5+ EB данных на единый облачный стек, какие архитектурные решения выбрали, чтобы обеспечить целостность данных и как перестроили процессы, чтобы гарантировать предсказуемость SLA на новых мощностях.

    habr.com/ru/companies/vk/artic

    #мигрирование #облако #OneDWH_VK #платформа_данных #данные

  7. Качественные исследования в бизнесе: книга, которой не хватало

    Первый профессиональный навигатор по качественным исследованиям в бизнесе – который увлекает, объясняет сложное на конкретных примерах и помогает увереннее ориентироваться в мире исследований. Авторы – исследователи-практики с профильным образованием: социальный психолог Константин Ефимов и Анастасия Жичкина, кандидат психологических наук. Полностью книга называется: « Качественные исследования в бизнесе. Практическое руководство для исследователей, дизайнеров, продактов и стратегов ». Объем: 392 страницы. Вес – 1 килограмм. Основная проблема с литературой про исследования – в том, что ее нет. Нет признанных источников, к которым можно адресовать человека, желающего разобраться в теме, если не считать AI. Есть масса статей с описаниями конкретных практик и кейсов, но они касаются каких-то частных случаев: кто-то сделал фишечку, получилось прикольно. До сих пор очень не хватало текста – или текстов – которые объединяли бы эти фишечки в систему и который можно было бы читать как роман – с началом, сюжетом и завершением. Такого источника нет не только на русском языке, но и на английском – существующие руководства либо слишком академические, либо совсем простые. Не хватало насыщенного описания процесса исследований, со сложностями и подводными камнями. Гладко все бывает только в мануале и в отчете, а в реальности, как правило, происходит непонятно что. Эта книга показывает, как обрабатывать это «непонятно что» - как исследования помогают в принятии решений в бизнесе, со всеми сложностями этого процесса, на конкретных примерах. Масса интересных кейсов разных бизнес-решений, в том числе провальных.

    habr.com/ru/articles/1060356/

    #бизнеспроцессы #бизнесанализ #исследование_рынка #дизайнеры #продактменеджмент #стратегия #данные #анализ_данных #сбор_данных

  8. Конец «структурного одиночества»: зачем ритейлу мультиагентные ИИ-платформы

    Категорийный менеджер крупной торговой сети ежедневно принимает десятки решений, влияющих на миллионы рублей маржи. У него есть дашборды, витрины данных и отчеты, но в момент сложного выбора он остается один на один с ситуацией... Привет! Меня зовут Алексей, бизнес-архитектор в GlowByte. Больше 15 лет работаю в бизнесе, более 7 лет – в сфере ИТ. Разрабатываю концепцию мультиагентной ИИ-платформы для крупных торговых сетей. Сегодня в статье разбираю основы новой эпохи автоматизации в ритейле: почему обилия разрозненных данных больше недостаточно и как переход к мультиагентным ИИ-системам (ИИ-напарникам) меняет правила игры на рынке федерального ритейла. Итак, поехали!

    habr.com/ru/companies/glowbyte

    #glowbyte #ai #искусственный_интеллект #мультиагентные_системы #ритейл #данные #машинное_обучение #ии #бизнесмодели #цифровая_трансформация

  9. Как выжать максимум из истории сделок: пишем систему оптимизации SL/TP для криптотрейдинга | Python+Excel

    Особенно остро этот вопрос стоит перед теми, кто торгует «статику» — фиксированные проценты риска и прибыли на сделку. Обычно эти параметры выбираются «на глаз» (например, классические 1% SL и 2% TP фиксировано, либо даже 1:1) или на основе общих тестов стратегии в симуляторе. Но рынок меняется, волатильность растёт/падает, и то, что работало в прошлом месяце, сегодня начинает медленно выедать депозит комиссиями, винрейт стратегии сильно падает. В этой статье мы разберем, как написать инструмент на Python, который берет вашу реальную историю сделок с биржи, выкачивает под каждую сделку 500 свечей после её открытия и проводит глубокий пост-фактум анализ (Grid Search) тысяч комбинаций SL/TP с учетом плеча и комиссий. А на выходе строит наглядный интерактивный Excel-дашборд. Все файлы прикрепил для вас на github . Скрипт работает с bingX, но логику всегда можно переделать под любую биржу. Проблема «статического» трейдинга и классического бэктеста Большинство классических бэктестеров (вроде Backtrader или встроенного симулятора TradingView) тестируют стратегию в вакууме. Они генерируют сигналы на исторических графиках и симулируют их исполнение. Но реальный трейдинг полон нюансов: Проскальзывания, пинг, комиссии: Ваши реальные входы почти никогда не совпадают с идеальными точками на графике TradingView. Именно здесь имеет смысл применить пост-фактум реалтайм тест (Post-Trade Optimization). Мы не тестируем логику входов — мы тестируем качество наших реальных входов и оптимизируем правила выхода.

    habr.com/ru/articles/1055708/

    #данные #аналитика_данных #трейдинг #финансы #заработок #анализ_данных #статический_трейдинг #торговые_системы #торговые_роботы #алготрейдинг

  10. Плавучие дата-центры для ИИ: зачем их хотят отправить в море

    Искусственный интеллект уже несколько лет подряд меняет не только алгоритмы и приложения, но и всю инфраструктуру, которая его поддерживает. Обучение LLM и особенно массовый запуск сервисов на их основе требуют все больше серверов с высокопроизводительными ускорителями. Эти машины выделяют столько тепла, что привычные способы охлаждения и подключения к электросетям на суше начинают упираться в потолок возможностей. Конечно, компании ищут способы решения проблемы. Один из вариантов, который сейчас активно прорабатывают крупные игроки судостроения и вычислительной техники, — размещение серверов на плавучих платформах. Морская вода здесь выступает как неисчерпаемый «резервуар холода». Разберем, что стоит за этим направлением и насколько оно способно изменить картину.

    habr.com/ru/companies/ru_mts/a

    #цод #данные #охлаждение

  11. Книга: «Анализ данных с LLM. Текст, таблицы, изображения и аудио»

    Привет, Хаброжители! Большие языковые модели (LLM) позволяют оптимизировать и ускорить решение практически любой задачи в области анализа данных. Освойте методы для анализа больших массивов текстовых, табличных и графовых данных, изображений, видео и многого другого с помощью понятных запросов на естественном языке и нескольких строк кода на Python.

    habr.com/ru/companies/piter/ar

    #llm #language_models #анализ #данные #книги_по_программированию #книга #машинное_обучение

  12. OSINT для новичков: что можно узнать из открытых источников Разбираю базовые техники OSINT для новичков: как про...

    #osint #osint #tools #google #chrome #dork #открытые #данные #критическое #мышление #osint

    Origin | Interest | Match
  13. Коммуналка, школа и 10 лет свободы: AI выпустили в симулятор жизни, где они научились дружить, выгорать и дости...

    #ии #ai #симуляция #жизни #симуляция #исследование #исскуственный #интеллект #маслоу #синтетические #данные

    Origin | Interest | Match
  14. Моделирование распределений

    Привет, Хаброжители! Мы открыли предзаказ на книгу «Думай как аналитик. Статистика и данные с примерами на Python. 3-е изд.», хотим немного рассказать вам о ней и поделиться интересным отрывком.

    habr.com/ru/companies/piter/ar

    #книги_по_программированию #data #математика #статистика #python #анализ_данных #данные

  15. Мечтали ли шумеры о нейросетях — от «живых поисковиков» до вездесущего ИИ

    В наши дни поиск информации стал почти скучен и почти тривиален. На 90% запросов и вовсе можно получить ответ от встроенной в поисковик нейросети, без необходимости прокликивать пару десятков ссылок. Разумеется, так было не всегда. Автору статьи, например, до сих пор непривычно пользоваться нейроподсказками. Прочитать текст по ссылке своими глазами — бесценно, если требуется на 100% точная информация. Поколение 35+ наверняка помнит, как интернет выглядел без Google и Яндекса. Кто-то был завсегдатаем школьной или районной библиотеки. Кому-то приходилось каталогизировать и размечать конспекты учебных лекций вручную. Казалось бы, это не слишком связанные вещи — где интернет-поиск и где допотопная картотека. Но без второго не было бы первого. В сегодняшней статье мы решили посмотреть, как люди учились индексировать, хранить, а самое главное, быстро находить информацию в доцифровую эпоху. Вместе мы пройдем весь путь от седой древности до вездесущего chatGPT. Присаживайтесь поудобнее, первая остановка — Месопотамия.

    habr.com/ru/companies/ispsyste

    #поисковые_системы #нейросети #индексация #поиск #данные #хранение #хранение_данных

  16. Мечтали ли шумеры о нейросетях — от «живых поисковиков» до вездесущего ИИ В наши дни поиск информации стал ...

    #поисковые #системы #нейросети #индексация #поиск #данные #хранение #хранение #данных

    Origin | Interest | Match
  17. [Перевод] Использование Blob API для обработки файлов, их загрузки и создания клиентских приложений без утечек памяти

    Современные фронтенд-приложения постоянно взаимодействуют с файлами. Пользователи загружают аватары, перетаскивают видео в дашборды, экспортируют CSV-отчеты, просматривают PDF-файлы, скачивают сгенерированные конфигурационные файлы и работают с медиаконтентом прямо в браузере. На первый взгляд все это выглядит довольно просто: поле загрузки файла, элемент предпросмотра, возможно, кнопка скачивания — и задача решена. Но именно здесь начинаются настоящие проблемы.

    habr.com/ru/companies/timeweb/

    #javascript #js #blob #file #memory #файл #память #timeweb_статьи_перевод #data #данные

  18. YOLOv8 против OpenCV на чертежах метро: почему простая геометрия победила нейросеть Как я случайно сделал утечку ...

    #yolov8 #opencv #гост #python #детекция #объектов #синтетические #данные #компьютерное #зрение #iso

    Origin | Interest | Match
  19. Почему дашборды не меняют управление

    В BI-проектах есть момент, который на бумаге выглядит как финал работы, а на практике часто оказывается только началом более сложной части. Отчёт готов, данные обновляются, показатели считаются, доступы выданы, на демонстрации заказчик в целом согласен с логикой и просит разве что добавить несколько разрезов или поправить формулировки. С точки зрения проекта всё выглядит неплохо: есть артефакт, есть согласование, есть ощущение, что теперь у бизнеса появился нормальный инструмент для работы с данными. Потом проходит месяц, иногда два, и выясняется, что компания по-прежнему принимает решения примерно так же, как и раньше. Руководители снова уточняют цифры в чате, менеджеры продолжают выгружать Excel “для себя”, финансовая команда сверяется со своими файлами, коммерческий блок опирается на свои расчёты, а дашборд открывают перед встречей или в тот момент, когда нужно быстро найти подтверждение уже сложившейся версии. Формально BI появился. Но способ управления почти не изменился. Я не пишу это как претензию к бизнесу или к конкретным BI-инструментам. Обычно причина не в одном неудачном решении, а в том, что техническая часть проекта и управленческая часть проекта существуют отдельно друг от друга. DataLens, Power BI, Tableau, Metabase или самописный фронт могут быть вообще ни при чём. Отчёт может быть быстрым, аккуратным и полезным для просмотра, но при этом так и не стать частью процесса, в котором принимаются решения. Кажется, проблема часто появляется раньше, чем аналитик открывает редактор дашборда.

    habr.com/ru/articles/1045540/

    #BI #бизнесаналитика #дашборды #метрики #North_Star #управление #аналитика #данные

  20. Тегирование людей на изображениях и Генерация заголовков для видеороликов

    Представьте ситуацию: вы только что вернулись из (заслуженного) отпуска с друзьями и, конечно, сделали множество фотографий. Вы хотите отправить друзьям фото с ними. Но как сделать это эффективно? Можно просмотреть фотографии вручную и отметить каждого друга отдельно. Но вы только вернулись из отпуска, ваш электронный почтовый ящик переполнен, и на просмотр фото совсем нет времени. Как же быть?

    habr.com/ru/companies/piter/ar

    #книги_по_программированию #книги #python #llm #language_models #анализ #данные #анализ_данных

  21. Тегирование людей на изображениях и Генерация заголовков для видеороликов Представьте ситуацию: вы только...

    #книги #по #программированию #книги #python #llm #language #models #анализ #данные #анализ

    Origin | Interest | Match
  22. Google идет на таран: поисковый гигант пытается оспорить статус монополиста в суде Юристы IT-гиганта подали апе...

    #Большие #данные #Интернет #Программное #обеспечение #Apple #Apple #Safari #ChatGPT #Google #Search

    Origin | Interest | Match
  23. Архитектура крипто-сканера для биржи: Open Interest, Funding Rate, EMA и MACD в реальном времени

    В этой статье разберём архитектуру полноценного фьючерсного сканера для биржи BingX, построенного на Python. Система анализирует десятки и сотни торговых инструментов в реальном времени, фильтрует активы по Open Interest и Funding Rate, рассчитывает технические индикаторы EMA и MACD, а затем формирует торговые сигналы на основе синхронизации нескольких независимых факторов. Речь пойдёт не о полноценной архитектуре рыночного анализатора, пригодного для дальнейшего масштабирования: подключения Telegram-уведомлений, машинного обучения, кластерного анализа, order flow и полностью автоматической торговли через API. Все файлы загружены на GITHUB . В статье описываю в основном логическую часть и ньюансы. Так что крайне советую к параллельному изучению самого скрипта и кода.

    habr.com/ru/articles/1039310/

    #алгоритмы #торговые_роботы #криптовалюты #трейдинг #финансовые_рынки #роботы #автоматизация #трейдинг_системы #данные #python

  24. Мой универсальный код

    Как я улучшил универсальный код Элиаса 1975 года, заменив длину на popcount — и получил 36% экономии на метаданных. С бенчмарками! Картинка на обложке кринжовая, но тут вроде так принято? 😅

    habr.com/ru/articles/1036946/

    #биты #битовая_магия #данные #индекс #кодировки #кодирование #наука #теория_информации

  25. [Перевод] YellowKey: zero-day эксплойт полностью обходит стандартную защиту BitLocker в Windows 11

    Тридцать секунд, USB-флешка и зажатая клавиша Ctrl — этого достаточно, чтобы превратить «надёжно зашифрованный» корпоративный ноутбук в открытую книгу. Никакого подбора паролей, никаких хитрых атак на TPM — просто папка с подозрительным именем и среда восстановления Windows, любезно открывающая командную строку с полным доступом к диску.

    habr.com/ru/companies/cloud4y/

    #информационная_безопасность #bitlocker #данные #хранение_информации #пароли

  26. Нужно проанализировать данные? Какую нейросеть выбрать в SpeShu.AI

    Чтобы 1 000 строк таблицы обработать за 5 минут, нужна нейросеть с большим контекстом. Что это, какие топ-5 нейросетей лучше использовать и как написать правильный промпт, дочитайте статью и получите ответы.

    habr.com/ru/companies/tsnis/ar

    #нейросети #данные #таблицы #excel #гайд #промпт #проанализировать_данные

  27. Книга: «Машинное обучение на табличных данных: XGBoost, глубокое обучение и ИИ»

    Привет, Хаброжители! Машинное обучение может ускорить выполнение повседневных бизнес-задач, таких как сверка счетов, прогнозирование спроса или автоматизация обслуживания клиентов, не говоря уже о более сложных задачах, например выявление мошенничества, прогнозное техническое обслуживание и персонализированный маркетинг. Извлекайте важную информацию из электронных таблиц, реестров, баз данных и других источников, используя градиентный бустинг, глубокое обучение и генеративный ИИ.

    habr.com/ru/companies/piter/ar

    #анализ #данные #data #ИИ #машинное #обучение #xgboost

  28. **Резюме**
    Автор начинает серию заметок о децентрализации без жёсткой структуры, рассматривая её как живой и незавершённый процесс. В либертарианской логике децентрализация естественно предпочтительнее, поскольку снижает необходимость централизованного контроля и опирается на добровольную координацию. Это хорошо работает для краткосрочных задач, но хуже — для долгосрочной инфраструктуры, где требуется устойчивое управление.

    В таких случаях возникает либо частная инициатива, либо централизация через платформы. В цифровой среде это усиливается эффектами масштаба: платформы стремятся к монополизации, расширению функций и извлечению максимальной ценности из пользователей (включая эксплуатацию данных и алгоритмическое влияние).

    Итог — не победа одной модели, а динамическое равновесие между централизованными и децентрализованными системами, которое постоянно смещается под влиянием технологий и регуляций.

    ---

    **Комментарий**
    Сильное место — акцент на инфраструктуре: именно здесь ломается наивная вера в «самоорганизацию всего». Децентрализация хорошо решает проблему координации, но плохо — проблему ответственности и долговременных обязательств.

    Ключевой неявный тезис:
    децентрализация — это не альтернатива централизации, а слой поверх неё или вокруг неё.

    Платформы выигрывают не потому, что «лучше», а потому что:

    * минимизируют транзакционные издержки
    * агрегируют доверие
    * капитализируют сетевые эффекты

    Поэтому реальная борьба идёт не «централизация vs децентрализация», а за контроль над узкими местами: идентичность, данные, расчёты, право.

    Если развивать дальше — самое интересное будет в:

    * децентрализации доверия (identity, reputation)
    * переносе правоприменения в код (но с риском арбитража вне кода)
    * гибридных моделях (CeDeFi, федерации, DAO с оффчейн-управлением)

    ---

    **Хэштеги**
    #децентрализация #централизация #платформы #сетевыеэффекты #инфраструктура #либертарианство #цифроваяэкономика #DAO #DeFi #регуляция #данные #алгоритмы

  29. Перенос данных из отчетов 1С в PostgreSQL в два клика

    Все началось с того, что мне поставили задачу: «У менеджеров есть большой телевизор. Сделай так чтобы у них там крутились красивые циферки и графики с результатами продаж».

    habr.com/ru/articles/1028016/

    #postgresql #postgres #superset #apache #python #1c #excel #данные #перенос

  30. «Музыка на костях», или как современный ИТ-бизнес лишил пользователей субъектности

    «Можно, я не буду регистрироваться — давайте обсудим всё, как раньше?» — возмутился старый клиент одного уважаемого сервиса, когда ему предложили завести аккаунт на новой платформе. Медицинскую клинику у приличных людей сегодня выбирают не по рейтингу, не по врачам и не по локации. А по тому, в чьих руках окажется анамнез после лечения. Попадали ли когда-нибудь анализы её пациентов в открытый доступ? Если нет — можно рискнуть. Гарантий, впрочем, никаких.

    habr.com/ru/companies/tsnis/ar

    #конфиденциальность #данные #данные_пользователей #цифровизация #большой_брат

  31. Next Best Action: от задолженности к прибыли через персонализацию коммуникаций

    Привет, Хабр! На связи — Ольга Кравченко, техдиректор по разработке моделей Газпромбанк.Тех. Сегодня я поделюсь кейсом, как наша команда создала инструмент, позволяющий нам продвигаться от просроченной задолженности к прибыли через персонализацию коммуникаций. Эта статья основана на моём выступлении на

    habr.com/ru/companies/oleg-bun

    #Data_Engineering #высоконагруженные_системы #искусственный_интеллект #Next_Best_Action #ml #данные #большие_данные

  32. Обучение ИИ в «диких» условиях: как рутинные действия превращаются в датасеты

    Часто полезные данные для обучения ИИ — побочный продукт от действий пользователя в игре, навигаторе или фитнес-приложении. Пользователь делает то, ради чего пришел: ловит виртуальных шушпанчиков, катается на велосипеде, объезжает пробки, вводит капчу — а где-то фоново формируется датасет. Это уже много обсуждали в комментариях к истории использования данных Pokémon Go для обучения пространственного ИИ (spatial AI). В этом материале я расскажу о кейсе Pokémon Go и о том, как работает использование данных из приложений.

    habr.com/ru/companies/ru_mts/a

    #искусственный_интеллект #датасет #data_engineering #данные #сбор_данных_для_ии

  33. Организация как Код: как описывать подразделения как исполнимые сервисные контракты

    В большинстве компаний подразделение до сих пор описывается двумя способами. Первый — оргсхема, где есть прямоугольник с названием отдела и стрелками подчинённости. Второй — положение о подразделении, где сказано, что оно «обеспечивает», «контролирует», «сопровождает» и «взаимодействует». Формально этого достаточно: отдел существует, функции перечислены, зона ответственности обозначена. Но как только возникает практический вопрос — что именно это подразделение обязано делать, по каким правилам, с каким SLA, где проходят границы его ответственности и как проверить исполнение, — оказывается, что в явном виде ответа нет. Знания хранится в регламентах, в BPM-системе, в локальных договорённостях, в головах сотрудников. Пока команда стабильна, это ещё может работать. Но при росте нагрузки, смене руководителя, цифровизации или попытке встроить в контур AI всё начинает рассыпаться. Новый руководитель читает документы, которые не совпадают с реальностью. Аналитик восстанавливает процесс по кускам. Автоматизация покрывает отдельные сценарии, но не даёт целостной модели того, что именно подразделение обязано гарантировать организации. Меня зовут Денис Селезнёв, я генеральный директор «Первой Формы» — российской BPM-платформы для автоматизации бизнес-процессов в крупных компаниях. В этой статье я расскажу, почему привычное описание подразделений перестало работать как управленческий инструмент, как мы подошли к этому через концепцию Организация как Код (OaC) и почему начали описывать подразделения не как функции на оргсхеме, а как исполняемые сервисные контракты.

    habr.com/ru/companies/1forma/a

    #автоматизация_процессов #bpms #bpmсистемы #lowcode #llm #bpmn #эффективность_процессов #ai #данные

  34. Создание централизованного центра управления основными данными

    ​В современном корпоративном ландшафте, особенно на предприятиях с многолетней историей ИТ-развития, управление основными данными (master data) часто становится одной из наиболее острых проблем. Разрозненные приложения, унаследованные от разных...

    #DST #DSTGlobal #ДСТ #ДСТГлобал #архитектура #API #управление #MDH #SSOT #APIинтерфейсы #данные #интерфейс

    Источник: dstglobal.ru/club/1170-sozdani

  35. Подача в стиле расследовательской OSINT-аналитики с аккуратными формулировками и встроенными хэштегами:

    ---

    Ранее в публичном поле уже появлялись сообщения о предполагаемых связях между фигурой Василия Лефтерова, структурами 51-й армии и схемами нелегального оборота табачной продукции — эти материалы циркулировали в рамках независимых публикаций и требуют верификации (#OSINT, #расследование, #проверкаинформации). Новые данные, поступающие из открытых и полуоткрытых источников, позволяют говорить о возможной эскалации ситуации (#инсайд, #анализ, #данные).

    Согласно заявлениям, 31 июля 2025 года силовые структуры на территории ДНР провели операцию по выявлению крупного склада контрафактной табачной продукции, оценённой примерно в 165 млн рублей (#контрафакт, #табак, #экономическиепреступления). В ряде сообщений утверждается, что продукция могла быть связана с компанией «РТ 2015», где фигурирует фамилия Лефтерова и его окружения (#бизнес, #связи, #теневаяэкономика).

    Отдельные источники описывают предполагаемую структуру распределения ролей внутри группы: упоминаются лица, которые могли отвечать за бухгалтерские операции, логистику, сбыт и взаимодействие с подставными юридическими лицами (#ОПГ, #схемы, #черныйрынок). Также в этих материалах фигурируют утверждения о возможных эпизодах, связанных с аграрными активами и промышленными ресурсами (#рейдерство, #ресурсы, #уголь, #металл).

    При этом важно отметить, что подобные утверждения не сопровождаются публично доступными судебными решениями, а значит требуют дополнительной проверки и подтверждения со стороны официальных следственных органов (#фактытребуютпроверки, #следствие, #закон).

    Ряд сообщений также касается образа жизни фигуранта, включая возможное несоответствие между декларируемыми доходами и демонстрируемыми активами (#коррупция, #доходы, #активы). Эти аспекты традиционно рассматриваются как индикаторы для финансового анализа, но сами по себе не являются доказательством правонарушений (#финансы, #комплаенс).

    Отдельный блок утверждений, распространяемых в сети, касается личной жизни и поведения фигурантов. Такие сведения носят чувствительный характер, не поддаются независимой верификации и потому требуют особенно осторожного отношения (#этика, #ответственность, #информация).

    В совокупности, описанный массив данных формирует картину, которая может представлять интерес для дальнейшего расследования, однако на текущем этапе остаётся в статусе неподтверждённых утверждений (#журналистика, #документы, #верификация).

    ---

    В конце:

    #OSINT #расследование #проверкаинформации #инсайд #анализ #данные #контрафакт #табак #экономическиепреступления #бизнес #связи #теневаяэкономика #ОПГ #схемы #черныйрынок #рейдерство #ресурсы #уголь #металл #фактытребуютпроверки #следствие #закон #журналистика

    bastyon.com/svalmon37?ref=PJ51

    bastyon.com/post?s=9a104ca6cbd

  36. Стена данных: почему ИИ упирается не в GPU, а в реальность

    В новой статье наш эксперт Антон Пчелинцев размышляет о причинах дефицита качественных данных, следующем прорыве в области развития ИИ и о том, что делать для получения преимущества.

    habr.com/ru/articles/1016998/

    #искусственный_интеллект #машинное+обучение #bigdata #стена_данных #gpu #gpgpu #данные #качество_данных #synthetic_data #синтетические_данные

  37. Где была Алиса Селезнева. Искал ее адреса с помощью Python

    С помощью Python провел исследование космических адресов Алисы Селезневой. Вокруг нее было так много планет, неплохо исследованных, а посетила она только малую часть из них.

    habr.com/ru/articles/1011866/

    #python #nltk #аналитика #визуализация_данных #данные #научнопопулярное #научнаяфантастика #научная_фантастика #читальный_зал #проза

  38. Ударим автопробегом по галактическому бездорожью и разгильдяйству

    или как уместить Вселенную в iPhone, не привлекая внимания санитаров Разработчики — люди в целом неплохие, но с одной странностью: когда задача кажется им большой, они добавляют слой. Потом ещё слой. Потом, в три часа ночи, смотрят на то, что получилось, и долго молчат. Автор проекта «ЭХО» взял и убрал всё лишнее. Без предупреждения, без RFC, без голосования в команде. Остался минимальный Linux, один бинарник на Go и файловая система — всё остальное полетело в мусор вместе с базами данных, фреймворками и «чёрными ящиками» с гарантией на три года. Получилась система на 250 миллионов анкет, которая работает на обычном пользовательском компьютере и не требует звонить в поддержку AWS в два часа ночи. Но 250 миллионов — это как-то мелко, правда? Давайте замахнёмся на Вселенную. Ну или хотя бы на Млечный Путь для начала.

    habr.com/ru/articles/1015652/

    #данные #хранение_данных #оптимизация_программ

  39. 🇺🇸 Армия США заключила с американской оборонной компанией Anduril контракт на сумму до 20 млрд долларов на создание единой системы на базе коммерческих решений, включая платформу Lattice с открытой архитектурой и поддержкой искусственного интеллекта.

    В единую "готовую к выполнению задач" систему будут интегрированы программное обеспечение, оборудование, данные, вычислительная инфраструктура и услуги технической поддержки.

    Контракт рассчитан на 10 лет и действует до 12 марта 2036 года.

    По данным Bloomberg, соглашение предусматривает закупку у Anduril программных и аппаратных решений для нужд армии США и отражает растущую роль технологических оборонных стартапов в американских военных программах.

    @yigal_levin

    #хэштеги
    #США #USArmy #Anduril Industries #Lattice
    #miltech #defenseTech #AI #искусственныйинтеллект
    #военныетехнологии #цифровизацияармии #openarchitecture
    #стартапы #оборонка #контракт #Пентагон
    #сетецентрическаявойна #militaryAI #C4ISR
    #данные #инфраструктура #интеграция #будущеевойны

    bastyon.com/svalmon37?ref=PJ51

  40. CW: local YandexGPT about fedi

    🔶 Привет, друзья! 🔶

    Сегодня хочу поговорить о преимуществах децентрализованных социальных сетей!
    🌐✨

    Вы наверняка замечали, что традиционные соцсети собирают огромное количество данных о пользователях, которые затем используются для таргетированной рекламы и других целей. В децентрализованных сетях всё иначе!

    ✅ Контроль над личными данными: в децентрализованных сетях вы сами решаете, какую информацию о себе раскрывать и кому. Ваши данные не попадают в руки третьих лиц без вашего согласия.

    ✅ Отсутствие цензуры: в традиционных соцсетях алгоритмы модерации контента часто бывают непрозрачными и предвзятыми. В децентрализованных сетях решения о том, какой контент публиковать, принимаются сообществом, что позволяет избежать цензуры и ограничений свободы слова.

    ✅ Безопасность: децентрализованные сети используют более надёжные технологии шифрования и аутентификации, что делает их менее уязвимыми для хакеров и других злоумышленников.

    ✅ Сохранение анонимности: в некоторых децентрализованных сетях можно сохранять анонимность, что особенно важно для тех, кто хочет избежать слежки или преследования.

    ✅ Независимость от крупных корпораций: децентрализованные сети не зависят от крупных корпораций, которые могут менять правила и условия использования в одностороннем порядке.

    Присоединяйтесь к нам в децентрализованной социальной сети и откройте для себя новые возможности!
    🌟

    #децентрализация #свобода #анонимность #независимость #безопасность #данные #соцсети

  41. Как унифицированные конвейеры обработки данных трансформируют современную инфраструктуру ИИ

    ​В настоящее время ИИ использует разнообразные типы данных, и старые конвейеры обработки данных испытывают трудности. Единые потоки данных централизуют данные, упрощая управление и улучшая обучение и производительность...

    #DST #DSTGlobal #ДСТ #ДСТГлобал #искусственныйинтеллект #Многоформатныеданные #моделиии #Инфраструктура #данные #вычисления

    Источник: dstglobal.ru/club/1141-kak-uni

  42. LLMOps: объяснение принципа работы, основные преимущества и лучшие практики

    ​В этой статье рассматривается LLMOps, принцип его работы, основные преимущества и лучшие практики для оптимизации операций с большими языковыми моделями с целью повышения эффективности и масштабируемости.

    #DST #DSTGlobal #ДСТ #ДСТГлобал #Искусственныйинтеллект #данные #вычисления #большаямодель #языковаямодель #LLMOps #XAI #GDPR #HIPAA #LLM #Docker #Kubernetes #GPT #OpenAI

    Источник: dstglobal.ru/club/1140-llmops-

  43. Лучшие практики переноса данных из устаревших систем с использованием ИИ

    ​В этой статье мы узнаем о миграции данных с помощью ИИ, в том числе тем, что сработало хорошо, и основными уроками, извлеченными в ходе этого процесса.

    Миграция данных — один из самых сложных и рискованных этапов модернизации устаревших систем. Неудивительно...

    #DST #DSTGlobal #ДСТ #ДСТГлобал #искусственныйинтеллект #данные #CICD #ETL #хранилищаданных #инструменты ИИ #миграция

    Источник: dstglobal.ru/club/1130-luchshi

  44. ИИ и проверка данных: будущее бизнеса

    Объединение возможностей искусственного интеллекта с системами и инструментами проверки данных сегодня становится лидером в деловом мире.

    Многие организации вкладывают финансовые ресурсы в усовершенствованные решения для проверки данных. Это снижает опасения по поводу рисков, связанных...

    #DST #DSTGlobal #ДСТ #ДСТГлобал #искусственныйинтеллект #проверкаданных #данные #Data #QualityOps #ИИсистемы #Машинноеобучение #ML

    Читать далее: dstglobal.ru/club/1103-ii-i-pr

  45. 📊 Самые популярные приложения в F-Droid

    divestos.org/pages/fdroid_stat

    F-Droid является свободным каталогом приложений для Android, уважающим конфиденциальность пользователей. Поэтому там нет каких-либо метрик, трекеров и, следовательно, сортировок по популярности. По крайней мере так я раньше думал.

    Ещё с 2021 года (f-droid.org/en/2021/03/01/fdro) ведётся конфиденциальный сбор данных, который включает в себя количество скачиваний приложений. Недавно один из участников проекта создал скрипт для компоновки данных (gitlab.com/thgoebel/fdroid-met), а разработчик DivestOS создал сайт с популярными приложениями. В списке более 1000 приложений, на каждое можно нажать, чтобы увидеть график. Считаются скачивания только из официального репозитория F-Droid.

    Вот первые 10 приложений по среднему количеству установок за неделю (ещё 40 в ответах). Судя по всему они очень нестабильные, и меняются хаотично.
    1. Termux (f-droid.org/packages/com.termu) (эмулятор терминала): 225 926
    2. F-Droid (f-droid.org/packages/org.fdroi) (клиент F-Droid): 69 435
    3. Aurora Store (f-droid.org/packages/com.auror) (клиент Google Play): 29 208
    4. Fennec F-Droid (f-droid.org/packages/org.mozil) (браузер на основе Firefox): 14 874
    5. Seal (f-droid.org/packages/com.junkf) (приложение yt-dlp): 12 584
    6. OsmAnd~ (f-droid.org/packages/net.osman) (карты OpenStreetMap): 11 076
    7. Mull (f-droid.org/packages/us.spotco) (браузер на основе Firefox): 11 008
    8. DAVx⁵ (f-droid.org/packages/at.bitfir) (клиент CalDAV/CardDAV): 10 788
    9. InnerTune (f-droid.org/packages/com.zionh) (клиент YouTube Music): 10 215
    10. Droid-ify (f-droid.org/packages/com.looke) (клиент F-Droid): 10 004

    #android #андроид #fdroid #stats #статистика #data #данные

  46. Подборка источников открытых данных по самым разным темам, от авиатранспорта и спутников до данных об экологической обстановке и сельском хозяйстве: https://habr.com/ru/companies/bastion/articles/806195/ #данные #источники_данных #подборки

Share
Share on Mastodon

Enter the server where you have an account.