home.social

#big-data — Public Fediverse posts

Live and recent posts from across the Fediverse tagged #big-data, aggregated by home.social.

fetched live
  1. @slothrop @jalefkowit in the big data world we discuss how CSV files form the Dark Matter of data
    - unstructured
    - lots of it
    - nobody knows where it all is
    - holds the universe together

    I still remember that bug a customer found in production where ingress of a 8+ GB CSV file into Apache Spark from Azure Storage could drop rows. Nobody tested at that size because "who has a CSV file that big?". Someone did.
    #bigdata

  2. God weekend læsning:
    Researchers og investorer kom til at forvente #AI, der var "urørt af menneske hånd", der lærte sig selv, hvordan verden fungerede

    Dette er den self-licking ice-cream cone af machine learning, verden af "teori-fri inferens", (act or process of deriving logical conclusions from premises known or assumed to be true.) der havde drevet #BigData -industrien

    Med teori-fri inferens behøver du ikke finde ud af, hvordan verden fungerer for at handle på det
    pluralistic.net/2026/08/21/wor

  3. Starcloud raises $250M more for orbital data centers
    Starcloud says it has raised $250 million in new funding to support the creation of a constellation of data center satellites powered by Nvidia’s next-generation AI chips.

    The Series A extension funding round was led by Manhattan West, with participation from existing investor
    cosmiclog.com/2026/08/21/starc
    #GeekWire #ArtificialIntelligence #BigData #Satellites #Space #Starcloud

  4. Digital Preservation at the University of Cambridge Libraries and Archives: Using Data Analysis to Untangle a 75TB Digital Preservation Problem. “For over two decades starting in 2000, the Streaming Media Service (SMS) served as the primary platform for managing and delivering audio and video content across the University. When the service reached its end-of-life in late 2025, the entire system […]

    https://rbfirehose.com/2026/08/21/digital-preservation-at-the-university-of-cambridge-libraries-and-archives-using-data-analysis-to-untangle-a-75tb-digital-preservation-problem/
  5. Endlich kann KI Geld verdienen!

    Jetzt gibt es endlich eine Perspektive zum Geld verdienen mit KI. Die Gebühren für die Token, die man zur Nutzung der Modelle kaufen oder abonnieren muss, können die Kosten nicht im entferntesten decken. Wie lässt sich richtig Geld scheffeln? Mit Werbung, besonders personalisierter Werbung! Und mit der Datensammlung, die der Personalisierung zugrunde liegt. Apple, Google, META und Microsoft machen das seit vielen Jahren vor. Jetzt will auch OpenAI Werbung ausspielen, und zwar im kostenlosen Tarif und im kleinsten der Bezahlmodelle. Neeeiiin, der Schutz der Privatsphäre sei weiterhin gewährleistet ...

    pc-fluesterer.info/wordpress/2

    #bigdata #identitt #KI #privacy #UnplugTrump #verfolgung #werbung

  6. Ducks are now loving Symfony!

    I've built the Doctrine DBAL for DuckDB.

    It brings the whole DuckDB ecosystem to Symfony (types, extensions, parquet, data lakes, etc.).
    Now you can run high performance analytics directly on your laptop or webserver together with Symfony and Doctrine ORM!
    Releases are available on GitHub and Packagist.

    github.com/thomas-0816/doctrin
    packagist.org/packages/thomas-

    #php #symfony #analytics #duckdb #doctrine #bigdata

  7. There’s no such thing as free ice cream … even if we want it

    Candid camera experiment where people were asked #personal questions in exchange for #free ice cream.

    Most of them refused to answer and preferred not to get a #free ice cream.

    threema.com/assets/videos/ice_

    #privacy #messaging #BigData #BigBrother #video #IceCream #data #surveillance #CorporateGreed #SurveillanceCapitalism #PersonalData

  8. Über Daten reden jetzt viele – sie im Unternehmens- und Forschungsalltag effizient erarbeiten, gelingt nicht immer: Das will der Bavarian Data Summit verbessern: Am 5. Oktober können Sie sich inspirieren lassen – von Vorträgen, Workshops, KI-Expertinnen, Daten-Spezialisten, Firmen, Forschenden.Das LRZ und BAIOSPHERE sind mit von der Partie - wir freuen uns auf Fragen, Ideen, Anregungen.
    Hier gehts zur Information : bayern-innovativ.de/events-ter

    #data #bigdata #ki #ai #machinelearning

  9. Google kauft Datenbestand von bankrotter Fluglinie

    Die US-Fluglinie Spirit war durch den Rückgang der Passagierzahlen wegen der SARS-CoV-2 Pandemie in wirtschaftliche Schwierigkeiten geraten, von denen sie sich nie wieder erholt hat. Im Mai diesen Jahres musste sie endgültig Konkurs anmelden. Damit wenigstens ein Teil der aufgelaufenen Schulden getilgt werden kann, wurde die Konkursmasse versteigert. So weit, so normal. Ungewöhnlich ist ein Posten in der Konkursmasse, den Google ergattert hat: Der gesamte Datenbestand der Fluglinie. Zu dem gehören unter anderem rund ... Weiterlesen:

    pc-fluesterer.info/wordpress/2

    #bigdata #google #KI #UnplugGoogle #UnplugTrump #usa #zahlen

  10. META in USA auf der Anklagebank

    Kaum zu glauben, aber wahr: Sogar in den USA regt sich eine Gegenbewegung, die auch juristisch gegen die Pest der kommerziellen antisozialen Plattformen vorgeht. Nach dem kleineren Präzedenz-Urteil im März (Meldungen hier oder hier) hat gerade ein groß aufgezogener Prozess gegen META begonnen. Meldungen dazu gibt es hier, hier, hier oder hier. Die Vorwürfe gegen das Imperium des Herrn Z. sind wohlbekannt, seine Ausflüchte ebenfalls. Dass die Vorwürfe zutreffen, ergibt sich bereits rein phänomenologisch durch die Entscheidungen und Handlungen von Herrn Z.. In diesem Gerichtsverfahren ... Weiterlesen:

    pc-fluesterer.info/wordpress/2

    #antisoziale #bigdata #fcbook #jugendschutz #meta #politik #privacy #unplugmeta #UnplugTrump #verbraucherschutz #verfolgung #whatsapp

  11. “We cannot see efficiency… datasets… compressed into something that simplifies value and helps us better serve communities.”

    Nur Hafiza Mutalif from Singapore Red Cross on the human purpose behind humanitarian data. How can big data truly serve people in crisis?

    Watch on YouTube: youtube.com/shorts/RfVnXsN5Z30

    #AnalysePodcast #BigData #HumanitarianAid #TechForGood

  12. Computer Weekly: Natural History Museum’s ‘living laboratory’ logs 11 million environmental records in first year. “The Natural History Museum’s (NHM’s) ‘living laboratory’ garden has collected more than 11 million environmental data records in its first year, feeding readings from more than 50 sensors into the Museum’s Amazon Web Services (AWS)-powered Data Ecosystem.”

    https://rbfirehose.com/2026/08/18/computer-weekly-natural-history-museums-living-laboratory-logs-11-million-environmental-records-in-first-year/
  13. Tom’s Hardware: Judge clears Nine PBS to retrieve 70 years of archival TV data — court rules station owns 50TB of data in Iron Mountain servers after host went under. “There’s light at the end of the tunnel for Nine PBS. We reported last week that the station lost access to 50TB of data representing 70 years of TV history. The issue was that its cloud storage provider went out of business […]

    https://rbfirehose.com/2026/08/18/toms-hardware-judge-clears-nine-pbs-to-retrieve-70-years-of-archival-tv-data-court-rules-station-owns-50tb-of-data-in-iron-mountain-servers-after-host-went-under/
  14. Alterskontrolle antisoziale Plattformen: Fehlstart in Frankreich

    Über den untauglichen Versuch, Kinder und Jugendliche durch Altersbeschränkungen vor den Schäden durch kommerzielle antisoziale Plattformen zu schützen, habe ich schon häufig berichtet. In Europa war Frankreich das erste Land, das dieser Falle der Betreiber auf den Leim gegangen war. War, Vergangenheitsform? Ja, genau. Am 21.7. wurde das entsprechende Gesetz beschlossen. Es wurde von Fachleuten schon damals für falsch gehalten. Noch bevor das Gesetz wie geplant ab 1.9. in Kraft treten konnte, hat der französische Verfassungsrat (Verfassungsgericht) das Vorhaben als nicht ... Weiterlesen:

    pc-fluesterer.info/wordpress/2

    #antisoziale #bigdata #Eltern #jugendschutz #politik #unplugmeta #UnplugTrump #verbraucherschutz #wissen

  15. #CitationsNeeded pod

    'In this episode, we break down the popular "inevitability" argument #AI companies are using to bulldoze over democracy and how the "inevitability" line has been used to sell everything from Manifest Destiny to poverty-creating "free trade deals".'

    guest: historian Amy Woodson Bolton

    citationsneeded.libsyn.com/ep-
    #tech #artificialIntelligence #dataCenters #BigData #techFutures #techCriticism #mediaCriticism #media

  16. Предиктивное обслуживание в промышленности: три системных условия, без которых технологии не работают

    Сотни миллиардов вложены в IIoT, предиктивную аналитику и цифровые двойники. Но часто проекты предиктивного ТОиР достигают технологического успеха — и операционного провала: модели верно прогнозируют отказы, а оборудование по-прежнему ремонтируют «по факту». В статье разбираю три условия, без которых предиктивная диагностика не становится частью реальной работы.

    habr.com/ru/companies/seversta

    #bigdata #искусственный_интеллект #industrial_iot #детектор_аномалий #мониторинг_оборудования

  17. Пишем свой Native Filter плагин для Apache Superset: пошаговый рабочий туториал

    Всем привет! Меня зовут Александр Цай, я ведущий инженер-аналитик в МТС Web Services. Занимаюсь всем, что связано с данными и ИИ. Найти, заполучить, обработать, спроектировать, развернуть — это все ко мне. Опущу все нудные подробности, решили мы развернуть себе Superset 6.1.0 — последнюю версию, но столкнулись с тем, что заказчику категорически не нравится штатный фильтр по датам и он не хочет пересаживаться со своего BI, а хочет он календарик. А еще — пару плагинов с оглядкой на PowerBI. Поэтому встал вопрос создания собственного плагина-фильтра. Казалось бы, задача несложная. Пара-тройка гайдов в en сегменте имеется, есть даже документация и штатный генератор шаблонов. Но по факту оказалось, что все это не работает. Генератор так вообще не обновлялся аж с 2024 года: выдает шаблон, который ссылается на уже несуществующие классы и типы, что автоматически делает все гайды неактуальными… А что все это значит? Время написать свой собственный! Об этом и расскажу в сегодняшнем материале. Дисклеймер: Я питонист до мозга костей и в тайпскрипте, да и фронте в целом, понимаю не очень много. Простите меня, адепты сего языка программирования, но код самого плагина навайбкожен (хоть и проверен насколько я смог). В npm не запушил тоже умышленно, цель статьи — дать исходники и показать, как можно собрать плагин. Любой желающий может что-то додумать и доработать, собрать или разобрать и так далее. Читать дальше

    habr.com/ru/companies/ru_mts/a

    #apache_superset #tutorial #dyi #визуализация_данных #sql #bigdata #apache #frontend #typescript

  18. Andrew Guthrie Ferguson, a professor at the George Washington University Law School whose scholarship has focused on #policing, #BigData #surveillance & the #FourthAmendment, said Thursday’s shifts were “better than the opposite” but called for further scrutiny of the #technology in the form of “sustained democratic engagement with the rules & judicial checks on access at a minimum.”

    #Flock #law #privacy #InfoSec #immigration #MassSurveillance #tech #AbuseOfPower #deflock

  19. PR Newswire: Former federal data officials answer the question: How many federal datasets have been terminated since January 2025? (PRESS RELEASE). “Today, dataindex.us, the nation’s leading resource for monitoring changes to federal data, published the Federal Data Terminations Tracker—the most policy-relevant, verified source of federal datasets terminated since January 2025. Having evolved […]

    https://rbfirehose.com/2026/08/12/former-federal-data-officials-answer-the-question-how-many-federal-datasets-have-been-terminated-since-january-2025-pr-newswire-press-release/
  20. AI-дайджест #3

    Друзья, всем привет! На связи Ольга Попова, ИИ-Евангелист Лаборатории искусственного интеллекта Департамента больших данных Россельхозбанка. Я подготовила новый дайджест новостей про ИИ. Поехали! Anthropic выпустила Claude Opus 5, OpenAI обновила модель по умолчанию в ChatGPT до GPT-5.6 Luna, Alibaba выпустила Qwen3.8-Max, китайская MiniMax разрабатывает открытую модель с 2,7 трлн параметров и не только! Больше новостей про ИИ

    habr.com/ru/companies/rshb/art

    #AIдайджест #искусственный_интеллект #bigdata #big_data #AI

  21. "Big data isn't just for business. Here, it's about saving lives. For humanitarian aid, we must compress global complexity into clear value to better serve communities.

    That's the powerful vision shared by Nur Hafiza Mutalif of Singapore Red Cross on this week's episode.

    How can data simplify humanitarian action?

    Watch on YouTube: youtube.com/shorts/RfVnXsN5Z30

    #BigData #HumanitarianAid #TechForGood #AnalysePodcast"

  22. #WFP to extend #Palantir contract despite concerns raised in leaked audit

    The #UN's World #Food Programme is finalizing a five-year renewal of its contract with US data software firm Palantir despite “key privacy concerns” raised in a leaked 2025 internal audit.

    The audit, seen by PassBlue and #FRANCE 24, reveals UN misgivings about allowing Palantir to process data for the world’s largest humanitarian supply chain

    france24.com/en/americas/20260

    #corruption #BigData #BoycottUSA #privacy

  23. От 12 часов к 30 минутам: как мы join’им миллиарды товарных движений в ClickHouse

    Всем привет! Меня зовут Муса. Наша команда занимается витринами данных по товарному учёту. Каждый день мы доставляем около 10 млрд записей в разных форматах. На этих данных строится различная аналитика, связанная с товарными запасами и движениями экземпляров. Перед нами встала задача: пять раз в день обогащать выгрузку из миллиардов экземплярных остатков дополнительными атрибутами для построения различного рода аналитики. История этих атрибутов уже измерялась десятками миллиардов записей. Первое решение выглядело просто: положить данные в ClickHouse и сделать JOIN. Но одна выгрузка считалась около 12 часов, а нам нужно было укладываться в десятки минут. В статье расскажу, про то, как мы смогли сократить время обработки примерно до 33 минут, про ключевой подход при работе с большими объёмами данных, а также попытаюсь донести важность локальности данных на примере реальной задачи.

    habr.com/ru/companies/ozontech

    #highload #clickhouse #backend #systemdesign #bigdata #базы_данны #sql #olap #архитектура_данных #ozon_tech