Big Data to dane o takiej skali, różnorodności lub szybkości napływu, że tradycyjne narzędzia (relacyjna baza, Excel, pojedynczy serwer) przestają wystarczać. Klasyczna definicja przez „3V": volume (objętość - terabajty i więcej), velocity (szybkość - dane strumieniowe, np. z czujników), variety (różnorodność - obok tabel także teksty, obrazy, logi). Bywa rozszerzana o veracity (wiarygodność) i value (wartość).
Analityk biznesowy rzadko buduje platformy big data, ale bywa tym, kto decyduje, czy w ogóle są potrzebne. Jego rola: przetłumaczyć problem biznesowy na pytanie o dane i ocenić, czy odpowiedź wymaga klastra obliczeniowego, czy porządnego zapytania SQL.
I tu przykład odwrotny, celowo. MediFlow - 12 przychodni, około 300 tys. wizyt rocznie, baza pacjentów poniżej miliona rekordów - to nie jest big data. Wszystko mieści się w jednej bazie PostgreSQL i dobrze napisanych zapytaniach. Big data zaczęłoby się, gdyby sieć ruszyła z telemedycyną opartą na ciągłym strumieniu danych z opasek pacjentów kardiologicznych: tysiące pomiarów na sekundę, dane niestrukturalne, analiza w czasie zbliżonym do rzeczywistego.
Najczęstsza pomyłka na polskim rynku: nazywanie „big data" wszystkiego, co nie mieści się w Excelu. Większość firm deklarujących big data ma w praktyce średnie dane i duży problem z ich jakością - a żadna technologia nie naprawi danych, w których 8% rekordów nie ma numeru telefonu. Najpierw jakość i model danych, potem skala.
Pojęcia powiązane: hurtownia danych, data lake, data quality, business intelligence.