Data Formulator od Microsoftu – zwinna analiza i wizualizacja danych z pomocą AI

W świecie analizy danych największym wyzwaniem rzadko bywa samo narysowanie wykresu. Najwięcej czasu pochłania przygotowanie danych: pivotowanie tabel, filtrowanie, łączenie źródeł czy dopasowywanie typów danych. Rozwiązaniem tego problemu ma być Data Formulator – rozwijany na licencji open source projekt badawczy od Microsoft Research, który łączy klasyczne UI analityczne z mocą agentów AI i modeli LLM.

Czym jest i do czego służy Data Formulator?

Data Formulator to interaktywne środowisko analityczne wspomagane sztuczną inteligencją. Narzędzie pozwala eksplorować surowe dane i przekształcać je w czytelne wizualizacje za pomocą języka naturalnego – bez konieczności ręcznego pisania skomplikowanych skryptów transformujących.

Przykłady zastosowań w praktyce:

  • Szybkie zestawienia ze zrzutów ekranu lub tekstu: Masz tabelę na zrzucie ekranu z PDF-a albo nieuporządkowane logi tekstowe? Wklejasz je do Data Formulatora, a agent wyodrębnia dane i buduje z nich gotowy model tabelaryczny.
  • Badanie korelacji bez pisania SQL/Pandas: Wystarczy polecenie: „Pokaż średnie zużycie zasobów w podziale na klastry i oznacz anomalie kolorem czerwonym” – narzędzie samo dokona agregacji i dobierze właściwy wykres.
  • Testowanie alternatywnych hipotez (A/B analizy): Jeśli chcesz sprawdzić dwa różne warianty grupowania danych, nie musisz nadpisywać bieżącego widoku ani tworzyć oddzielnych skoroszytów – tworzysz nową gałąź wątku analitycznego.

Kluczowe funkcjonalności

  1. Transformacja danych w locie (Data Formulation): Agenci AI piszą i wykonują w tle kod przekształcający dane pod zadany cel wizualizacji.
  2. Drzewiasta struktura analizy (Data Threads): Historia zapytań nie jest prostym czatem – to drzewo powiązań, w którym można swobodnie cofać się, tworzyć odgałęzienia (branching) i porównywać różne ścieżki wnioskowania.
  3. Silnik wizualizacji Flint: Ponad 30 typów wykresów z możliwością precyzyjnego dostrajania stylu przez dedykowanego agenta lub interfejs graficzny.
  4. Wielorodne źródła danych: Obsługa plików płaskich (CSV, TSV, JSON, Excel), baz SQL (PostgreSQL, MySQL, MSSQL, DuckDB, ClickHouse) oraz platform chmurowych (Databricks, Azure Data Explorer).
  5. Wsparcie dla modeli lokalnych i chmurowych: Możliwość podpięcia OpenAI, Azure OpenAI, Anthropic, a także lokalnych instancji przez Ollama.

Szybkie wdrożenie: Docker Compose (Linux, macOS, Windows)

Dzięki konteneryzacji uruchomienie Data Formulatora w lokalnym środowisku sprowadza się do kilku prostych kroków.

Krok 1: Klonowanie repozytorium

git clone https://github.com/microsoft/data-formulator.git
cd data-formulator

Krok 2: Przygotowanie pliku konfiguracyjnego .env

Projekt dostarcza szablon .env.template. Skopiuj go jako .env:

# Linux / macOS:
cp .env.template .env

# Windows (PowerShell):
Copy-Item .env.template .env

(Opcjonalnie: w pliku .env możesz od razu zdefiniować klucze API, np. OPENAI_API_KEY=twoj_klucz, choć można je również podać bezpośrednio w UI).

Krok 3: Uruchomienie kontenera

docker compose up --build -d

Aplikacja wystawia interfejs webowy pod adresem: http://localhost:5567

Podsumowanie

Data Formulator to świetny przykład tego, jak LLM-y mogą usprawnić codzienną pracę z danymi bez odbierania użytkownikowi kontroli nad procesem. Jeśli szukasz lekkiego narzędzia do szybkiego prototypowania wykresów i analiz bez mozolnego pisania kodu filtrującego – zdecydowanie warto postawić ten kontener na swoim serwerze lub stacji roboczej.

Demo: https://data-formulator.ai/

Repozytorium GitHub: https://github.com/microsoft/data-formulator