W świecie analizy danych największym wyzwaniem rzadko bywa samo narysowanie wykresu. Najwięcej czasu pochłania przygotowanie danych: pivotowanie tabel, filtrowanie, łączenie źródeł czy dopasowywanie typów danych. Rozwiązaniem tego problemu ma być Data Formulator – rozwijany na licencji open source projekt badawczy od Microsoft Research, który łączy klasyczne UI analityczne z mocą agentów AI i modeli LLM.
Czym jest i do czego służy Data Formulator?
Data Formulator to interaktywne środowisko analityczne wspomagane sztuczną inteligencją. Narzędzie pozwala eksplorować surowe dane i przekształcać je w czytelne wizualizacje za pomocą języka naturalnego – bez konieczności ręcznego pisania skomplikowanych skryptów transformujących.
Przykłady zastosowań w praktyce:
- Szybkie zestawienia ze zrzutów ekranu lub tekstu: Masz tabelę na zrzucie ekranu z PDF-a albo nieuporządkowane logi tekstowe? Wklejasz je do Data Formulatora, a agent wyodrębnia dane i buduje z nich gotowy model tabelaryczny.
- Badanie korelacji bez pisania SQL/Pandas: Wystarczy polecenie: „Pokaż średnie zużycie zasobów w podziale na klastry i oznacz anomalie kolorem czerwonym” – narzędzie samo dokona agregacji i dobierze właściwy wykres.
- Testowanie alternatywnych hipotez (A/B analizy): Jeśli chcesz sprawdzić dwa różne warianty grupowania danych, nie musisz nadpisywać bieżącego widoku ani tworzyć oddzielnych skoroszytów – tworzysz nową gałąź wątku analitycznego.
Kluczowe funkcjonalności
- Transformacja danych w locie (Data Formulation): Agenci AI piszą i wykonują w tle kod przekształcający dane pod zadany cel wizualizacji.
- Drzewiasta struktura analizy (Data Threads): Historia zapytań nie jest prostym czatem – to drzewo powiązań, w którym można swobodnie cofać się, tworzyć odgałęzienia (branching) i porównywać różne ścieżki wnioskowania.
- Silnik wizualizacji Flint: Ponad 30 typów wykresów z możliwością precyzyjnego dostrajania stylu przez dedykowanego agenta lub interfejs graficzny.
- Wielorodne źródła danych: Obsługa plików płaskich (CSV, TSV, JSON, Excel), baz SQL (PostgreSQL, MySQL, MSSQL, DuckDB, ClickHouse) oraz platform chmurowych (Databricks, Azure Data Explorer).
- Wsparcie dla modeli lokalnych i chmurowych: Możliwość podpięcia OpenAI, Azure OpenAI, Anthropic, a także lokalnych instancji przez Ollama.
Szybkie wdrożenie: Docker Compose (Linux, macOS, Windows)
Dzięki konteneryzacji uruchomienie Data Formulatora w lokalnym środowisku sprowadza się do kilku prostych kroków.
Krok 1: Klonowanie repozytorium
git clone https://github.com/microsoft/data-formulator.git cd data-formulator
Krok 2: Przygotowanie pliku konfiguracyjnego .env
Projekt dostarcza szablon .env.template. Skopiuj go jako .env:
# Linux / macOS: cp .env.template .env # Windows (PowerShell): Copy-Item .env.template .env
(Opcjonalnie: w pliku .env możesz od razu zdefiniować klucze API, np. OPENAI_API_KEY=twoj_klucz, choć można je również podać bezpośrednio w UI).
Krok 3: Uruchomienie kontenera
docker compose up --build -d
Aplikacja wystawia interfejs webowy pod adresem: http://localhost:5567
Podsumowanie
Data Formulator to świetny przykład tego, jak LLM-y mogą usprawnić codzienną pracę z danymi bez odbierania użytkownikowi kontroli nad procesem. Jeśli szukasz lekkiego narzędzia do szybkiego prototypowania wykresów i analiz bez mozolnego pisania kodu filtrującego – zdecydowanie warto postawić ten kontener na swoim serwerze lub stacji roboczej.
Demo: https://data-formulator.ai/
Repozytorium GitHub: https://github.com/microsoft/data-formulator


