Databricks
średnio zaawansowany Analitycy danych

Zaawansowana analiza danych w Databricks - SQL, AI/BI i Genie

3 dni online z trenerem, na sali DBAN2_PL
Cel szkolenia
Biorąc udział w szkoleniu, uczestnik rozwinie umiejętność prowadzenia zaawansowanych analiz danych w środowisku Databricks. Nauczy się tworzyć złożone zapytania SQL, analizować dane hierarchiczne i półustrukturyzowane, korzystać z możliwości Delta Lake oraz funkcji AI, a także budować warstwę semantyczną, interaktywne dashboardy AI/BI i rozwiązania oparte na Genie. Pozna również podstawy języka Python oraz interfejsu DataFrame API w PySpark. Uczestnicy wykonują praktyczne ćwiczenia przez całe szkolenie.
Korzyści
Po szkoleniu uczestnik będzie potrafił tworzyć wielopoziomowe raporty i zaawansowane analizy okienkowe, analizować hierarchie, przekształcać układ danych, przetwarzać złożone dokumenty JSON, wykonywać operacje DML na tabelach Delta, korzystać z historii i wersjonowania danych, stosować funkcje AI w zapytaniach SQL oraz diagnozować ich wykonanie. Wykorzystując Python i PySpark, będzie również potrafił utworzyć DataFrame oraz wykonać podstawowe operacje filtrowania, przekształcania, grupowania i agregowania danych. Zdobędzie także umiejętność tworzenia metric views, dashboardów AI/BI oraz konfigurowania i doskonalenia Genie Agenta.
Wymagania wstępne
Uczestnik powinien znać podstawy środowiska Databricks oraz potrafić tworzyć zapytania SELECT, filtrować, sortować, agregować i łączyć dane, a także stosować podzapytania, CTE i podstawowe funkcje okienkowe. Przydatna jest podstawowa znajomość operacji DML oraz danych JSON. Znajomość języka Python ani biblioteki PySpark nie jest wymagana.
Program szkolenia
  1. Organizacja złożonych zapytań
    • organizowanie zapytań za pomocą CTE
    • stosowanie wielu CTE w jednym zapytaniu
    • wybór między podzapytaniem, CTE i widokiem
    • dzielenie złożonej analizy na etapy
    • dokumentowanie analizy w notebookach
  2. Zaawansowane agregacje i raporty wielopoziomowe
    • GROUPING SETS
    • ROLLUP i CUBE
    • rozpoznawanie poziomów agregacji za pomocą GROUPING
    • agregacje warunkowe
    • sumy częściowe i końcowe
    • raporty obejmujące różne poziomy szczegółowości
  3. Zaawansowane funkcje okienkowe
    • definiowanie okien i partycji
    • ramki ROWS i RANGE
    • sumy narastające i miary kroczące
    • porównywanie okresów za pomocą LAG i LEAD
    • FIRST_VALUE, LAST_VALUE i NTH_VALUE
    • rankingi i numerowanie rekordów
    • filtrowanie wyników za pomocą QUALIFY
  4. Analiza hierarchii i zaawansowane złączenia
    • samozłączenia tabel
    • analiza relacji nadrzędny-podrzędny
    • rekurencyjne CTE
    • tworzenie poziomów i ścieżek hierarchii
    • definiowanie warunków rozpoczęcia i zakończenia rekurencji
    • LATERAL i zależne funkcje tabelaryczne
  5. Zaawansowane przekształcanie układu danych
    • zaawansowane zastosowania PIVOT
    • stosowanie wielu agregacji
    • przekształcanie kolumn w wiersze za pomocą UNPIVOT
    • obsługa brakujących wartości
    • porównanie PIVOT z agregacją warunkową
    • przygotowanie danych do raportowania
  6. Zaawansowana analiza JSON i danych typu VARIANT
    • przetwarzanie zagnieżdżonych dokumentów JSON
    • praca z obiektami i tablicami
    • odczytywanie elementów typu VARIANT
    • rozwijanie kolekcji do postaci relacyjnej
    • obsługa brakujących i niejednorodnych pól
    • konwertowanie typów
    • łączenie danych półustrukturyzowanych z tabelami relacyjnymi
  7. Zaawansowane operacje DML i wersjonowanie danych w Delta Lake
    • warunkowe aktualizowanie danych
    • synchronizowanie danych za pomocą MERGE
    • obsługa rekordów dopasowanych i niedopasowanych
    • przeglądanie historii tabel
    • odczytywanie wcześniejszych wersji danych
    • time travel
    • przywracanie wcześniejszych wersji tabel
  8. Funkcje AI w zapytaniach SQL
    • klasyfikowanie tekstu
    • analiza sentymentu
    • wydobywanie informacji z tekstu
    • stosowanie ai_query
    • uzyskiwanie wyników o określonej strukturze
    • łączenie funkcji AI z filtrowaniem i agregowaniem
    • walidowanie wyników generowanych przez AI
    • kontrolowanie liczby wywołań i kosztu analizy
  9. Diagnostyka i optymalizacja zapytań
    • przeglądanie historii zapytań
    • analiza planu wykonania
    • praca z Query Profile
    • identyfikowanie kosztownych operacji
    • ograniczanie odczytywanych wierszy i kolumn
    • eliminowanie zbędnych sortowań i powtarzanych obliczeń
    • porównywanie alternatywnych sposobów zapisania zapytania
  10. Wprowadzenie do Python i PySpark
    • uruchamianie kodu Python w notebooku
    • przełączanie się między SQL i Python
    • podstawowe elementy składni języka Python
    • tworzenie DataFrame na podstawie danych z Unity Catalog
    • prezentowanie danych za pomocą display
    • wybieranie, filtrowanie i przekształcanie kolumn
    • grupowanie i agregowanie danych
    • porównanie SQL z DataFrame API
    • wykorzystanie Genie Code do przygotowania i objaśniania kodu
  11. Warstwa semantyczna i metric views
    • znaczenie warstwy semantycznej
    • definiowanie wymiarów i miar
    • tworzenie metric views
    • budowanie współdzielonych wskaźników
    • stosowanie filtrów i poziomów szczegółowości
    • kontrolowanie spójności definicji biznesowych
    • wykorzystywanie metric views w zapytaniach, dashboardach i Genie
  12. Zaawansowane AI/BI Dashboards
    • projektowanie zestawów danych
    • stosowanie wielu zestawów danych
    • tworzenie dashboardów wielostronicowych
    • prezentowanie KPI, trendów i struktury danych
    • parametry, filtry i interakcje użytkownika
    • wykorzystanie Genie Code
    • publikowanie i udostępnianie dashboardu
    • odświeżanie danych, pamięć podręczna i analiza wykorzystania
  13. Konfigurowanie i doskonalenie Genie Agenta
    • planowanie zakresu tematycznego agenta
    • dobór tabel, widoków i metric views
    • definiowanie instrukcji i kontekstu biznesowego
    • opisywanie relacji i pojęć biznesowych
    • przygotowanie przykładowych zapytań SQL
    • uwzględnianie synonimów i terminologii biznesowej
    • testowanie odpowiedzi agenta
    • porównywanie odpowiedzi z wynikami kontrolnymi
    • doskonalenie instrukcji, opisów i przykładów
    • monitorowanie wykorzystania agenta
  14. Udostępnianie i utrzymanie rozwiązania analitycznego
    • publikowanie rozwiązania dla użytkowników
    • zarządzanie dostępem do dashboardów i agenta
    • rozróżnienie uprawnień do danych i artefaktów analitycznych
    • kontrolowanie aktualności miar i opisów
    • weryfikowanie rozwiązania po zmianach danych
    • dokumentowanie założeń analitycznych
    • współpraca z właścicielem danych i zespołem inżynierskim

Najbliższe terminy

Najbliższe terminy online

Ładowanie terminów…

Najbliższe terminy stacjonarne

Ładowanie terminów…

Formularz zapisu

Dane podane w formularzu posłużą do wystawienia faktury proforma. Po otrzymaniu zgłoszenia skontaktujemy się w ciągu 1 dnia roboczego.

Wybrany termin jest gwarantowany — szkolenie odbędzie się niezależnie od ilości zgłoszeń

Klauzula informacyjna RODO

Administratorem moich danych osobowych jest Dataconsulting Services sp. z o.o. z siedzibą w Warszawie (00-843), Rondo Daszyńskiego 2B, wpisaną do rejestru przedsiębiorców Krajowego Rejestru Sądowego prowadzonego przez Sąd Rejonowy dla m.st. Warszawy w Warszawie, XIII Wydział Gospodarczy Krajowego Rejestru Sądowego, pod numerem KRS: 0001017491, NIP: 5273040797, REGON: 524385129, z kapitałem zakładowym w wysokości 5.000,00 zł (dalej: „Spółka").

Ze Spółką kontaktować się można listownie (na adres podany wyżej), mailowo: biuro@dataconsulting.pl, lub telefonicznie: +48 (22) 398 47 81.

  • moje dane osobowe przetwarzane będą w celu nawiązania kontaktu ze mną przez Spółkę, na podstawie art. 6 ust. 1 lit. a Rozporządzenia Parlamentu Europejskiego i Rady (UE) 2016/679 z dnia 27 kwietnia 2016 r. w sprawie ochrony osób fizycznych w związku z przetwarzaniem danych osobowych i w sprawie swobodnego przepływu takich danych oraz uchylenia dyrektywy 95/46/WE („RODO"),
  • moje dane osobowe nie będą przekazywane podmiotom zewnętrznym, państwom trzecim spoza Europejskiego Obszaru Gospodarczego ani organizacjom międzynarodowym,
  • moje dane osobowe będą przechowywane przez okres niezbędny do nawiązania ze mną kontaktu przez Spółkę jednak nie dłużej niż do momentu cofnięcia zgody na ich przetwarzanie,
  • posiadam prawo dostępu do treści moich danych oraz prawo ich sprostowania, usunięcia, ograniczenia przetwarzania oraz prawo do przeniesienia moich danych,
  • mam możliwość wycofania zgody na przetwarzanie moich danych osobowych, a wycofanie zgody nie wpływa na zgodność z prawem przetwarzania danych osobowych, którego dokonano na podstawie zgody przed jej wycofaniem,
  • przysługuje mi uprawnienie wniesienia skargi do Prezesa Urzędu Ochrony Danych Osobowych.

Podanie danych osobowych jest dobrowolne, jednak jest niezbędne do nawiązania ze mną kontaktu przez Spółkę.

Pola oznaczone * są wymagane.