0Pricing
SQL Academy · Lekcja

Hash Join a Merge Join a Nested Loop

Rozpoznawać trzy główne strategie złączania, ich profile kosztów oraz sytuacje, w których każda z nich jest najlepszym wyborem planisty

Hash Join a Merge Join a Nested Loop to bezpłatna lekcja SQL Academy na CoddyKit. To lekcja 3 z 4. Możesz przeczytać całą lekcję poniżej za darmo — a potem ćwiczyć ją interaktywnie w przeglądarce z wbudowanym edytorem kodu i tutorem AI dostępnym 24/7. To część ścieżki edukacyjnej SQL Academy, a Twój postęp synchronizuje się między webem a aplikacją CoddyKit. Kurs SQL Academy zawiera 4 lekcji w sumie.

Trzy strategie złączania

PostgreSQL ma trzy fizyczne algorytmy złączania:

  • Nested Loop — dla każdego wiersza zewnętrznego skanuje stronę wewnętrzną
  • Hash Join — tworzy tablicę mieszającą dla strony wewnętrznej, a następnie wyszukuje w niej za pomocą strony zewnętrznej
  • Merge Join — obie strony są posortowane i scalane równolegle

Nested Loop

Najprostsza strategia: strona zewnętrzna × strona wewnętrzna. Jest szybka, gdy strona wewnętrzna ma dobry indeks, A strona zewnętrzna jest niewielka:

EXPLAIN ANALYZE
SELECT * FROM users u JOIN orders o ON o.user_id = u.id
WHERE u.id = 42;
-- Nested Loop
--   -> Index Scan on users where id = 42  (rows=1)
--   -> Index Scan on orders_user_id_idx    (rows=5)

Kiedy wygrywa Nested Loop

Jeśli strona zewnętrzna ma niewiele wierszy, a strona wewnętrzna ma indeks na kluczu złączenia, Nested Loop jest niezwykle szybki. Najgorszy przypadek: O(liczba_wierszy_zewnętrznych × liczba_wierszy_wewnętrznych).

Hash Join

Algorytm tworzy tablicę mieszającą dla jednej strony (zwykle mniejszej), a następnie wyszukuje w niej wiersze z drugiej strony. Jest świetny do łączenia dwóch dużych tabel, gdy dla klucza złączenia nie ma użytecznego indeksu:

EXPLAIN ANALYZE
SELECT * FROM big_a a JOIN big_b b ON a.key = b.key;
-- Hash Join (cost=10000..50000)
--   -> Seq Scan on big_a
--   -> Hash
--       -> Seq Scan on big_b

Kiedy wygrywa Hash Join

Dwie średnie lub duże tabele, brak dobrego indeksu na kluczu złączenia albo potrzeba pobrania przez planistę wielu wierszy. Ograniczenie pamięci: tablica mieszająca musi zmieścić się w work_mem, w przeciwnym razie dane są zapisywane na dysku.

Merge Join

Obie strony są posortowane według klucza złączenia i przeglądane równolegle. Ta strategia sprawdza się, gdy obie strony są już posortowane (np. dzięki pasującemu indeksowi):

EXPLAIN ANALYZE
SELECT * FROM big_a a JOIN big_b b ON a.key = b.key
ORDER BY a.key;
-- Merge Join
--   -> Index Scan on big_a (a.key ASC)
--   -> Index Scan on big_b (b.key ASC)

Kiedy wygrywa Merge Join

Dwa duże, wstępnie posortowane wejścia. Liniowe skanowanie i niewielkie zużycie pamięci. Koszt sortowania ma znaczenie — jeśli obie strony wymagają jawnego sortowania, zwykle wygrywa Hash Join.

Wybór strategii

Planista wybiera strategię na podstawie:

  • Szacowanej liczby wierszy
  • Dostępnych indeksów
  • Pamięci (work_mem)
  • Stałych kosztu w pliku postgresql.conf

Wymuszanie strategii (tylko diagnostycznie)

W celach diagnostycznych można wyłączyć poszczególne strategie:

SET enable_hashjoin = off;
SET enable_mergejoin = off;
SET enable_nestloop = off;
-- Re-run EXPLAIN to see what the planner picks instead.
-- NEVER persist these in production.

Zapisywanie danych na dysku

Jeśli tablica mieszająca lub sortowanie przekroczy limit work_mem, operator zapisze pliki tymczasowe na dysku — co znacznie spowolni działanie. Należy albo zwiększyć work_mem, albo przepisać zapytanie.

Złączenia równoległe

PostgreSQL może wykonywać równolegle Hash Join i Merge Join (a także skanowanie sekwencyjne i skan indeksu) — w EXPLAIN będzie to widoczne jako Parallel Hash Join wraz z Workers Planned.

Odczytywanie wybranej strategii

W EXPLAIN ANALYZE nazwa węzła złączenia wskazuje używaną strategię. Wybór jest prawie zawsze właściwy — gdy tak nie jest, przed wymuszaniem strategii należy sprawdzić statystyki i indeksy.

Podsumowanie

Trzy strategie złączania służą różnym układom danych.

  • Nested Loop: niewielka strona zewnętrzna + indeksowana strona wewnętrzna
  • Hash Join: duże tabele bez użytecznego indeksu
  • Merge Join: wstępnie posortowane wejścia

Szybki test

Łączone są dwie tabele zawierające po 10 milionów wierszy, a kolumna złączenia nie jest indeksowana. Który algorytm złączenia najprawdopodobniej wybierze planista?

Często zadawane pytania

Czy lekcja „Hash Join a Merge Join a Nested Loop” jest bezpłatna?

Tak — pełny tekst „Hash Join a Merge Join a Nested Loop” jest dostępny za darmo tutaj w sieci. Aby ćwiczyć ją interaktywnie (wbudowany edytor kodu i tutor AI dostępny 24/7) i odblokować resztę kursu SQL Academy, przejdź na CoddyKit PRO. Kurs SQL Academy zawiera 4 lekcji w sumie.

Co nauczysz się w „Hash Join a Merge Join a Nested Loop”?

Rozpoznawać trzy główne strategie złączania, ich profile kosztów oraz sytuacje, w których każda z nich jest najlepszym wyborem planisty Ćwiczysz SQL Academy z praktycznym kodem, który uruchamiasz bezpośrednio w przeglądarce, a tutor AI dostępny 24/7 odpowiada na Twoje pytania podczas pracy nad lekcją.

Czy potrzebuję doświadczenia, aby zacząć SQL Academy?

Nie wymagamy żadnego doświadczenia. SQL Academy w CoddyKit jest strukturyzowany dla początkujących i zaawansowanych użytkowników, więc możesz zacząć tutaj lub od początku i uczyć się w swoim tempie. To lekcja 3 z 4.

Ile czasu zajmuje lekcja „Hash Join a Merge Join a Nested Loop”?

Większość lekcji CoddyKit trwa około 5–10 minut. Każda lekcja to mały, interaktywny krok, dzięki czemu robisz systematyczne postępy i zawsze wracasz dokładnie do tego samego miejsca — na webie i w aplikacji.

Czy mogę pisać i uruchamiać kod w tej lekcji SQL Academy?

Tak. Każda lekcja SQL Academy zawiera wbudowany edytor kodu, więc piszesz i uruchamiasz prawdziwy kod bezpośrednio w przeglądarce i od razu otrzymujesz sprzężenie zwrotne od AI — bez konfiguracji na komputerze.

Wszystkie lekcje w tym kursie

  1. Odczytywanie EXPLAIN i EXPLAIN ANALYZE
  2. Skanowanie sekwencyjne a skanowanie indeksu
  3. Hash Join a Merge Join a Nested Loop
  4. Identyfikowanie i naprawianie powolnych zapytań
← Powrót do SQL Academy