Hash Join a Merge Join a Nested Loop
Rozpoznawać trzy główne strategie złączania, ich profile kosztów oraz sytuacje, w których każda z nich jest najlepszym wyborem planisty
Hash Join a Merge Join a Nested Loop to bezpłatna lekcja SQL Academy na CoddyKit. To lekcja 3 z 4. Możesz przeczytać całą lekcję poniżej za darmo — a potem ćwiczyć ją interaktywnie w przeglądarce z wbudowanym edytorem kodu i tutorem AI dostępnym 24/7. To część ścieżki edukacyjnej SQL Academy, a Twój postęp synchronizuje się między webem a aplikacją CoddyKit. Kurs SQL Academy zawiera 4 lekcji w sumie.
Trzy strategie złączania
PostgreSQL ma trzy fizyczne algorytmy złączania:
- Nested Loop — dla każdego wiersza zewnętrznego skanuje stronę wewnętrzną
- Hash Join — tworzy tablicę mieszającą dla strony wewnętrznej, a następnie wyszukuje w niej za pomocą strony zewnętrznej
- Merge Join — obie strony są posortowane i scalane równolegle
Nested Loop
Najprostsza strategia: strona zewnętrzna × strona wewnętrzna. Jest szybka, gdy strona wewnętrzna ma dobry indeks, A strona zewnętrzna jest niewielka:
EXPLAIN ANALYZE
SELECT * FROM users u JOIN orders o ON o.user_id = u.id
WHERE u.id = 42;
-- Nested Loop
-- -> Index Scan on users where id = 42 (rows=1)
-- -> Index Scan on orders_user_id_idx (rows=5)Kiedy wygrywa Nested Loop
Jeśli strona zewnętrzna ma niewiele wierszy, a strona wewnętrzna ma indeks na kluczu złączenia, Nested Loop jest niezwykle szybki. Najgorszy przypadek: O(liczba_wierszy_zewnętrznych × liczba_wierszy_wewnętrznych).
Hash Join
Algorytm tworzy tablicę mieszającą dla jednej strony (zwykle mniejszej), a następnie wyszukuje w niej wiersze z drugiej strony. Jest świetny do łączenia dwóch dużych tabel, gdy dla klucza złączenia nie ma użytecznego indeksu:
EXPLAIN ANALYZE
SELECT * FROM big_a a JOIN big_b b ON a.key = b.key;
-- Hash Join (cost=10000..50000)
-- -> Seq Scan on big_a
-- -> Hash
-- -> Seq Scan on big_bKiedy wygrywa Hash Join
Dwie średnie lub duże tabele, brak dobrego indeksu na kluczu złączenia albo potrzeba pobrania przez planistę wielu wierszy. Ograniczenie pamięci: tablica mieszająca musi zmieścić się w work_mem, w przeciwnym razie dane są zapisywane na dysku.
Merge Join
Obie strony są posortowane według klucza złączenia i przeglądane równolegle. Ta strategia sprawdza się, gdy obie strony są już posortowane (np. dzięki pasującemu indeksowi):
EXPLAIN ANALYZE
SELECT * FROM big_a a JOIN big_b b ON a.key = b.key
ORDER BY a.key;
-- Merge Join
-- -> Index Scan on big_a (a.key ASC)
-- -> Index Scan on big_b (b.key ASC)Kiedy wygrywa Merge Join
Dwa duże, wstępnie posortowane wejścia. Liniowe skanowanie i niewielkie zużycie pamięci. Koszt sortowania ma znaczenie — jeśli obie strony wymagają jawnego sortowania, zwykle wygrywa Hash Join.
Wybór strategii
Planista wybiera strategię na podstawie:
- Szacowanej liczby wierszy
- Dostępnych indeksów
- Pamięci (
work_mem) - Stałych kosztu w pliku postgresql.conf
Wymuszanie strategii (tylko diagnostycznie)
W celach diagnostycznych można wyłączyć poszczególne strategie:
SET enable_hashjoin = off;
SET enable_mergejoin = off;
SET enable_nestloop = off;
-- Re-run EXPLAIN to see what the planner picks instead.
-- NEVER persist these in production.Zapisywanie danych na dysku
Jeśli tablica mieszająca lub sortowanie przekroczy limit work_mem, operator zapisze pliki tymczasowe na dysku — co znacznie spowolni działanie. Należy albo zwiększyć work_mem, albo przepisać zapytanie.
Złączenia równoległe
PostgreSQL może wykonywać równolegle Hash Join i Merge Join (a także skanowanie sekwencyjne i skan indeksu) — w EXPLAIN będzie to widoczne jako Parallel Hash Join wraz z Workers Planned.
Odczytywanie wybranej strategii
W EXPLAIN ANALYZE nazwa węzła złączenia wskazuje używaną strategię. Wybór jest prawie zawsze właściwy — gdy tak nie jest, przed wymuszaniem strategii należy sprawdzić statystyki i indeksy.
Podsumowanie
Trzy strategie złączania służą różnym układom danych.
- Nested Loop: niewielka strona zewnętrzna + indeksowana strona wewnętrzna
- Hash Join: duże tabele bez użytecznego indeksu
- Merge Join: wstępnie posortowane wejścia
Szybki test
Łączone są dwie tabele zawierające po 10 milionów wierszy, a kolumna złączenia nie jest indeksowana. Który algorytm złączenia najprawdopodobniej wybierze planista?
Często zadawane pytania
Czy lekcja „Hash Join a Merge Join a Nested Loop” jest bezpłatna?
Tak — pełny tekst „Hash Join a Merge Join a Nested Loop” jest dostępny za darmo tutaj w sieci. Aby ćwiczyć ją interaktywnie (wbudowany edytor kodu i tutor AI dostępny 24/7) i odblokować resztę kursu SQL Academy, przejdź na CoddyKit PRO. Kurs SQL Academy zawiera 4 lekcji w sumie.
Co nauczysz się w „Hash Join a Merge Join a Nested Loop”?
Rozpoznawać trzy główne strategie złączania, ich profile kosztów oraz sytuacje, w których każda z nich jest najlepszym wyborem planisty Ćwiczysz SQL Academy z praktycznym kodem, który uruchamiasz bezpośrednio w przeglądarce, a tutor AI dostępny 24/7 odpowiada na Twoje pytania podczas pracy nad lekcją.
Czy potrzebuję doświadczenia, aby zacząć SQL Academy?
Nie wymagamy żadnego doświadczenia. SQL Academy w CoddyKit jest strukturyzowany dla początkujących i zaawansowanych użytkowników, więc możesz zacząć tutaj lub od początku i uczyć się w swoim tempie. To lekcja 3 z 4.
Ile czasu zajmuje lekcja „Hash Join a Merge Join a Nested Loop”?
Większość lekcji CoddyKit trwa około 5–10 minut. Każda lekcja to mały, interaktywny krok, dzięki czemu robisz systematyczne postępy i zawsze wracasz dokładnie do tego samego miejsca — na webie i w aplikacji.
Czy mogę pisać i uruchamiać kod w tej lekcji SQL Academy?
Tak. Każda lekcja SQL Academy zawiera wbudowany edytor kodu, więc piszesz i uruchamiasz prawdziwy kod bezpośrednio w przeglądarce i od razu otrzymujesz sprzężenie zwrotne od AI — bez konfiguracji na komputerze.
Wszystkie lekcje w tym kursie
- Odczytywanie EXPLAIN i EXPLAIN ANALYZE
- Skanowanie sekwencyjne a skanowanie indeksu
- Hash Join a Merge Join a Nested Loop
- Identyfikowanie i naprawianie powolnych zapytań