GroupBy og aggregering
df.groupby(), agg(), transform(), apply() og navngivne aggregeringer med Named Aggregation.
GroupBy og aggregering er en gratis Lær AI med Python-lektion på CoddyKit. Dette er lektion 1 af 4. Du kan læse alle 3 lektioner i dette læringsspor gratis i deres fulde længde — derefter låser CoddyKit PRO alle lektioner op samt praktiske øvelser med en indbygget kodeeditor og en AI-underviser døgnet rundt. Den er en del af læringsforløbet i Lær AI med Python, og dine fremskridt synkroniseres på tværs af nettet og CoddyKit-appen. Lær AI med Python-kurset indeholder 4 lektioner i alt.
Idéen bag opdel-anvend-sammenlæg
GroupBy følger mønstret opdel-anvend-sammenlæg: Rækker opdeles i grupper efter en nøgle, en funktion anvendes på hver gruppe, og resultaterne samles derefter i én DataFrame. Det danner grundlag for de fleste analytiske opsummeringer.
import pandas as pd
df = pd.DataFrame({
"dept": ["A", "A", "B", "B", "B"],
"salary": [50, 70, 40, 60, 80],
})Grundlæggende groupby
df.groupby("col") opretter et grupperet objekt. Når du kæder en aggregering som .mean() på, beregnes én værdi pr. gruppe.
print(df.groupby("dept")["salary"].mean())
# dept
# A 60.0
# B 60.0Flere aggregeringer
Kald flere reduktioner på én gang med .agg([...]), så der oprettes en kolonne pr. funktion.
print(df.groupby("dept")["salary"].agg(["mean", "min", "max", "count"]))Aggregeringsordbog pr. kolonne
Videregiv en ordbog til .agg for at anvende forskellige funktioner på forskellige kolonner.
df["bonus"] = [5, 7, 4, 6, 8]
out = df.groupby("dept").agg({"salary": "mean", "bonus": "sum"})
print(out)Navngivet aggregering
Navngivet aggregering giver resultatkolonner tydelige navne ved hjælp af syntaksen pd.NamedAgg. Det undgår forvirrende kolonneoverskrifter på flere niveauer.
out = df.groupby("dept").agg(
avg_salary=("salary", "mean"),
total_bonus=("bonus", "sum"),
)
print(out)Gruppering efter flere nøgler
Videregiv en liste med kolonner for at gruppere efter flere nøgler på én gang, hvilket giver et hierarkisk resultat (MultiIndex).
df["level"] = ["jr", "sr", "jr", "sr", "sr"]
print(df.groupby(["dept", "level"])["salary"].mean())transform: Output med samme form
.transform() returnerer et resultat, der er justeret efter de oprindelige rækker, ikke én række pr. gruppe. Det er perfekt til at føje en gruppestatistik til som en ny kolonne.
df["dept_avg"] = df.groupby("dept")["salary"].transform("mean")
print(df[["dept", "salary", "dept_avg"]])transform til normalisering
Fordi transform broadcaster tilbage til hver række, kan du normalisere inden for grupper, f.eks. ved at trække gruppens gennemsnit fra.
df["centered"] = df["salary"] - df.groupby("dept")["salary"].transform("mean")
print(df[["dept", "salary", "centered"]])apply til brugerdefineret logik
.apply() overgiver hver gruppe (som en del-DataFrame) til din funktion. Brug den til logik, som indbyggede aggregeringer ikke kan udtrykke, f.eks. at returnere de øverste N rækker pr. gruppe.
top = df.groupby("dept").apply(lambda g: g.nlargest(1, "salary"))
print(top[["dept", "salary"]])agg kontra transform kontra apply
agg reducerer hver gruppe til én værdi. transform returnerer én værdi pr. oprindelig række. apply er den fleksible, men langsommere, generelle løsning. Vælg den mest specifikke for at opnå tydelighed og hastighed.
Ophævelse af gruppering med reset_index
GroupBy-resultater placerer nøglerne i indekset. Kald .reset_index() for at gøre dem til almindelige kolonner igen, hvilket de fleste efterfølgende programmer forventer.
flat = df.groupby("dept")["salary"].mean().reset_index()
print(flat)
# dept salary
# 0 A 60.0
# 1 B 60.0Hurtigt tjek
Afprøv din forståelse af groupby.
Opsummering
Det vigtigste om GroupBy:
- Opdel-anvend-sammenlæg via
df.groupby("col") .agg([...])samt ordbogsbaseret og navngivet aggregering til flere statistikker.transform()returnerer resultater med samme form som originalen.apply()til vilkårlig logik pr. gruppe- Brug altid
.reset_index()til at flade gruppenøgler ud til almindelige kolonner igen
Lær Python med en AI-underviser — gratis
Skriv og kør rigtig kode i din browser, få øjeblikkelig hjælp fra en AI-underviser døgnet rundt, og fortsæt, hvor du slap, på web eller i appen.
- Kurser
- 53
- Lektioner
- 225
Ofte stillede spørgsmål
Er lektionen “GroupBy og aggregering” gratis?
Ja — alle 3 lektioner i læringssporet Lær AI med Python, inklusive “GroupBy og aggregering”, kan læses gratis i deres fulde længde her på webstedet. Derefter låser CoddyKit PRO alle lektioner op samt interaktive øvelser med en indbygget kodeeditor og en AI-underviser døgnet rundt. Lær AI med Python-kurset indeholder 4 lektioner i alt.
Hvad lærer jeg i “GroupBy og aggregering”?
df.groupby(), agg(), transform(), apply() og navngivne aggregeringer med Named Aggregation. Du øver dig i Lær AI med Python med praktisk kode, som du kører direkte i browseren, og en AI-vejleder døgnet rundt besvarer dine spørgsmål, mens du arbejder dig gennem lektionen.
Skal jeg have erfaring for at begynde på Lær AI med Python?
Der kræves ingen tidligere erfaring. Lær AI med Python på CoddyKit er tilrettelagt for både begyndere og øvede, så du kan starte her eller fra begyndelsen og lære i dit eget tempo. Dette er lektion 1 af 4.
Hvor lang tid tager lektionen “GroupBy og aggregering”?
De fleste CoddyKit-lektioner tager cirka 5–10 minutter. Hver lektion er kort og interaktiv, så du gør løbende fremskridt og kan fortsætte, hvor du slap – på både web og app.
Kan jeg skrive og køre kode i denne Lær AI med Python-lektion?
Ja. Alle Lær AI med Python-lektioner har en indbygget kodeeditor, så du kan skrive og køre rigtig kode direkte i din browser og få øjeblikkelig feedback fra AI – uden lokal opsætning.
Alle lektioner i dette kursus
- GroupBy og aggregering
- Pivot-tabeller og krydstabulering
- Avanceret fletning og join
- Tidsserier i Pandas