Commitgeschiedenis en diffanalyse
Door de commitgeschiedenis lopen, gewijzigde bestanden ophalen en diffs samenvatten.
Commitgeschiedenis en diffanalyse is een gratis AI-agenten-les op CoddyKit. Dit is les 4 van 4. Je kunt de volledige les hieronder gratis lezen en daarna in de browser praktisch oefenen met een ingebouwde code-editor en een AI-begeleider die 24/7 beschikbaar is. Deze les maakt deel uit van het leertraject AI-agenten. Je voortgang wordt gesynchroniseerd op het web en in de CoddyKit-app. De cursus AI-agenten bevat in totaal 4 lessen.
Waarom commitgeschiedenis analyseren?
Commitgeschiedenis is een goudmijn voor agents: hiermee zie je wat, wanneer en door wie is gewijzigd. Agents gebruiken commitgeschiedenis voor het genereren van wijzigingslogboeken, samenvattingen van codebeoordelingen, rapporten over ontwikkelaarsactiviteit, het detecteren van risico's (grote wijzigingen vlak voor releases) en het begrijpen van de ontwikkeling van een codebasis.
from github import Github
import os
g = Github(token=os.environ['GITHUB_TOKEN'])
repo = g.get_repo('myorg/myrepo')
# Get recent commits on the default branch
commits = repo.get_commits()
print(f'Total commits: {commits.totalCount}')
# Preview the last 5
for commit in commits[:5]:
print(f'{commit.sha[:8]} | {commit.commit.author.name}')
print(f' {commit.commit.message.split(chr(10))[0][:60]}')
print(f' {commit.commit.author.date.date()}')Commits filteren op tijdsperiode
Gebruik de parameters since en until om commits binnen een specifieke datumperiode op te halen. Beide accepteren Python-datetime-objecten. Dit is het belangrijkste hulpmiddel voor het genereren van wekelijkse of maandelijkse activiteitsrapporten.
import datetime
from github import Github
import os
g = Github(token=os.environ['GITHUB_TOKEN'])
repo = g.get_repo('myorg/myrepo')
# Last 7 days of commits
now = datetime.datetime.utcnow()
last_week = now - datetime.timedelta(days=7)
recent_commits = repo.get_commits(
since=last_week,
until=now
)
print(f'Commits in last 7 days: {recent_commits.totalCount}')
# By specific author
author_commits = repo.get_commits(
since=last_week,
author='alice' # GitHub username
)
print(f'Alice\'s commits last week: {author_commits.totalCount}')
# On a specific branch
branch_commits = repo.get_commits(
sha='feature/new-api',
since=last_week
)Commitstatistieken: toevoegingen en verwijderingen
Elk commitobject heeft een eigenschap stats met aantallen additions, deletions en total voor alle gewijzigde bestanden. Hiermee krijg je snel een beeld van de omvang van een wijziging.
from github import Github
import os
g = Github(token=os.environ['GITHUB_TOKEN'])
repo = g.get_repo('myorg/myrepo')
commit = repo.get_commit('abc12345sha')
# Overall stats
print(f'SHA: {commit.sha[:8]}')
print(f'Message: {commit.commit.message[:80]}')
print(f'Author: {commit.commit.author.name}')
print(f'Date: {commit.commit.author.date}')
print(f'Additions: +{commit.stats.additions}')
print(f'Deletions: -{commit.stats.deletions}')
print(f'Total changes: {commit.stats.total}')
# Large commit warning
if commit.stats.total > 500:
print('WARNING: Large commit — careful code review needed')Gewijzigde bestanden in een commit weergeven
commit.files is een lijst met File-objecten voor elk bestand dat in de commit is gewijzigd. Eigenschappen: filename, status (added/modified/removed/renamed), additions, deletions, patch (de difftekst).
from github import Github
import os
g = Github(token=os.environ['GITHUB_TOKEN'])
repo = g.get_repo('myorg/myrepo')
commit = repo.get_commit('abc12345sha')
print(f'Files changed: {len(commit.files)}')
for f in commit.files:
print(f' [{f.status.upper():<8}] {f.filename}')
print(f' +{f.additions} -{f.deletions}')
if f.previous_filename: # for renamed files
print(f' Renamed from: {f.previous_filename}')
# Find changed Python files
python_changes = [
f for f in commit.files
if f.filename.endswith('.py')
]
print(f'\nPython files changed: {len(python_changes)}')De difftekst (patch) parseren
file.patch bevat een unified diff. Regels die beginnen met + zijn toevoegingen, regels die beginnen met - zijn verwijderingen en contextregels hebben geen voorvoegsel. Parseer de tekst om toegevoegde regels voor analyse te extraheren — bijvoorbeeld om nieuwe geheimen, TODO-opmerkingen of antipatronen te vinden.
def extract_added_lines(patch):
if not patch:
return []
added = []
for line in patch.split('\n'):
if line.startswith('+') and not line.startswith('+++'):
added.append(line[1:]) # strip the '+' prefix
return added
def scan_for_secrets(added_lines):
import re
PATTERNS = [
(r'api[_-]?key\s*=\s*["\'][^"\']{20,}', 'potential API key'),
(r'password\s*=\s*["\'][^"\']{6,}', 'potential hardcoded password'),
(r'sk-[a-zA-Z0-9]{20,}', 'potential OpenAI key'),
(r'ghp_[a-zA-Z0-9]{36}', 'potential GitHub token'),
]
findings = []
for i, line in enumerate(added_lines, 1):
for pattern, label in PATTERNS:
if re.search(pattern, line, re.IGNORECASE):
findings.append({'line': i, 'type': label, 'preview': line[:80]})
return findings
# --- demo ---
patch = (
'@@ -1,2 +1,3 @@\n'
' def connect():\n'
'+ api_key = "sk-abcdefghijklmnopqrstuvwx"\n'
'+ password = "hunter2222"\n'
)
added = extract_added_lines(patch)
print('Added lines:', added)
for finding in scan_for_secrets(added):
print(finding)
Activiteit per auteur samenvoegen
Groepeer commits per auteur om rapporten over ontwikkelaarsactiviteit te maken. Tel per auteur binnen een periode het aantal commits, toegevoegde en verwijderde regels en bestanden waarin is gewerkt. Dit is nuttig voor teamterugblikken en beslissingen over het toewijzen van PR's.
import datetime
from collections import defaultdict
from github import Github
import os
g = Github(token=os.environ['GITHUB_TOKEN'])
repo = g.get_repo('myorg/myrepo')
last_month = datetime.datetime.utcnow() - datetime.timedelta(days=30)
author_stats = defaultdict(lambda: {'commits': 0, 'additions': 0, 'deletions': 0, 'files': set()})
for commit in repo.get_commits(since=last_month):
author = commit.commit.author.name
author_stats[author]['commits'] += 1
author_stats[author]['additions'] += commit.stats.additions
author_stats[author]['deletions'] += commit.stats.deletions
for f in commit.files:
author_stats[author]['files'].add(f.filename)
print('Author Activity (last 30 days):')
for author, stats in sorted(author_stats.items(), key=lambda x: -x[1]['commits']):
print(f'{author}: {stats["commits"]} commits, +{stats["additions"]} -{stats["deletions"]}, {len(stats["files"])} files')Een wijzigingslogboek uit commits genereren
Een agent voor wijzigingslogboeken leest commits tussen twee tags of datums, groepeert ze op type (feat/fix/chore volgens het conventionele commitformaat) en genereert een opgemaakt wijzigingslogboek. Gebruik een LLM om de kwaliteit van de beschrijving van elke commit te verbeteren.
import re
import datetime
from github import Github
import os
g = Github(token=os.environ['GITHUB_TOKEN'])
repo = g.get_repo('myorg/myrepo')
def get_commits_since_tag(repo, tag_name):
try:
ref = repo.get_git_ref(f'tags/{tag_name}')
tag_sha = ref.object.sha
tag_commit = repo.get_commit(tag_sha)
since = tag_commit.commit.author.date
return list(repo.get_commits(since=since))[:-1] # exclude the tag commit
except Exception:
return []
def parse_conventional_commit(message):
match = re.match(r'^(feat|fix|chore|docs|test|refactor|perf|style)(\(.+?\))?: (.+)', message)
if match:
return match.group(1), match.group(3)
return 'other', message.split('\n')[0][:60]
commits = get_commits_since_tag(repo, 'v1.2.0')
by_type = {'feat': [], 'fix': [], 'other': []}
for c in commits:
msg = c.commit.message
ctype, desc = parse_conventional_commit(msg)
by_type.get(ctype, by_type['other']).append(desc)
print(f'Parsed {len(commits)} commits')Commits met een hoog risico herkennen
Commits met een hoog risico zijn groot, wijzigen kritieke bestanden (authenticatie, betalingen, beveiliging) of zijn vlak voor een release gemaakt. Een agent kan deze markeren voor extra controle voordat ze naar main worden samengevoegd.
import datetime
from github import Github
import os
g = Github(token=os.environ['GITHUB_TOKEN'])
repo = g.get_repo('myorg/myrepo')
CRITICAL_PATHS = [
'src/auth', 'src/payment', 'src/security',
'config/', '.env', 'Dockerfile', 'requirements.txt'
]
def is_high_risk(commit):
reasons = []
# Large change
if commit.stats.total > 300:
reasons.append(f'Large change: {commit.stats.total} lines')
# Touches critical files
for f in commit.files:
for path in CRITICAL_PATHS:
if f.filename.startswith(path):
reasons.append(f'Touches critical: {f.filename}')
break
return reasons
now = datetime.datetime.utcnow()
for commit in repo.get_commits(since=now - datetime.timedelta(days=1)):
risks = is_high_risk(commit)
if risks:
print(f'HIGH RISK: {commit.sha[:8]} - {commit.commit.message[:50]}')
for r in risks:
print(f' - {r}')Twee commits vergelijken
Gebruik repo.compare(base, head) om de diff tussen twee verwijzingen (branches, tags of commit-SHA's) op te halen. Dit retourneert een Comparison-object met de gecombineerde statistieken, de lijst met commits en de lijst met bestanden die tussen de twee punten zijn gewijzigd.
from github import Github
import os
g = Github(token=os.environ['GITHUB_TOKEN'])
repo = g.get_repo('myorg/myrepo')
# Compare two branches
comparison = repo.compare('main', 'feature/new-api')
print(f'Commits ahead: {comparison.ahead_by}')
print(f'Commits behind: {comparison.behind_by}')
print(f'Status: {comparison.status}') # ahead/behind/identical/diverged
print(f'Total commits in diff: {len(comparison.commits)}')
print(f'Files changed: {len(comparison.files)}')
# Summary of what changed
for f in comparison.files:
print(f' {f.status}: {f.filename} +{f.additions} -{f.deletions}')
# Compare two tags
tag_comparison = repo.compare('v1.0.0', 'v1.1.0')
print(f'Changes between v1.0.0 and v1.1.0: {len(tag_comparison.commits)} commits')Door een LLM gegenereerde commitsamenvatting
Voer een reeks commitberichten en bestandsnamen aan een LLM om een voor mensen leesbare samenvatting te genereren van wat er in een bepaalde periode is gewijzigd. Dit vormt de kern van een bot voor wekelijkse technische overzichten.
import anthropic
import os
client = anthropic.Anthropic(api_key=os.environ['ANTHROPIC_API_KEY'])
def summarize_commits(commits, time_period='last week'):
commit_data = []
for commit in commits[:30]: # limit to avoid context overflow
commit_data.append(
f'- {commit.commit.message.split(chr(10))[0][:80]} '
f'(+{commit.stats.additions}/-{commit.stats.deletions})'
)
commit_list = '\n'.join(commit_data)
prompt = (
f'Summarize what happened in this codebase {time_period} '
f'based on these commit messages. Be concise (3-5 bullet points). '
f'Focus on user-facing changes and significant technical work.\n\n'
f'Commits:\n{commit_list}'
)
response = client.messages.create(
model='claude-opus-4-5',
max_tokens=400,
messages=[{'role': 'user', 'content': prompt}]
)
return response.content[0].textGevoelige bestanden in commits detecteren
Een agent voor beveiligingsgerichte commitanalyse zoekt naar commits waarin per ongeluk gevoelige bestanden zijn opgenomen: privésleutels, .env-bestanden, configuratie met inloggegevens of database-dumps. Controleer commit.files op bestandsnamen die overeenkomen met bekende patronen voor gevoelige bestanden.
import re
from github import Github
import os
g = Github(token=os.environ['GITHUB_TOKEN'])
repo = g.get_repo('myorg/myrepo')
SENSITIVE_PATTERNS = [
r'\.env$', r'\.pem$', r'\.key$', r'id_rsa', r'credentials\.json',
r'secret', r'password', r'\.p12$', r'keystore', r'\btoken\b'
]
def is_sensitive_filename(filename):
for pattern in SENSITIVE_PATTERNS:
if re.search(pattern, filename, re.IGNORECASE):
return pattern
return None
import datetime
last_day = datetime.datetime.utcnow() - datetime.timedelta(days=1)
for commit in repo.get_commits(since=last_day):
for f in commit.files:
matched = is_sensitive_filename(f.filename)
if matched and f.status in ('added', 'modified'):
print(f'ALERT: Sensitive file in commit {commit.sha[:8]}')
print(f' File: {f.filename} (matched: {matched})')
print(f' Author: {commit.commit.author.name}')
print(f' Link: {commit.html_url}')Korte toets: commit.files versus pr.get_files()
Toets je begrip van toegang tot commitdiffs.
Samenvatting van commitgeschiedenisanalyse
Je agent kan commitgeschiedenis nu uitgebreid analyseren:
- repo.get_commits(since, until, author, sha) — commits filteren op tijd, auteur of branch
- commit.stats — toevoegingen, verwijderingen en het totaal voor alle gewijzigde bestanden
- commit.files — details per bestand, inclusief de patch (unified diff)
- Parseer
file.patchom toegevoegde regels te scannen op geheimen, TODO's of antipatronen - Groepeer commits per auteur voor activiteitsrapporten
- repo.compare(base, head) — diff tussen twee verwijzingen (branches, tags of SHA's)
- Gebruik LLM's om voor mensen leesbare samenvattingen te genereren uit lijsten met commitberichten
- Markeer commits met een hoog risico: grote wijzigingen, kritieke bestanden en een moment vlak voor releases
Leer AI-agenten met een AI-tutor — gratis
Schrijf echte code en voer die uit in je browser, krijg direct hulp van een AI-tutor die 24/7 beschikbaar is en ga verder waar je gebleven bent op het web of in de app.
- Cursussen
- 60
- Lessen
- 239
Veelgestelde vragen
Is de les “Commitgeschiedenis en diffanalyse” gratis?
Ja — de volledige tekst van “Commitgeschiedenis en diffanalyse” kun je hier gratis op het web lezen. Als je interactief wilt oefenen met een ingebouwde code-editor en een AI-begeleider die 24/7 beschikbaar is, en de rest van de cursus AI-agenten wilt ontgrendelen, kun je upgraden naar CoddyKit PRO. De cursus AI-agenten bevat in totaal 4 lessen.
Wat leer ik in “Commitgeschiedenis en diffanalyse”?
Door de commitgeschiedenis lopen, gewijzigde bestanden ophalen en diffs samenvatten. Je oefent met AI-agenten door code rechtstreeks in de browser uit te voeren. Een AI-begeleider die 24/7 beschikbaar is beantwoordt je vragen terwijl je de les doorwerkt.
Heb ik ervaring nodig om met AI-agenten te beginnen?
Ervaring vooraf is niet nodig. AI-agenten op CoddyKit is opgebouwd voor beginners tot gevorderden, zodat je hier of bij het begin kunt starten en in je eigen tempo kunt leren. Dit is les 4 van 4.
Hoe lang duurt de les “Commitgeschiedenis en diffanalyse”?
De meeste lessen van CoddyKit duren ongeveer 5–10 minuten. Elke les is kort en interactief, zodat je gestaag vooruitgaat en op het web en in de app precies verdergaat waar je was gebleven.
Kan ik code schrijven en uitvoeren in deze les over AI-agenten?
Ja. Elke les over AI-agenten bevat een ingebouwde code-editor, zodat je rechtstreeks in je browser echte code kunt schrijven en uitvoeren en direct feedback van AI krijgt — lokale installatie is niet nodig.
Alle lessen in deze cursus
- Overzicht van de GitHub REST API
- Issues opsommen en beheren
- Geautomatiseerde opmerkingen bij PR-reviews
- Commitgeschiedenis en diffanalyse