Bronverificatie en bronvermelding
Beweringen tussen bronnen vergelijken en bron-URL's aan feiten koppelen.
Bronverificatie en bronvermelding is een gratis AI-agenten-les op CoddyKit. Dit is les 2 van 4. Je kunt de volledige les hieronder gratis lezen en daarna in de browser praktisch oefenen met een ingebouwde code-editor en een AI-begeleider die 24/7 beschikbaar is. Deze les maakt deel uit van het leertraject AI-agenten. Je voortgang wordt gesynchroniseerd op het web en in de CoddyKit-app. De cursus AI-agenten bevat in totaal 4 lessen.
Waarom bronverificatie belangrijk is
Een agent kan een onjuiste bewering uit een bron van lage kwaliteit ophalen en deze als feit presenteren. Zonder verificatie is de onderzoeksagent slechts een geavanceerde zoekmachine zonder kwaliteitsfilter.
Verificatie voegt een laag toe die controleert of beweringen door meerdere onafhankelijke bronnen worden bevestigd.
De regel van twee bronnen
Een bewering geldt als geverifieerd wanneer deze in ten minste twee onafhankelijke bronnen voorkomt. Met 'onafhankelijk' bedoelen we verschillende domeinen — dezelfde bewering op twee sites die allebei naar hetzelfde oorspronkelijke artikel verwijzen, telt niet mee.
from urllib.parse import urlparse
def extract_domain(url: str) -> str:
return urlparse(url).netloc.replace('www.', '')
def is_verified(fact: str, all_facts: list[dict]) -> bool:
matching_domains = set()
for f in all_facts:
if fact.lower() in f['fact'].lower() or f['fact'].lower() in fact.lower():
matching_domains.add(extract_domain(f['source']))
return len(matching_domains) >= 2
# Example
facts = [
{'fact': 'Inflation peaked at 9.1% in June 2022', 'source': 'https://bls.gov/cpi'},
{'fact': 'US inflation hit 9.1% peak in mid-2022', 'source': 'https://reuters.com/article/a'}
]
print(is_verified('inflation peaked at 9.1%', facts)) # TrueSemantische vergelijking met een LLM
Vergelijking van tekenreeksen mist geparafraseerde beweringen. Gebruik een LLM om te bepalen of twee feiten semantisch gelijkwaardig zijn voordat je ze telt als bevestiging door verschillende bronnen.
import openai, json
client = openai.OpenAI(api_key='YOUR_OPENAI_KEY')
def claims_are_equivalent(claim_a: str, claim_b: str) -> bool:
prompt = (
f'Are these two statements making the same factual claim?\n'
f'A: "{claim_a}"\n'
f'B: "{claim_b}"\n'
f'Answer JSON: {{"equivalent": true/false}}'
)
resp = client.chat.completions.create(
model='gpt-4o-mini',
messages=[{'role': 'user', 'content': prompt}],
response_format={'type': 'json_object'}
)
return json.loads(resp.choices[0].message.content).get('equivalent', False)
print(claims_are_equivalent(
'CPI hit 9.1% in June 2022',
'US consumer prices rose 9.1 percent year-over-year in June 2022'
)) # TrueBronkwaliteit scoren
Niet alle bronnen zijn gelijkwaardig. Geef elke bron een score op basis van het domeintype, de publicatiedatum en de bekende betrouwbaarheid. Bronnen van niveau 1, zoals overheidsstatistieken en door vakgenoten beoordeelde tijdschriften, moeten zwaarder wegen dan blogs of sociale media.
from datetime import datetime, timezone
HIGH_AUTHORITY_DOMAINS = [
'gov', 'edu', 'nature.com', 'science.org', 'pubmed.ncbi.nlm.nih.gov',
'reuters.com', 'bbc.com', 'apnews.com', 'who.int'
]
def score_source(url: str, publication_date: str | None) -> float:
score = 0.5 # baseline
domain = extract_domain(url)
tld = domain.split('.')[-1]
# Domain authority
if any(ha in domain for ha in HIGH_AUTHORITY_DOMAINS):
score += 0.3
elif tld in ('gov', 'edu', 'org'):
score += 0.1
# Recency
if publication_date:
try:
pub = datetime.fromisoformat(publication_date)
days_old = (datetime.now(timezone.utc) - pub.replace(tzinfo=timezone.utc)).days
if days_old < 365:
score += 0.1
elif days_old > 1825: # 5 years
score -= 0.1
except ValueError:
pass
return min(1.0, max(0.0, score))Beweringen met bronnen vergelijken
Vergelijk elke bewering die de agent in het eindrapport wil opnemen met alle opgehaalde documenten om de beste bevestigende bronnen te vinden.
def cross_reference(claim: str, all_facts: list[dict]) -> list[dict]:
supporting = []
seen_domains = set()
for fact in all_facts:
if claims_are_equivalent(claim, fact['fact']):
domain = extract_domain(fact['source'])
if domain not in seen_domains: # only one per domain
seen_domains.add(domain)
supporting.append({
'source': fact['source'],
'domain': domain,
'fact': fact['fact'],
'score': score_source(fact['source'], fact.get('publication_date'))
})
return sorted(supporting, key=lambda x: x['score'], reverse=True)Auteurskwalificaties controleren
Bij wetenschappelijke of medische beweringen zijn de kwalificaties van de auteur belangrijk. Een onderzoek met genoemde auteurs aan erkende instellingen weegt zwaarder dan een anonieme blogpost. Extraheer de auteursgegevens en markeer beweringen uit anonieme bronnen.
def assess_authorship(url: str, page_text: str) -> dict:
prompt = (
f'From this webpage text, extract:\n'
f'1. Author name(s) (or null)\n'
f'2. Author affiliation/credentials (or null)\n'
f'3. Publication name (or null)\n'
f'Return JSON: {{"authors": [], "affiliation": null, "publication": null}}\n\n'
f'TEXT:\n{page_text[:2000]}'
)
resp = client.chat.completions.create(
model='gpt-4o-mini',
messages=[{'role': 'user', 'content': prompt}],
response_format={'type': 'json_object'}
)
return json.loads(resp.choices[0].message.content)Niet-geverifieerde beweringen markeren
Beweringen die niet met twee onafhankelijke bronnen kunnen worden vergeleken, moeten in de uitvoer als niet geverifieerd worden gemarkeerd. Afhankelijk van het risiconiveau van het rapport kunnen niet-geverifieerde beweringen worden weggelaten of met een toelichting worden gepresenteerd.
def classify_claims(claims: list[str], all_facts: list[dict]) -> list[dict]:
classified = []
for claim in claims:
support = cross_reference(claim, all_facts)
classified.append({
'claim': claim,
'verified': len(support) >= 2,
'sources': support[:3], # top 3 supporting sources
'confidence': 'high' if len(support) >= 3 else
'medium' if len(support) == 2 else
'low'
})
return classifiedIndeling van bronverwijzingen: in de tekst en referentielijst
Rapporten moeten bronverwijzingen in de tekst bevatten, met genummerde cijfers in superscript, en aan het einde een referentielijst. Genereer beide op basis van de metagegevens van geverifieerde bronnen.
def format_citations(classified_claims: list[dict]) -> tuple[list[str], list[str]]:
ref_list = []
ref_map = {} # url -> citation number
inline_claims = []
for item in classified_claims:
nums = []
for src in item['sources']:
url = src['source']
if url not in ref_map:
ref_map[url] = len(ref_list) + 1
ref_list.append(f'[{ref_map[url]}] {url}')
nums.append(f'[{ref_map[url]}]')
citation_str = ''.join(nums)
prefix = '' if item['verified'] else '[UNVERIFIED] '
inline_claims.append(f'{prefix}{item["claim"]} {citation_str}')
return inline_claims, ref_list
if __name__ == '__main__':
demo_claims = [
{'claim': 'Revenue grew 12% year over year', 'verified': True, 'sources': [{'source': 'https://example.com/report'}]},
{'claim': 'The CEO plans to step down', 'verified': False, 'sources': [{'source': 'https://example.com/rumor'}]},
]
inline, refs = format_citations(demo_claims)
for line in inline:
print(line)
print('References:')
for r in refs:
print(' ', r)
Tegenstrijdigheden tussen bronnen herkennen
Soms spreken twee betrouwbare bronnen elkaar tegen. Herken tegenstrijdigheden en presenteer beide kanten in plaats van stilzwijgend één kant te kiezen. Dit is vooral belangrijk bij betwiste empirische beweringen.
def find_contradictions(claim: str, all_facts: list[dict]) -> list[dict]:
contradictions = []
for fact in all_facts:
if extract_domain(fact['source']) == extract_domain(claim):
continue
prompt = (
f'Does fact B contradict fact A?\n'
f'A: "{claim}"\nB: "{fact["fact"]}"\n'
f'JSON: {{"contradicts": true/false}}'
)
resp = client.chat.completions.create(
model='gpt-4o-mini',
messages=[{'role': 'user', 'content': prompt}],
response_format={'type': 'json_object'}
)
result = json.loads(resp.choices[0].message.content)
if result.get('contradicts'):
contradictions.append(fact)
return contradictionsVerificatieoverzicht
Maak voordat je het eindrapport genereert een verificatiesamenvatting: hoeveel beweringen zijn geverifieerd, hoeveel niet, welke bronnen hebben de hoogste autoriteitsscore en zijn er tegenstrijdigheden vastgesteld?
def verification_report_card(classified: list[dict]) -> dict:
total = len(classified)
verified = sum(1 for c in classified if c['verified'])
all_sources = [
src for c in classified for src in c['sources']
]
top_domains = sorted(
set(s['domain'] for s in all_sources),
key=lambda d: max(s['score'] for s in all_sources if s['domain'] == d),
reverse=True
)[:5]
return {
'total_claims': total,
'verified': verified,
'unverified': total - verified,
'verification_rate': f'{verified/max(total,1)*100:.0f}%',
'top_sources': top_domains
}
if __name__ == '__main__':
demo_classified = [
{'verified': True, 'sources': [{'domain': 'docs.python.org', 'score': 1.3}]},
{'verified': False, 'sources': [{'domain': 'quora.com', 'score': 0.5}]},
]
card = verification_report_card(demo_classified)
for k, v in card.items():
print(f'{k}: {v}')
Uitvoer op basis van een betrouwbaarheidsdrempel
Stel een minimale verificatiedrempel in voordat je publiceert. Als minder dan 70% van de beweringen is geverifieerd, laat je de onderzoeksloop nog een iteratie uitvoeren die specifiek op de niet-geverifieerde beweringen is gericht.
MIN_VERIFICATION_RATE = 0.70
def should_run_more_research(classified: list[dict]) -> list[str]:
unverified = [c for c in classified if not c['verified']]
total = len(classified)
if total == 0:
return []
rate = (total - len(unverified)) / total
if rate >= MIN_VERIFICATION_RATE:
return [] # Sufficient confidence — stop
# Return search queries to verify remaining claims
return [f'verify: {c["claim"]}' for c in unverified[:3]]
if __name__ == '__main__':
demo_classified = [
{'claim': 'A', 'verified': True},
{'claim': 'B', 'verified': False},
{'claim': 'C', 'verified': False},
]
followups = should_run_more_research(demo_classified)
print('Follow-up queries needed:', followups)
Wat definieert twee 'onafhankelijke' bronnen voor de verificatieregel van twee bronnen?
Het onafhankelijkheidscriterium voorkomt verificatie in een echokamer, waarbij dezelfde bewering kan worden teruggevoerd op één oorspronkelijke bron die door veel publicaties wordt aangehaald.
Samenvatting van bronverificatie
Geverifieerd onderzoek vereist: bevestiging door twee bronnen uit verschillende domeinen, semantische vergelijking met een LLM om geparafraseerde equivalenten te herkennen, scoren van bronkwaliteit (domeinautoriteit + actualiteit), herkenning van tegenstrijdigheden en uitvoer op basis van een betrouwbaarheidsdrempel die meer onderzoek start als het verificatiepercentage te laag is.
Leer AI-agenten met een AI-tutor — gratis
Schrijf echte code en voer die uit in je browser, krijg direct hulp van een AI-tutor die 24/7 beschikbaar is en ga verder waar je gebleven bent op het web of in de app.
- Cursussen
- 60
- Lessen
- 239
Veelgestelde vragen
Is de les “Bronverificatie en bronvermelding” gratis?
Ja — de volledige tekst van “Bronverificatie en bronvermelding” kun je hier gratis op het web lezen. Als je interactief wilt oefenen met een ingebouwde code-editor en een AI-begeleider die 24/7 beschikbaar is, en de rest van de cursus AI-agenten wilt ontgrendelen, kun je upgraden naar CoddyKit PRO. De cursus AI-agenten bevat in totaal 4 lessen.
Wat leer ik in “Bronverificatie en bronvermelding”?
Beweringen tussen bronnen vergelijken en bron-URL's aan feiten koppelen. Je oefent met AI-agenten door code rechtstreeks in de browser uit te voeren. Een AI-begeleider die 24/7 beschikbaar is beantwoordt je vragen terwijl je de les doorwerkt.
Heb ik ervaring nodig om met AI-agenten te beginnen?
Ervaring vooraf is niet nodig. AI-agenten op CoddyKit is opgebouwd voor beginners tot gevorderden, zodat je hier of bij het begin kunt starten en in je eigen tempo kunt leren. Dit is les 2 van 4.
Hoe lang duurt de les “Bronverificatie en bronvermelding”?
De meeste lessen van CoddyKit duren ongeveer 5–10 minuten. Elke les is kort en interactief, zodat je gestaag vooruitgaat en op het web en in de app precies verdergaat waar je was gebleven.
Kan ik code schrijven en uitvoeren in deze les over AI-agenten?
Ja. Elke les over AI-agenten bevat een ingebouwde code-editor, zodat je rechtstreeks in je browser echte code kunt schrijven en uitvoeren en direct feedback van AI krijgt — lokale installatie is niet nodig.
Alle lessen in deze cursus
- Een meerstaps onderzoeksloop ontwerpen
- Bronverificatie en bronvermelding
- Gestructureerde rapporten genereren
- Feiten controleren en hallucinaties voorkomen