Evalueringsdriven utveckling för agenter
Skriv utvärderingen innan du lanserar agenten – det är det enda sättet att iterera utan regressioner.
Evalueringsdriven utveckling för agenter är en gratis lektion i AI-agenter på CoddyKit. Detta är lektion 1 av 4. Ni kan läsa hela lektionen gratis nedan och sedan öva praktiskt i webbläsaren med en inbyggd kodredigerare och en AI-handledare som är tillgänglig dygnet runt. Den ingår i lärvägen för AI-agenter, och Era framsteg synkroniseras mellan webben och CoddyKit-appen. Kursen i AI-agenter innehåller totalt 4 lektioner.
Delar av den här lektionen har ännu inte översatts och visas på engelska.
Utvärderingar är tester för AI
Ni skulle inte leverera kod utan tester. Samma logik gäller för LLM-agenter – utan utvärderingar blir varje ändring ett myntkast.
Utvärderingsdriven utveckling (EDD) innebär att skriva utvärderingen INNAN ni levererar ändringen.
EDD-loopen
- Skriv en utvärdering som misslyckas: indata + förväntat beteende
- Förbättra agenten tills utvärderingen godkänns
- Lägg till utvärderingen i er testsvit
- Kör den vid varje ändring
Vad ska utvärderas
Utvärdera en agent på flera nivåer:
- Komponent – returnerar retrievern rätt textavsnitt?
- Steg – väljer LLM:en rätt verktyg?
- Från början till slut – producerar agenten rätt slutliga svar?
Utvärderingsdata
Varje rad i en utvärdering innehåller minst:
eval_example = {
'input': 'What is our return policy?',
'expected_output': 'mentions 30-day window',
'expected_tool_calls': ['retrieve'],
'metadata': {'tags': ['policy', 'common']}
}
for k, v in eval_example.items():
print(f"{k}: {v}")
Run an Eval Suite
def run_evals(suite, agent):
results = []
for case in suite:
actual = agent.run(case['input'])
scores = [
score_correctness(actual, case['expected_output']),
score_tool_calls(actual.tool_calls, case['expected_tool_calls'])
]
results.append({'case': case, 'actual': actual, 'scores': scores})
return resultsCI-integrering
Kör utvärderingar vid varje PR. Blockera sammanslagningen om kvaliteten sjunker under tröskelvärdet:
# .github/workflows/evals.yml
on: pull_request
jobs:
evals:
runs-on: ubuntu-latest
steps:
- run: python -m evals.run --fail-below 0.85Utvärderingsfrekvens
- Komponentutvärderingar – varje PR
- Utvärderingar från början till slut – varje PR (ett urval) + varje natt (alla)
- Produktionsspår -> utvärderingsuppsättning – varje vecka
Pipeline från produktion till utvärdering
Analysera verkliga spår. Dåliga resultat blir morgondagens utvärderingar:
for trace in production_traces_with_thumbs_down():
add_to_eval_suite(trace.input, expected=trace.fixed_output_from_human)Utvärdering med LangSmith / Langfuse
Båda verktygen har inbyggt stöd för utvärderingar: versionshantering av dataset, utvärderingsfunktioner och jämförelsevyer.
Manuella stickprovskontroller
Automatiserade utvärderingar missar stil och nyanser. Läs regelbundet 20 slumpmässiga spår manuellt – då upptäcks problem som utvärderingarna missar.
Antimönster: memorering av utvärderingsuppsättningen
Om ni finjusterar agenten tills den klarar er utvärdering, men utvärderingen är liten, överanpassar ni den. Fortsätt att utöka utvärderingarna och rotera uppdelningarna mellan testdata och träningsdata.
Underhåll av utvärderingsuppsättningen
Utvärderingar förändras när produkten förändras. Lägg till fall för nya funktioner och ta bort fall för funktioner som har tagits bort.
Definition av EDD
Vad innebär utvärderingsdriven utveckling?
Sammanfattning
Utvärderingsdriven utveckling är oumbärlig för seriösa agenter. Skriv utvärderingar på varje nivå, kör dem i CI och utöka sviten med produktionsspår.
Lär dig AI-agenter med en AI-lärare – gratis
Skriv och kör riktig kod i webbläsaren, få omedelbar hjälp av en AI-lärare dygnet runt och fortsätt där du slutade – på webben eller i appen.
- Kurser
- 60
- Lektioner
- 239
Vanliga frågor
Är lektionen ”Evalueringsdriven utveckling för agenter” gratis?
Ja – hela texten till ”Evalueringsdriven utveckling för agenter” kan läsas gratis här på webben. Om Ni vill öva interaktivt med en inbyggd kodredigerare och en AI-handledare som är tillgänglig dygnet runt och låsa upp resten av kursen i AI-agenter, kan Ni uppgradera till CoddyKit PRO. Kursen i AI-agenter innehåller totalt 4 lektioner.
Vad lär jag mig i ”Evalueringsdriven utveckling för agenter”?
Skriv utvärderingen innan du lanserar agenten – det är det enda sättet att iterera utan regressioner. Ni övar på AI-agenter med praktisk kod som körs direkt i webbläsaren, medan en AI-handledare som är tillgänglig dygnet runt svarar på Era frågor under lektionen.
Behöver jag någon erfarenhet för att börja lära mig AI-agenter?
Du behöver inga förkunskaper. Utbildningen i AI-agenter på CoddyKit är upplagd för allt från nybörjare till avancerade elever, så att du kan börja här eller från början och gå fram i din egen takt. Detta är lektion 1 av 4.
Hur lång tid tar lektionen ”Evalueringsdriven utveckling för agenter”?
De flesta CoddyKit-lektioner tar cirka 5–10 minuter. Varje lektion är kort och interaktiv, så att du gör stadiga framsteg och kan fortsätta precis där du slutade – på webben eller i appen.
Kan jag skriva och köra kod i den här AI-agenter-lektionen?
Ja. Varje AI-agenter-lektion innehåller en inbyggd kodredigerare, så att du kan skriva och köra riktig kod direkt i webbläsaren och få omedelbar AI-feedback – utan lokal installation.
Alla lektioner i den här kursen
- Evalueringsdriven utveckling för agenter
- Bygg en gyllene testuppsättning
- Fallgropar med LLM-as-a-Judge
- Benchmarksviter: SWE-Bench, GAIA, ToolBench