AI-agenter · Lektion

Eval-drevet udvikling af agenter

Skriv evalueringen, før De udgiver agenten — det er den eneste måde at iterere uden regressioner.

Lektion 1 af 414 trin

Eval-drevet udvikling af agenter er en gratis AI-agenter-lektion på CoddyKit. Dette er lektion 1 af 4. Du kan læse hele lektionen gratis nedenfor — og derefter øve dig praktisk i browseren med en indbygget kodeeditor og en AI-vejleder, der er tilgængelig døgnet rundt. Den er en del af læringsforløbet i AI-agenter, og dine fremskridt synkroniseres på tværs af nettet og CoddyKit-appen. AI-agenter-kurset indeholder 4 lektioner i alt.

Dele af denne lektion er endnu ikke oversat og vises på engelsk.

Evalueringer er test af AI

Du ville ikke levere kode uden test. Den samme logik gælder for LLM-agenter — uden evalueringer er enhver ændring et lotteri.

Evalueringsdrevet udvikling (EDD) betyder, at du skriver evalueringen, FØR du leverer ændringen.

EDD-sløjfen

  1. Skriv en fejlslagen evaluering: inddata + forventet adfærd
  2. Forbedr agenten, indtil evalueringen består
  3. Føj evalueringen til din testsuite
  4. Kør den ved hver ændring

Hvad skal evalueres

For en agent skal du evaluere på flere niveauer:

  • Komponent — returnerer informationssøgeren de rigtige tekststykker?
  • Trin — vælger LLM'en det rigtige værktøj?
  • Fra ende til anden — producerer agenten det rigtige endelige svar?

Evalueringsdata

Hver evalueringspost består som minimum af:

eval_example = {
    'input': 'What is our return policy?',
    'expected_output': 'mentions 30-day window',
    'expected_tool_calls': ['retrieve'],
    'metadata': {'tags': ['policy', 'common']}
}
for k, v in eval_example.items():
    print(f"{k}: {v}")

Run an Eval Suite

def run_evals(suite, agent):
    results = []
    for case in suite:
        actual = agent.run(case['input'])
        scores = [
            score_correctness(actual, case['expected_output']),
            score_tool_calls(actual.tool_calls, case['expected_tool_calls'])
        ]
        results.append({'case': case, 'actual': actual, 'scores': scores})
    return results

CI-integration

Kør evalueringer ved hver PR. Hvis kvaliteten falder under tærsklen, skal sammenlægningen blokeres:

# .github/workflows/evals.yml
on: pull_request
jobs:
  evals:
    runs-on: ubuntu-latest
    steps:
      - run: python -m evals.run --fail-below 0.85

Evalueringshyppighed

  • Komponentevalueringer — ved hver PR
  • Evalueringer fra ende til anden — ved hver PR (udtaget) + hver nat (fuldt sæt)
  • Produktionsspor -> evalueringssæt — ugentligt

Fra produktion til evaluering

Gennemgå reelle spor. Dårlige resultater bliver morgendagens evalueringer:

for trace in production_traces_with_thumbs_down():
    add_to_eval_suite(trace.input, expected=trace.fixed_output_from_human)

LangSmith / Langfuse-evaluering

Begge værktøjer har indbygget understøttelse af evalueringer: versionsstyring af datasæt, evalueringsfunktioner og sammenligningsvisninger.

Manuelle stikprøver

Automatiske evalueringer overser stil og nuancer. Læs jævnligt 20 tilfældige spor manuelt — så opdager du problemer, som evalueringerne overser.

Modmønster: At huske evalueringssættet

Hvis du tilpasser agenten, indtil den består din evaluering, men evalueringen er lille, overtilpasser du. Bliv ved med at udvide evalueringerne, og roter opdelingerne i test og træning.

Vedligeholdelse af evalueringssættet

Evalueringer ændrer sig, efterhånden som dit produkt ændrer sig. Tilføj tilfælde for nye funktioner, og fjern tilfælde for funktioner, der er fjernet.

Definition af EDD

Hvad betyder evalueringsdrevet udvikling?

Opsummering

Evalueringsdrevet udvikling er ufravigelig for seriøse agenter. Skriv evalueringer på alle niveauer, kør dem i CI, og udvid din testsuite med produktionsspor.

Gratis at komme i gang

Lær AI-agenter med en AI-underviser — gratis

Skriv og kør rigtig kode i din browser, få øjeblikkelig hjælp fra en AI-underviser døgnet rundt, og fortsæt, hvor du slap, på web eller i appen.

Kurser
60
Lektioner
239

Ofte stillede spørgsmål

Er lektionen “Eval-drevet udvikling af agenter” gratis?

Ja — hele teksten til “Eval-drevet udvikling af agenter” kan læses gratis her på nettet. Hvis du vil øve dig interaktivt med en indbygget kodeeditor og en AI-vejleder døgnet rundt og få adgang til resten af AI-agenter-kurset, skal du opgradere til CoddyKit PRO. AI-agenter-kurset indeholder 4 lektioner i alt.

Hvad lærer jeg i “Eval-drevet udvikling af agenter”?

Skriv evalueringen, før De udgiver agenten — det er den eneste måde at iterere uden regressioner. Du øver dig i AI-agenter med praktisk kode, som du kører direkte i browseren, og en AI-vejleder døgnet rundt besvarer dine spørgsmål, mens du arbejder dig gennem lektionen.

Skal jeg have erfaring for at begynde på AI-agenter?

Der kræves ingen tidligere erfaring. AI-agenter på CoddyKit er tilrettelagt for både begyndere og øvede, så du kan starte her eller fra begyndelsen og lære i dit eget tempo. Dette er lektion 1 af 4.

Hvor lang tid tager lektionen “Eval-drevet udvikling af agenter”?

De fleste CoddyKit-lektioner tager cirka 5–10 minutter. Hver lektion er kort og interaktiv, så du gør løbende fremskridt og kan fortsætte, hvor du slap – på både web og app.

Kan jeg skrive og køre kode i denne AI-agenter-lektion?

Ja. Alle AI-agenter-lektioner har en indbygget kodeeditor, så du kan skrive og køre rigtig kode direkte i din browser og få øjeblikkelig feedback fra AI – uden lokal opsætning.

Alle lektioner i dette kursus

  1. Eval-drevet udvikling af agenter
  2. Opbygning af et golden testset
  3. Faldgruber ved LLM-as-a-Judge
  4. Benchmark-suiter: SWE-Bench, GAIA, ToolBench
← Tilbage til AI-agenter