AI Prompt Engineering · Lekcja

Czytanie i ocenianie wyników AI

Poznaj kryteria oceny istotności, poprawności i kompletności odpowiedzi AI.

Lekcja 1 z 413 kroki

Czytanie i ocenianie wyników AI to bezpłatna lekcja AI Prompt Engineering na CoddyKit. To lekcja 1 z 4. Możesz przeczytać całą lekcję poniżej za darmo — a potem ćwiczyć ją interaktywnie w przeglądarce z wbudowanym edytorem kodu i tutorem AI dostępnym 24/7. To część ścieżki edukacyjnej AI Prompt Engineering, a Twój postęp synchronizuje się między webem a aplikacją CoddyKit. Kurs AI Prompt Engineering zawiera 4 lekcji w sumie.

Dlaczego ocena ma znaczenie

Uzyskanie odpowiedzi od AI to dopiero połowa zadania. Druga połowa to ocena, czy odpowiedź rzeczywiście jest dobra.

Bez jasnych kryteriów oceny można zaakceptować odpowiedź, która wygląda profesjonalnie, ale odpowiada na niewłaściwe pytanie, albo odrzucić naprawdę użyteczną odpowiedź tylko dlatego, że nie ma oczekiwanego formatu.

Wyrobienie umiejętności rzetelnej oceny jakości treści generowanych przez AI to jedna z najbardziej praktycznych umiejętności w prompt engineeringu.

Cztery kryteria oceny

Oceniając odpowiedź AI, należy sprawdzić cztery aspekty:

  • Trafność — Czy odpowiedź dotyczy rzeczywistego pytania?
  • Poprawność — Czy informacje są zgodne z faktami?
  • Kompletność — Czy uwzględniono wszystkie elementy polecenia?
  • Format — Czy odpowiedź ma potrzebną strukturę?

Odpowiedź może uzyskać wysoką ocenę w trzech aspektach i zawieść w czwartym. Każde kryterium ma znaczenie niezależnie od pozostałych.

Kryterium 1: Trafność

Trafność oznacza sprawdzenie, czy model odpowiedział na faktycznie zadane pytanie, czy na pytanie powiązane, ale inne.

Przykład: pytają Państwo "Jakie ryzyko wiąże się ze stosowaniem LLM w ochronie zdrowia?", a model odpowiada ogólnym omówieniem działania LLM. Taka odpowiedź może być poprawna, ale nie jest trafna — rozmija się z istotą pytania.

Aby sprawdzić trafność, proszę ponownie przeczytać pierwotny prompt i zadać sobie pytanie: czy odpowiedź bezpośrednio odnosi się do tego, o co zapytano?

Kryterium 2: Dokładność

Dokładność oznacza sprawdzenie, czy fakty, dane liczbowe i twierdzenia zawarte w odpowiedzi są poprawne.

Modele AI mogą halucynować — mogą z przekonaniem przedstawiać informacje, które są po prostu błędne. Do typowych problemów z dokładnością należą:

  • Nieprawidłowe statystyki lub daty
  • Błędnie przypisane cytaty
  • Nieaktualne informacje przedstawione jako bieżące
  • Zmyślone źródła lub cytowania

W przypadku tematów opartych na faktach przed wykorzystaniem wyniku zawsze należy zweryfikować kluczowe twierdzenia w wiarygodnym źródle.

Kryterium 3: Kompletność

Kompletność oznacza sprawdzenie, czy odpowiedź obejmuje wszystkie elementy prośby.

Jeśli prompt zawierał kilka części — "Wyjaśnij X, podaj trzy przykłady i zaproponuj następny krok" — należy sprawdzić, czy model odniósł się do wszystkich trzech, a nie tylko do pierwszej.

Modele czasami pomijają ostatnią część wieloczęściowej prośby, zwłaszcza gdy prompt jest długi. Porównanie odpowiedzi z promptem punkt po punkcie to najbardziej niezawodny sposób sprawdzenia kompletności.

Kryterium 4: Format

Format oznacza sprawdzenie, czy odpowiedź ma strukturę odpowiadającą potrzebom.

Nawet idealnie dokładna i kompletna odpowiedź może być trudna w użyciu, jeśli ma niewłaściwy format. Typowe niezgodności formatu:

  • Tekst ciągły, gdy potrzebne były wypunktowania
  • Długi esej, gdy potrzebne było podsumowanie
  • Brak nagłówków ułatwiających nawigację
  • Kod bez wyjaśnień lub wyjaśnienia bez kodu

Problemy z formatem często najłatwiej naprawić za pomocą promptu uzupełniającego.

Prosta lista kontrolna oceny

Po otrzymaniu dowolnej odpowiedzi AI proszę przejść przez następującą mentalną listę kontrolną:

  • Trafność: Czy odpowiedź dotyczy faktycznie zadanego pytania?
  • Dokładność: Czy można zaufać faktom? Co należy zweryfikować?
  • Kompletność: Czy odpowiedź obejmuje wszystkie części prośby?
  • Format: Czy struktura pozwala wykorzystać odpowiedź?

Jeśli którekolwiek kryterium nie jest spełnione, wskazuje to dokładnie, jaki rodzaj promptu uzupełniającego należy napisać. Każde kryterium wskazuje konkretny rodzaj poprawki.

Ocena w kodzie: punktowanie odpowiedzi

Można zbudować lekki wrapper oceniający w Pythonie, który za pomocą drugiego wywołania LLM przyznaje odpowiedzi punkty według każdego kryterium:

import openai

client = openai.OpenAI(api_key='sk-...')

def evaluate_response(original_prompt, response_text):
    eval_prompt = f'''You are an evaluator. Score the following AI response on a scale of 1-5 for each criterion.

Original prompt: {original_prompt}

AI response: {response_text}

Score each:
- Relevance (1-5): Did it answer the actual question?
- Accuracy (1-5): Are the facts correct? (flag any concerns)
- Completeness (1-5): Did it cover all parts of the request?
- Format (1-5): Is it structured appropriately?

Return your scores as: Relevance: X, Accuracy: X, Completeness: X, Format: X
Then a one-sentence note for any score below 4.'''

    result = client.chat.completions.create(
        model='gpt-4o-mini',
        messages=[{'role': 'user', 'content': eval_prompt}]
    )
    return result.choices[0].message.content

Błędy trafności: typowe wzorce

Błędy trafności zwykle mają przewidywalne wzorce. Ich rozpoznawanie przyspiesza ocenę:

  • Dryf tematyczny — model zaczyna poprawnie, a następnie przechodzi do powiązanego tematu
  • Podmiana pytania — model odpowiada na prostszą lub łatwiejszą wersję pytania
  • Nadmierne uogólnienie — pytanie dotyczyło konkretnego przypadku, a model odpowiada na poziomie ogólnym
  • Zignorowanie ograniczenia — określono kontekst, np. "dla początkujących", ale model go zignorował

Każdy wzorzec sugeruje konkretną poprawkę w prompcie uzupełniającym.

Sygnały ostrzegawcze dotyczące dokładności

Nawet jeśli nie można od razu zweryfikować danego twierdzenia, pewne sygnały sugerują niższą dokładność:

  • Bardzo konkretne liczby podane bez źródła
  • Twierdzenia, które wydają się zbyt wygodne lub idealnie trafne
  • Odwołania do badań, artykułów lub książek podane wraz z tytułem i autorem
  • Daty i numery wersji, które często się zmieniają
  • Szczegółowe informacje prawne, medyczne lub finansowe

Nie są to dowody błędu, ale przed wykorzystaniem wyniku w sytuacji o istotnych konsekwencjach warto dokładnie sprawdzić właśnie te elementy.

Wykorzystanie oceny do pisania lepszych promptów uzupełniających

Prawdziwa wartość oceny polega na tym, że każde niespełnione kryterium bezpośrednio wskazuje rodzaj promptu uzupełniającego:

  • Niespełniona trafność → "Odpowiedź dotyczyła X, ale pytanie dotyczyło Y. Proszę skupić się na Y."
  • Wątpliwości dotyczące dokładności → "Proszę ponownie sprawdzić twierdzenie dotyczące Z i podać podstawę tej odpowiedzi."
  • Niepełna odpowiedź → "Odpowiedź nie uwzględniała trzeciej części pytania. Proszę ją dodać."
  • Niewłaściwy format → "Proszę przepisać to w formie wypunktowania z jednozdaniowym podsumowaniem na początku."

Ocena i pisanie promptów uzupełniających działają jak pętla informacji zwrotnej.

Sprawdzenie wiedzy: kryteria oceny

Pytają Państwo model: "Wymień 5 najpopularniejszych frameworków webowych języka Python i dodaj jednozdaniowy opis każdego z nich." Model odpowiada dobrze napisanym esejem o historii Pythona i jego rozwoju w programowaniu webowym, krótko wspominając o Flask i Django, ale nie wymieniając 5 frameworków.

Które kryterium ta odpowiedź narusza w najbardziej istotny sposób?

Podsumowanie: czytanie i ocenianie wyników AI

Skuteczne pisanie promptów to proces dwuetapowy: przygotowanie promptu i ocena odpowiedzi.

Cztery kryteria — Trafność, Dokładność, Kompletność, Format — zapewniają systematyczny sposób oceniania dowolnego wyniku AI. Każde niespełnione kryterium dokładnie wskazuje rodzaj promptu uzupełniającego, który należy napisać.

W następnej lekcji będą Państwo ćwiczyć pisanie promptów uzupełniających służących do korygowania konkretnych rodzajów błędów.

Bezpłatny start

Ucz się AI Prompt Engineering dzięki korepetycjom AI — za darmo

Pisz i uruchamiaj kod w przeglądarce, otrzymuj natychmiastową pomoc od korepetytora AI dostępnego 24/7 i kontynuuj naukę w sieci lub w aplikacji.

Kursy
53
Lekcje
199

Często zadawane pytania

Czy lekcja „Czytanie i ocenianie wyników AI” jest bezpłatna?

Tak — pełny tekst „Czytanie i ocenianie wyników AI” jest dostępny za darmo tutaj w sieci. Aby ćwiczyć ją interaktywnie (wbudowany edytor kodu i tutor AI dostępny 24/7) i odblokować resztę kursu AI Prompt Engineering, przejdź na CoddyKit PRO. Kurs AI Prompt Engineering zawiera 4 lekcji w sumie.

Co nauczysz się w „Czytanie i ocenianie wyników AI”?

Poznaj kryteria oceny istotności, poprawności i kompletności odpowiedzi AI. Ćwiczysz AI Prompt Engineering z praktycznym kodem, który uruchamiasz bezpośrednio w przeglądarce, a tutor AI dostępny 24/7 odpowiada na Twoje pytania podczas pracy nad lekcją.

Czy potrzebuję doświadczenia, aby zacząć AI Prompt Engineering?

Nie wymagamy żadnego doświadczenia. AI Prompt Engineering w CoddyKit jest strukturyzowany dla początkujących i zaawansowanych użytkowników, więc możesz zacząć tutaj lub od początku i uczyć się w swoim tempie. To lekcja 1 z 4.

Ile czasu zajmuje lekcja „Czytanie i ocenianie wyników AI”?

Większość lekcji CoddyKit trwa około 5–10 minut. Każda lekcja to mały, interaktywny krok, dzięki czemu robisz systematyczne postępy i zawsze wracasz dokładnie do tego samego miejsca — na webie i w aplikacji.

Czy mogę pisać i uruchamiać kod w tej lekcji AI Prompt Engineering?

Tak. Każda lekcja AI Prompt Engineering zawiera wbudowany edytor kodu, więc piszesz i uruchamiasz prawdziwy kod bezpośrednio w przeglądarce i od razu otrzymujesz sprzężenie zwrotne od AI — bez konfiguracji na komputerze.

Wszystkie lekcje w tym kursie

  1. Czytanie i ocenianie wyników AI
  2. Pisanie skutecznych promptów uzupełniających
  3. Rozwijanie poprzednich odpowiedzi
  4. Kiedy udoskonalać, a kiedy zacząć od nowa
← Powrót do AI Prompt Engineering