Wersjonowanie promptów i ocena wyników
Śledź zmiany promptów i oceniaj odpowiedzi
Wersjonowanie promptów i ocena wyników to bezpłatna lekcja MLOps Academy na CoddyKit. To lekcja 2 z 4. Możesz przeczytać całą lekcję poniżej za darmo — a potem ćwiczyć ją interaktywnie w przeglądarce z wbudowanym edytorem kodu i tutorem AI dostępnym 24/7. To część ścieżki edukacyjnej MLOps Academy, a Twój postęp synchronizuje się między webem a aplikacją CoddyKit. Kurs MLOps Academy zawiera 4 lekcji w sumie.
Prompty są kodem
Zmiana sformułowania promptu może z dnia na dzień zmienić zachowanie. Dlatego każdy prompt traktuje się jako wersjonowany artefakt z historią, przeglądem i możliwością wycofania zmian. 📝
Przechowuj prompty, nie ciągi znaków
Ciągi znaków zakodowane na stałe i rozproszone w kodzie są niemożliwe do śledzenia. Prompty należy przechowywać w rejestrze lub plikach, aby każda zmiana była widoczna i możliwa do porównania.
prompts/summarize_ticket.v2.txt
prompts/summarize_ticket.v3.txtOznaczaj każdą wersję
Każdemu promptowi nadaj jasny identyfikator wersji, który można przypiąć w kodzie. Dzięki temu zawsze wiadomo, jakie dokładnie sformułowanie wygenerowało dany wynik.
PROMPT_VERSION = "summarize-v3"
template = load_prompt(PROMPT_VERSION)Zbuduj zbiór ewaluacyjny
Zbierz rzeczywiste dane wejściowe wraz z oczekiwanymi odpowiedziami. Ten zbiór ewaluacyjny jest punktem odniesienia do oceny, czy zmiana promptu rzeczywiście pomogła.
cases = [
{"input": "ticket text...", "expected": "Refund requested"},
]Porównuj z odpowiedziami referencyjnymi
W zadaniach ze znaną odpowiedzią porównuj wynik z oczekiwanym tekstem. Prosta metryka, taka jak exact match lub F1, szybko daje sygnał zaliczenia albo odrzucenia.
Użyj LLM jako sędziego
W przypadku tekstu otwartego poproś inny model o ocenę odpowiedzi według kryteriów. Wzorzec LLM-as-judge pozwala skalować ocenianie poza ręcznie zapisane reguły.
judge_prompt = "Rate 1-5 how well the summary captures the ticket:\n{output}"Kontroluj także sędziego
Sędziowie mogą być stronniczy lub niespójni. Aby zachować ich wiarygodność, należy wyrywkowo porównywać wyniki z ocenami ludzi dla tych samych przypadków.
Uruchamiaj ewaluacje po każdej zmianie
Przed wdrożeniem nowego promptu uruchom go dla całego zbioru ewaluacyjnego. Promuj go tylko wtedy, gdy wynik pozostaje taki sam lub się poprawia — nigdy na podstawie przeczucia.
old = run_eval("summarize-v2")
new = run_eval("summarize-v3")
assert new.score >= old.scoreŚledź regresje
Prompt, który naprawia jeden przypadek, może zepsuć inny. Porównywanie wyników dla poszczególnych przypadków wykrywa te regresje, zanim użytkownicy je zobaczą.
Frameworki pomagają
Narzędzia takie jak promptfoo lub OpenAI Evals uruchamiają zbiory danych, wywołują modele i raportują wyniki. Framework przekształca doraźne testowanie w powtarzalny zestaw testów.
Przypnij zwycięzcę
Gdy jedna wersja zwycięży w ewaluacjach, przypnij ją na produkcji, a pozostałe zarchiwizuj. Otrzymujesz w ten sposób jasny, możliwy do prześledzenia zapis od promptu do wyniku.
Szybkie sprawdzenie
Trzeba ocenić otwarte podsumowania, dla których nie istnieje jedna poprawna odpowiedź. Co najlepiej się sprawdzi?
Podsumowanie
Nauczono się wersjonować prompty, budować zbiór ewaluacyjny, oceniać wyniki za pomocą metryk lub LLM pełniącego rolę sędziego oraz uzależniać wydania od rezultatów. Koniec ze zgadywaniem! 🎉
Ucz się Python dzięki korepetycjom AI — za darmo
Pisz i uruchamiaj kod w przeglądarce, otrzymuj natychmiastową pomoc od korepetytora AI dostępnego 24/7 i kontynuuj naukę w sieci lub w aplikacji.
- Kursy
- 30
- Lekcje
- 120
Często zadawane pytania
Czy lekcja „Wersjonowanie promptów i ocena wyników” jest bezpłatna?
Tak — pełny tekst „Wersjonowanie promptów i ocena wyników” jest dostępny za darmo tutaj w sieci. Aby ćwiczyć ją interaktywnie (wbudowany edytor kodu i tutor AI dostępny 24/7) i odblokować resztę kursu MLOps Academy, przejdź na CoddyKit PRO. Kurs MLOps Academy zawiera 4 lekcji w sumie.
Co nauczysz się w „Wersjonowanie promptów i ocena wyników”?
Śledź zmiany promptów i oceniaj odpowiedzi Ćwiczysz MLOps Academy z praktycznym kodem, który uruchamiasz bezpośrednio w przeglądarce, a tutor AI dostępny 24/7 odpowiada na Twoje pytania podczas pracy nad lekcją.
Czy potrzebuję doświadczenia, aby zacząć MLOps Academy?
Nie wymagamy żadnego doświadczenia. MLOps Academy w CoddyKit jest strukturyzowany dla początkujących i zaawansowanych użytkowników, więc możesz zacząć tutaj lub od początku i uczyć się w swoim tempie. To lekcja 2 z 4.
Ile czasu zajmuje lekcja „Wersjonowanie promptów i ocena wyników”?
Większość lekcji CoddyKit trwa około 5–10 minut. Każda lekcja to mały, interaktywny krok, dzięki czemu robisz systematyczne postępy i zawsze wracasz dokładnie do tego samego miejsca — na webie i w aplikacji.
Czy mogę pisać i uruchamiać kod w tej lekcji MLOps Academy?
Tak. Każda lekcja MLOps Academy zawiera wbudowany edytor kodu, więc piszesz i uruchamiasz prawdziwy kod bezpośrednio w przeglądarce i od razu otrzymujesz sprzężenie zwrotne od AI — bez konfiguracji na komputerze.
Wszystkie lekcje w tym kursie
- Czym LLMOps różni się od klasycznego MLOps
- Wersjonowanie promptów i ocena wyników
- Śledzenie i monitorowanie wywołań LLM
- Guardrails i ocena RAG