Zasady CAI i prompty krytyki
Constitutional AI firmy Anthropic: samokrytyka oparta na zasadach nieszkodliwości.
Zasady CAI i prompty krytyki to bezpłatna lekcja AI Prompt Engineering na CoddyKit. To lekcja 1 z 4. Możesz przeczytać całą lekcję poniżej za darmo — a potem ćwiczyć ją interaktywnie w przeglądarce z wbudowanym edytorem kodu i tutorem AI dostępnym 24/7. To część ścieżki edukacyjnej AI Prompt Engineering, a Twój postęp synchronizuje się między webem a aplikacją CoddyKit. Kurs AI Prompt Engineering zawiera 4 lekcji w sumie.
Czym jest Constitutional AI?
Constitutional AI (CAI) to metoda firmy Anthropic służąca do trenowania systemów AI tak, aby były pomocne, nieszkodliwe i uczciwe, z wykorzystaniem zestawu spisanych zasad — konstytucji.
Zamiast polegać wyłącznie na osobach oznaczających szkodliwe odpowiedzi, CAI sprawia, że model sam krytykuje i poprawia własne odpowiedzi w odniesieniu do konstytucji. To rozwiązanie jest zarówno bardziej skalowalne, jak i bardziej spójne.
Konstytucja: spisane zasady
Konstytucja CAI to lista zasad, których model musi przestrzegać. Opublikowana przez Anthropic konstytucja zawiera zasady wywodzące się z:
- Powszechnej deklaracji praw człowieka ONZ
- Wytycznych Apple dotyczących App Store
- Wewnętrznych wytycznych Anthropic dotyczących unikania szkód
Przykładowa zasada: „Wybierz odpowiedź, która z najmniejszym prawdopodobieństwem będzie zawierać treści szkodliwe, nieetyczne, rasistowskie, seksistowskie, toksyczne, niebezpieczne lub nielegalne”.
Trzystopniowa pętla CAI
Constitutional AI wykorzystuje trzyetapowy proces ulepszania odpowiedzi:
- Generowanie: model tworzy wstępną odpowiedź, która może być szkodliwa
- Krytyka: model ocenia odpowiedź w odniesieniu do zasady
- Poprawa: model przepisuje odpowiedź, aby uwzględnić uwagi krytyczne
Pętlę można wykonać raz lub wielokrotnie. Każda iteracja sprawia, że odpowiedź jest lepiej zgodna z konstytucją.
Krok 1: generowanie wstępnej odpowiedzi
Pierwszy krok polega po prostu na wygenerowaniu odpowiedzi na prośbę użytkownika — bez żadnych dodatkowych ograniczeń. Odpowiedź może być pomocna, ale również potencjalnie szkodliwa, stronnicza lub niedokładna.
import anthropic
client = anthropic.Anthropic(api_key='sk-ant-...')
# Step 1: Generate initial response
def generate_initial(user_request):
response = client.messages.create(
model='claude-opus-4-5',
max_tokens=512,
messages=[
{'role': 'user', 'content': user_request}
]
)
return response.content[0].text
initial = generate_initial('How do I pick a lock?')
print('Initial response:', initial[:200])Krok 2: krytyka w odniesieniu do zasady
W kroku krytyki model otrzymuje własną wstępną odpowiedź oraz konkretną zasadę, a następnie wskazuje, w jaki sposób odpowiedź narusza tę zasadę lub jak mogłaby lepiej ją spełniać.
import anthropic
client = anthropic.Anthropic(api_key='sk-ant-...')
PRINCIPLE = (
'Choose the response that is least likely to provide instructions '
'that could enable illegal activity or harm to others.'
)
def critique_response(user_request, initial_response, principle):
critique_prompt = (
f'Human: {user_request}\n\n'
f'Assistant: {initial_response}\n\n'
f'Critique the assistant response using this principle: {principle}\n'
f'Identify specific problems and explain why they violate the principle.'
)
response = client.messages.create(
model='claude-opus-4-5',
max_tokens=256,
messages=[{'role': 'user', 'content': critique_prompt}]
)
return response.content[0].text
critique = critique_response('How do I pick a lock?', initial, PRINCIPLE)
print('Critique:', critique[:200])Krok 3: poprawa na podstawie krytyki
W kroku poprawy model otrzymuje krytykę i tworzy nową, ulepszoną odpowiedź, która uwzględnia wskazane problemy, pozostając przy tym możliwie pomocna.
import anthropic
client = anthropic.Anthropic(api_key='sk-ant-...')
def revise_response(user_request, initial_response, critique_text):
revise_prompt = (
f'Human: {user_request}\n\n'
f'Original assistant response: {initial_response}\n\n'
f'Critique of that response: {critique_text}\n\n'
f'Please rewrite the assistant response to address the critique '
f'while still being as helpful as possible to the user.'
)
response = client.messages.create(
model='claude-opus-4-5',
max_tokens=512,
messages=[{'role': 'user', 'content': revise_prompt}]
)
return response.content[0].text
revised = revise_response('How do I pick a lock?', initial, critique)
print('Revised response:', revised[:300])Wybór zasad do zastosowania
Konstytucja CAI zawiera wiele zasad. Nie stosuje się ich wszystkich do każdej odpowiedzi — byłoby to powolne i redundantne.
W praktyce wybiera się zasady odpowiednie dla danej dziedziny lub poziomu ryzyka:
- Dziedziny wysokiego ryzyka: stosuj 3–5 zasad bezpieczeństwa
- Asystent ogólnego przeznaczenia: stosuj 1–2 szeroko obowiązujące zasady
- Twórcze pisanie: stosuj zasady dotyczące legalności i treści o charakterze jawnym
# Example principles from Anthropic's published constitution
PRINCIPLES = [
'Choose the response that is least likely to contain harmful, '
'unethical, racist, sexist, toxic, dangerous, or illegal content.',
'Choose the response that a thoughtful, senior Anthropic employee '
'would consider optimal given the context.',
'Choose the response that is most likely to be true and accurate, '
'even if it requires acknowledging uncertainty.',
'Choose the response that would be most appropriate for children '
'if the context is ambiguous about the audience.',
]
# For a medical advice context, apply principles 1 and 3
medical_principles = [PRINCIPLES[0], PRINCIPLES[2]]
# For a general chat context, apply principle 2
general_principles = [PRINCIPLES[1]]CAI w RLHF: SL-CAI i RLCAI
Anthropic wykorzystuje CAI w dwóch fazach trenowania:
- SL-CAI: uczenie nadzorowane — generuje pary krytyka–poprawiona odpowiedź, a poprawione odpowiedzi wykorzystuje do dostrajania modelu
- RLCAI: uczenie ze wzmocnieniem — wykorzystuje model preferencji wytrenowany za pomocą CAI jako sygnał nagrody zamiast etykiet preferencji nadanych przez ludzi
Jako inżynier promptów stosuje Pan/Pani zasady CAI podczas wnioskowania w swoich aplikacjach — wykorzystuje Pan/Pani tę samą logikę krytyki i poprawy, bez infrastruktury treningowej.
Pomocny, nieszkodliwy i uczciwy — framework HHH
Celem trenowania Anthropic jest framework HHH:
- Pomocny: rzeczywiście pomaga użytkownikowi w realizacji jego prośby
- Nieszkodliwy: unika wyrządzania szkód użytkownikom, osobom trzecim i społeczeństwu
- Uczciwy: nie wprowadza w błąd i nie udaje pewności, której nie ma
Te trzy cele czasami są ze sobą sprzeczne — proces krytyki i poprawy CAI ma na celu znalezienie odpowiedzi, która jednocześnie spełnia wszystkie trzy.
Szablon promptu do krytyki CAI
Niezawodny szablon promptu do krytyki, który można dostosować do swoich aplikacji:
CRITIQUE_TEMPLATE = (
'Review the following conversation and critique the assistant response.\n\n'
'Conversation:\n'
'Human: {user_message}\n'
'Assistant: {assistant_response}\n\n'
'Critique Request: Identify specific ways the assistant response could be '
'improved to be more {principle_goal}. '
'If the response is already excellent, say so briefly.\n\n'
'Critique:'
)
# Example: critique for harmlessness
harmless_critique = CRITIQUE_TEMPLATE.format(
user_message='How do I make someone angry at a party?',
assistant_response='Here are some classic pranks you can try...',
principle_goal='harmless and considerate of all people involved'
)
print(harmless_critique[:300])Kiedy stosować pętle CAI
Nie każda odpowiedź wymaga cyklu krytyki i poprawy. Stosuj CAI, gdy:
- Prośba dotyczy dziedziny wysokiego ryzyka (zdrowie, prawo, bezpieczeństwo)
- Wstępna odpowiedź wydaje się wymijająca lub potencjalnie szkodliwa
- Aplikacja ma rygorystyczne wymagania dotyczące treści
- Chcesz przeprowadzić kontrolę jakości przed pokazaniem wyniku użytkownikom
W przypadku rutynowych zapytań o niskim ryzyku pomiń CAI, aby oszczędzić czas i koszty.
Sprawdź wiedzę: trzystopniowa pętla CAI
Jaka jest prawidłowa kolejność kroków w pętli krytyki Constitutional AI?
Podsumowanie: zasady CAI i prompty krytykujące
Constitutional AI wykorzystuje trzyetapową pętlę: generuje wstępną odpowiedź, krytykuje ją w odniesieniu do spisanej zasady, a następnie poprawia, aby uzyskać lepszy wynik. Konstytucja to lista zasad, które nadają priorytet pomocności, nieszkodliwości i uczciwości. Anthropic stosuje CAI zarówno w fazie nadzorowanego dostrajania, jak i w fazie RLHF. Na poziomie aplikacji można zaimplementować tę samą logikę krytyki i poprawy podczas wnioskowania, wykorzystując wywołania API. CAI należy stosować wybiórczo w dziedzinach wysokiego ryzyka, aby zachować równowagę między bezpieczeństwem, opóźnieniami i kosztami.
Często zadawane pytania
Czy lekcja „Zasady CAI i prompty krytyki” jest bezpłatna?
Tak — pełny tekst „Zasady CAI i prompty krytyki” jest dostępny za darmo tutaj w sieci. Aby ćwiczyć ją interaktywnie (wbudowany edytor kodu i tutor AI dostępny 24/7) i odblokować resztę kursu AI Prompt Engineering, przejdź na CoddyKit PRO. Kurs AI Prompt Engineering zawiera 4 lekcji w sumie.
Co nauczysz się w „Zasady CAI i prompty krytyki”?
Constitutional AI firmy Anthropic: samokrytyka oparta na zasadach nieszkodliwości. Ćwiczysz AI Prompt Engineering z praktycznym kodem, który uruchamiasz bezpośrednio w przeglądarce, a tutor AI dostępny 24/7 odpowiada na Twoje pytania podczas pracy nad lekcją.
Czy potrzebuję doświadczenia, aby zacząć AI Prompt Engineering?
Nie wymagamy żadnego doświadczenia. AI Prompt Engineering w CoddyKit jest strukturyzowany dla początkujących i zaawansowanych użytkowników, więc możesz zacząć tutaj lub od początku i uczyć się w swoim tempie. To lekcja 1 z 4.
Ile czasu zajmuje lekcja „Zasady CAI i prompty krytyki”?
Większość lekcji CoddyKit trwa około 5–10 minut. Każda lekcja to mały, interaktywny krok, dzięki czemu robisz systematyczne postępy i zawsze wracasz dokładnie do tego samego miejsca — na webie i w aplikacji.
Czy mogę pisać i uruchamiać kod w tej lekcji AI Prompt Engineering?
Tak. Każda lekcja AI Prompt Engineering zawiera wbudowany edytor kodu, więc piszesz i uruchamiasz prawdziwy kod bezpośrednio w przeglądarce i od razu otrzymujesz sprzężenie zwrotne od AI — bez konfiguracji na komputerze.
Wszystkie lekcje w tym kursie
- Zasady CAI i prompty krytyki
- Wzorce samokrytyki i rewizji
- Napięcie między nieszkodliwością a użytecznością
- Implementowanie CAI w aplikacjach