0Pricing
AI Prompt Engineering · Lekcja

Zasady CAI i prompty krytyki

Constitutional AI firmy Anthropic: samokrytyka oparta na zasadach nieszkodliwości.

Zasady CAI i prompty krytyki to bezpłatna lekcja AI Prompt Engineering na CoddyKit. To lekcja 1 z 4. Możesz przeczytać całą lekcję poniżej za darmo — a potem ćwiczyć ją interaktywnie w przeglądarce z wbudowanym edytorem kodu i tutorem AI dostępnym 24/7. To część ścieżki edukacyjnej AI Prompt Engineering, a Twój postęp synchronizuje się między webem a aplikacją CoddyKit. Kurs AI Prompt Engineering zawiera 4 lekcji w sumie.

Czym jest Constitutional AI?

Constitutional AI (CAI) to metoda firmy Anthropic służąca do trenowania systemów AI tak, aby były pomocne, nieszkodliwe i uczciwe, z wykorzystaniem zestawu spisanych zasad — konstytucji.

Zamiast polegać wyłącznie na osobach oznaczających szkodliwe odpowiedzi, CAI sprawia, że model sam krytykuje i poprawia własne odpowiedzi w odniesieniu do konstytucji. To rozwiązanie jest zarówno bardziej skalowalne, jak i bardziej spójne.

Konstytucja: spisane zasady

Konstytucja CAI to lista zasad, których model musi przestrzegać. Opublikowana przez Anthropic konstytucja zawiera zasady wywodzące się z:

  • Powszechnej deklaracji praw człowieka ONZ
  • Wytycznych Apple dotyczących App Store
  • Wewnętrznych wytycznych Anthropic dotyczących unikania szkód

Przykładowa zasada: „Wybierz odpowiedź, która z najmniejszym prawdopodobieństwem będzie zawierać treści szkodliwe, nieetyczne, rasistowskie, seksistowskie, toksyczne, niebezpieczne lub nielegalne”.

Trzystopniowa pętla CAI

Constitutional AI wykorzystuje trzyetapowy proces ulepszania odpowiedzi:

  1. Generowanie: model tworzy wstępną odpowiedź, która może być szkodliwa
  2. Krytyka: model ocenia odpowiedź w odniesieniu do zasady
  3. Poprawa: model przepisuje odpowiedź, aby uwzględnić uwagi krytyczne

Pętlę można wykonać raz lub wielokrotnie. Każda iteracja sprawia, że odpowiedź jest lepiej zgodna z konstytucją.

Krok 1: generowanie wstępnej odpowiedzi

Pierwszy krok polega po prostu na wygenerowaniu odpowiedzi na prośbę użytkownika — bez żadnych dodatkowych ograniczeń. Odpowiedź może być pomocna, ale również potencjalnie szkodliwa, stronnicza lub niedokładna.

import anthropic

client = anthropic.Anthropic(api_key='sk-ant-...')

# Step 1: Generate initial response
def generate_initial(user_request):
    response = client.messages.create(
        model='claude-opus-4-5',
        max_tokens=512,
        messages=[
            {'role': 'user', 'content': user_request}
        ]
    )
    return response.content[0].text

initial = generate_initial('How do I pick a lock?')
print('Initial response:', initial[:200])

Krok 2: krytyka w odniesieniu do zasady

W kroku krytyki model otrzymuje własną wstępną odpowiedź oraz konkretną zasadę, a następnie wskazuje, w jaki sposób odpowiedź narusza tę zasadę lub jak mogłaby lepiej ją spełniać.

import anthropic

client = anthropic.Anthropic(api_key='sk-ant-...')

PRINCIPLE = (
    'Choose the response that is least likely to provide instructions '
    'that could enable illegal activity or harm to others.'
)

def critique_response(user_request, initial_response, principle):
    critique_prompt = (
        f'Human: {user_request}\n\n'
        f'Assistant: {initial_response}\n\n'
        f'Critique the assistant response using this principle: {principle}\n'
        f'Identify specific problems and explain why they violate the principle.'
    )
    response = client.messages.create(
        model='claude-opus-4-5',
        max_tokens=256,
        messages=[{'role': 'user', 'content': critique_prompt}]
    )
    return response.content[0].text

critique = critique_response('How do I pick a lock?', initial, PRINCIPLE)
print('Critique:', critique[:200])

Krok 3: poprawa na podstawie krytyki

W kroku poprawy model otrzymuje krytykę i tworzy nową, ulepszoną odpowiedź, która uwzględnia wskazane problemy, pozostając przy tym możliwie pomocna.

import anthropic

client = anthropic.Anthropic(api_key='sk-ant-...')

def revise_response(user_request, initial_response, critique_text):
    revise_prompt = (
        f'Human: {user_request}\n\n'
        f'Original assistant response: {initial_response}\n\n'
        f'Critique of that response: {critique_text}\n\n'
        f'Please rewrite the assistant response to address the critique '
        f'while still being as helpful as possible to the user.'
    )
    response = client.messages.create(
        model='claude-opus-4-5',
        max_tokens=512,
        messages=[{'role': 'user', 'content': revise_prompt}]
    )
    return response.content[0].text

revised = revise_response('How do I pick a lock?', initial, critique)
print('Revised response:', revised[:300])

Wybór zasad do zastosowania

Konstytucja CAI zawiera wiele zasad. Nie stosuje się ich wszystkich do każdej odpowiedzi — byłoby to powolne i redundantne.

W praktyce wybiera się zasady odpowiednie dla danej dziedziny lub poziomu ryzyka:

  • Dziedziny wysokiego ryzyka: stosuj 3–5 zasad bezpieczeństwa
  • Asystent ogólnego przeznaczenia: stosuj 1–2 szeroko obowiązujące zasady
  • Twórcze pisanie: stosuj zasady dotyczące legalności i treści o charakterze jawnym
# Example principles from Anthropic's published constitution
PRINCIPLES = [
    'Choose the response that is least likely to contain harmful, '
    'unethical, racist, sexist, toxic, dangerous, or illegal content.',

    'Choose the response that a thoughtful, senior Anthropic employee '
    'would consider optimal given the context.',

    'Choose the response that is most likely to be true and accurate, '
    'even if it requires acknowledging uncertainty.',

    'Choose the response that would be most appropriate for children '
    'if the context is ambiguous about the audience.',
]

# For a medical advice context, apply principles 1 and 3
medical_principles = [PRINCIPLES[0], PRINCIPLES[2]]

# For a general chat context, apply principle 2
general_principles = [PRINCIPLES[1]]

CAI w RLHF: SL-CAI i RLCAI

Anthropic wykorzystuje CAI w dwóch fazach trenowania:

  • SL-CAI: uczenie nadzorowane — generuje pary krytyka–poprawiona odpowiedź, a poprawione odpowiedzi wykorzystuje do dostrajania modelu
  • RLCAI: uczenie ze wzmocnieniem — wykorzystuje model preferencji wytrenowany za pomocą CAI jako sygnał nagrody zamiast etykiet preferencji nadanych przez ludzi

Jako inżynier promptów stosuje Pan/Pani zasady CAI podczas wnioskowania w swoich aplikacjach — wykorzystuje Pan/Pani tę samą logikę krytyki i poprawy, bez infrastruktury treningowej.

Pomocny, nieszkodliwy i uczciwy — framework HHH

Celem trenowania Anthropic jest framework HHH:

  • Pomocny: rzeczywiście pomaga użytkownikowi w realizacji jego prośby
  • Nieszkodliwy: unika wyrządzania szkód użytkownikom, osobom trzecim i społeczeństwu
  • Uczciwy: nie wprowadza w błąd i nie udaje pewności, której nie ma

Te trzy cele czasami są ze sobą sprzeczne — proces krytyki i poprawy CAI ma na celu znalezienie odpowiedzi, która jednocześnie spełnia wszystkie trzy.

Szablon promptu do krytyki CAI

Niezawodny szablon promptu do krytyki, który można dostosować do swoich aplikacji:

CRITIQUE_TEMPLATE = (
    'Review the following conversation and critique the assistant response.\n\n'
    'Conversation:\n'
    'Human: {user_message}\n'
    'Assistant: {assistant_response}\n\n'
    'Critique Request: Identify specific ways the assistant response could be '
    'improved to be more {principle_goal}. '
    'If the response is already excellent, say so briefly.\n\n'
    'Critique:'
)

# Example: critique for harmlessness
harmless_critique = CRITIQUE_TEMPLATE.format(
    user_message='How do I make someone angry at a party?',
    assistant_response='Here are some classic pranks you can try...',
    principle_goal='harmless and considerate of all people involved'
)

print(harmless_critique[:300])

Kiedy stosować pętle CAI

Nie każda odpowiedź wymaga cyklu krytyki i poprawy. Stosuj CAI, gdy:

  • Prośba dotyczy dziedziny wysokiego ryzyka (zdrowie, prawo, bezpieczeństwo)
  • Wstępna odpowiedź wydaje się wymijająca lub potencjalnie szkodliwa
  • Aplikacja ma rygorystyczne wymagania dotyczące treści
  • Chcesz przeprowadzić kontrolę jakości przed pokazaniem wyniku użytkownikom

W przypadku rutynowych zapytań o niskim ryzyku pomiń CAI, aby oszczędzić czas i koszty.

Sprawdź wiedzę: trzystopniowa pętla CAI

Jaka jest prawidłowa kolejność kroków w pętli krytyki Constitutional AI?

Podsumowanie: zasady CAI i prompty krytykujące

Constitutional AI wykorzystuje trzyetapową pętlę: generuje wstępną odpowiedź, krytykuje ją w odniesieniu do spisanej zasady, a następnie poprawia, aby uzyskać lepszy wynik. Konstytucja to lista zasad, które nadają priorytet pomocności, nieszkodliwości i uczciwości. Anthropic stosuje CAI zarówno w fazie nadzorowanego dostrajania, jak i w fazie RLHF. Na poziomie aplikacji można zaimplementować tę samą logikę krytyki i poprawy podczas wnioskowania, wykorzystując wywołania API. CAI należy stosować wybiórczo w dziedzinach wysokiego ryzyka, aby zachować równowagę między bezpieczeństwem, opóźnieniami i kosztami.

Często zadawane pytania

Czy lekcja „Zasady CAI i prompty krytyki” jest bezpłatna?

Tak — pełny tekst „Zasady CAI i prompty krytyki” jest dostępny za darmo tutaj w sieci. Aby ćwiczyć ją interaktywnie (wbudowany edytor kodu i tutor AI dostępny 24/7) i odblokować resztę kursu AI Prompt Engineering, przejdź na CoddyKit PRO. Kurs AI Prompt Engineering zawiera 4 lekcji w sumie.

Co nauczysz się w „Zasady CAI i prompty krytyki”?

Constitutional AI firmy Anthropic: samokrytyka oparta na zasadach nieszkodliwości. Ćwiczysz AI Prompt Engineering z praktycznym kodem, który uruchamiasz bezpośrednio w przeglądarce, a tutor AI dostępny 24/7 odpowiada na Twoje pytania podczas pracy nad lekcją.

Czy potrzebuję doświadczenia, aby zacząć AI Prompt Engineering?

Nie wymagamy żadnego doświadczenia. AI Prompt Engineering w CoddyKit jest strukturyzowany dla początkujących i zaawansowanych użytkowników, więc możesz zacząć tutaj lub od początku i uczyć się w swoim tempie. To lekcja 1 z 4.

Ile czasu zajmuje lekcja „Zasady CAI i prompty krytyki”?

Większość lekcji CoddyKit trwa około 5–10 minut. Każda lekcja to mały, interaktywny krok, dzięki czemu robisz systematyczne postępy i zawsze wracasz dokładnie do tego samego miejsca — na webie i w aplikacji.

Czy mogę pisać i uruchamiać kod w tej lekcji AI Prompt Engineering?

Tak. Każda lekcja AI Prompt Engineering zawiera wbudowany edytor kodu, więc piszesz i uruchamiasz prawdziwy kod bezpośrednio w przeglądarce i od razu otrzymujesz sprzężenie zwrotne od AI — bez konfiguracji na komputerze.

Wszystkie lekcje w tym kursie

  1. Zasady CAI i prompty krytyki
  2. Wzorce samokrytyki i rewizji
  3. Napięcie między nieszkodliwością a użytecznością
  4. Implementowanie CAI w aplikacjach
← Powrót do AI Prompt Engineering