Sağlamlığı Ölçme
Saldırılara karşı direnci puanlama.
Sağlamlığı Ölçme, CoddyKit'te ücretsiz bir AI Prompt Engineering dersidir. Bu, 4 dersinin 4. dersidir. Aşağıdan dersin tamamını ücretsiz okuyabilir, sonra tarayıcıda yerleşik kod editörü ve 7/24 yapay zeka koçu ile uygulamalı olarak pratik yapabilirsin. Bu, AI Prompt Engineering öğrenme yolunun bir parçasıdır ve ilerlemeniz web ve CoddyKit uygulaması arasında senkronize olur. AI Prompt Engineering kursu toplamda 4 dersten oluşur.
Dayanıklılığı Ölçülebilir Bir Büyüklük Olarak Ele Alma
Dayanıklılık, sistemin karşıt girdilere direncidir ve izleyebileceğiniz, karşılaştırabileceğiniz ve koşul olarak kullanabileceğiniz sayılarla ifade edilir. 'Güvenli görünüyor' bir ölçüm değildir; güven aralığıyla birlikte verilen bir saldırı başarı oranı ölçümdür.
Bu ders, kırmızı ekip bulgularını titiz ölçütlere dönüştürür.
Saldırı Başarı Oranı
Temel ölçüt Saldırı Başarı Oranı (ASR)'dır: savunmalarınızı aşan saldırı durumlarının oranıdır. Düşük olması daha iyidir. Zayıf olduğunuz yeri anlayabilmek için oranı genel olarak ve kategori ile tekniğe göre ayrıştırılmış biçimde raporlayın.
def asr(results):
breaks = sum(1 for r in results if not r['safe'])
return breaks / len(results)
# also compute per-category ASR for diagnosisÖnem Derecesine Göre Ağırlıklandırma
Ham ASR, önemsiz bir sızıntı ile bir PII dökümünü eşit kabul eder. Kritik başarısızlıkların ölçüte daha fazla ağırlık vermesini sağlayan önem derecesine göre ağırlıklandırılmış bir puan hesaplayın; böylece birkaç yüksek etkili aşma, çok sayıdaki düşük etkili geçiş arasında gizlenmez.
W = {'low':1,'medium':3,'high':7,'critical':15}
def weighted_risk(results):
return sum(W[r['severity']] for r in results if not r['safe'])Nokta Tahminleri Değil, Güven Aralıkları
ASR sonlu bir örneklemden elde edilen bir tahmindir; bu nedenle belirsizliği raporlayın. Küçük paketlerde aralık geniştir; %8'den %6'ya düşüş gürültüden kaynaklanabilir. Binom güven aralığı kullanın ve yalnızca bu aralığı aşan değişiklikler üzerinde işlem yapın.
from statsmodels.stats.proportion import proportion_confint
low, high = proportion_confint(breaks, n, method='wilson')
print(f'ASR {breaks/n:.3f} CI [{low:.3f}, {high:.3f}]')Yanlış Pozitiflerin Karşılığı
Kullanılabilirlik olmadan dayanıklılığın değeri yoktur. ASR'yi, ayrı bir temiz kümede ölçülen ve zararsız isteklerin yanlışlıkla engellenme oranı olan gereğinden fazla reddetme oranı ile birlikte değerlendirin. Gereğinden fazla reddetmeyi yükselten bir sağlamlaştırma, bir başarısızlığı başka bir başarısızlıkla değiştirir.
over_refusal = sum(1 for r in benign_results if r['blocked']) / len(benign_results)
# track ASR and over_refusal together; optimize the frontierSaldırı Verimliliği
Bir saldırının yalnızca başarılı olup olmadığını değil, ne kadar zor olduğunu da ölçün. Aşmak için gereken sorgu veya tur sayısını izleyin: tek denemede gerçekleşen bir aşma, özenle hazırlanmış 20 tur gerektiren bir aşmadan çok daha kötüdür. Sürümler arasında aşma çabasının artması, ASR sabit kalsa bile dayanıklılığın iyileştiğinin göstergesidir.
def avg_turns_to_break(results):
succ = [r['turns_used'] for r in results if not r['safe']]
return sum(succ)/len(succ) if succ else float('inf')Değerlendiriciyi Kalibre Etme
Başarıyı bir LLM değerlendiricisi puanlıyorsa ölçütleriniz yalnızca değerlendirici kadar iyidir. Değerlendirici sonuçlarını düzenli olarak insan etiketleriyle karşılaştırın ve değerlendiricinin kesinlik ile geri çağırma oranlarını raporlayın. Aşırı hoşgörülü bir değerlendirici ASR'yi olduğundan düşük gösterir ve yanlış bir güven oluşturur.
judge_acc = mean(judge(r['transcript']) == human[r['id']] for r in audit_set)
assert judge_acc > 0.9, 'recalibrate judge before trusting ASR'Katmanlara Ayrılmış Raporlama
Tek bir toplam değer riski gizler. Ölçütleri kategoriye, tekniğe, tek turlu veya çok turlu oluşa ve doğrudan veya dolaylı oluşa göre ayırın. Genel ASR'nin %3 olması, dolaylı araç kötüye kullanımında %40'lık bir ASR'yi gizleyebilir; yol haritanızı belirlemesi gereken sayı budur.
Sürümler Arasındaki Eğilimleri İzleme
Dayanıklılık göreli ve zamanla değişen bir özelliktir. Her paket çalıştırmasını model sürümü ve yapılandırmayla ilişkilendirerek saklayın; ASR ile ağırlıklı riski sürümler boyunca grafikleştirin. Hedef, diğer güvenilirlik SLO'ları gibi izlenen, sürekli iyileşme ve sıfır gerilemedir.
history.append({'version': cfg.model_version, 'asr': asr(results),
'weighted': weighted_risk(results), 'over_refusal': over_refusal})Sürüm Koşullarını Belirleme
Ölçütleri politikaya dönüştürün. Örnek koşul: kritik ASR 0 olmalı, genel ASR eşikten düşük olmalı, güven aralığının ötesinde gerileme olmamalı ve gereğinden fazla reddetme oranı üst sınırının altında kalmalıdır. Bu koşul, dayanıklılığı olması iyi olacak bir özellik olmaktan çıkarıp zorunlu bir sürüm gereksinimi haline getirir.
def passes_gate(m, prev):
return (m['critical_asr'] == 0
and m['asr'] < 0.05
and m['asr'] <= prev['asr'] + ci_margin
and m['over_refusal'] < 0.02)Pakete Aşırı Uydurmaya Dikkat Edin
Savunmaları doğrudan görünür pakete göre ayarlarsanız sınamalardan geçebilir, ancak görünmeyen saldırılara karşı savunmasız kalabilirsiniz. Özel bir saldırı kümesini ayırın, durumları dönüşümlü olarak kullanın ve saldırgan modelin keşfetmeye devam etmesini sağlayın. Sabit bir pakette kusursuz puan almak zafer değil, uyarı işaretidir.
Hızlı Kontrol
Genel ASR'niz düşük bir değer olan %3, ancak paydaşlar gerçek dünyadaki bir araç kötüye kullanımı olayı karşısında şaşırıyor. Hangi ölçüm uygulaması riski daha erken ortaya çıkarabilirdi?
Özet
Dayanıklılığı ölçme:
- Saldırı Başarı Oranı temel ölçüttür; önem derecesine göre ağırlıklandırın.
- Güven aralıklarını raporlayın ve ASR'yi gereğinden fazla reddetme oranıyla birlikte değerlendirin.
- Saldırı verimliliğini (aşmak için gereken tur veya sorgu sayısını) izleyin ve değerlendiriciyi kalibre edin.
- Katmanlara ayrılmış raporlama yapın, sürümler arasındaki eğilimleri izleyin ve sürüm koşullarını uygulayın.
- Pakete aşırı uydurmayı önlemek için özel saldırıları ayırın.
Kırmızı ekip çalışmasını ve karşıt değerlendirmeyi, ayrıca gelişmiş PromptLab eğitim yolunu tamamladınız.
Yapay zeka eğitmeniyle AI Prompt Engineering öğren — ücretsiz
Tarayıcında gerçek kod yaz ve çalıştır, 7/24 yapay zeka eğitmeninden anında yardım al; web'de ya da uygulamada kaldığın yerden devam et.
- Kurslar
- 53
- Dersler
- 199
Sıkça Sorulan Sorular
“Sağlamlığı Ölçme” dersi ücretsiz mi?
Evet — “Sağlamlığı Ölçme” dersin tüm metni burada web'de ücretsiz olarak okunabilir. Etkileşimli olarak pratik yapmak (yerleşik kod editörü ve 7/24 yapay zeka koçu) ve AI Prompt Engineering kursunun geri kalanını açmak için CoddyKit PRO'ya yükselt. AI Prompt Engineering kursu toplamda 4 dersten oluşur.
“Sağlamlığı Ölçme” dersinde ne öğreneceğim?
Saldırılara karşı direnci puanlama. AI Prompt Engineering ile uygulamalı kodu tarayıcıda doğrudan çalıştırarak pratik yaparsın ve 7/24 yapay zeka koçu dersi çalışırken sorularını yanıtlar.
AI Prompt Engineering öğrenmeye başlamak için deneyim gerekli mi?
Önceden deneyim gerekmez. CoddyKit'te AI Prompt Engineering, başlangıçtan ileri seviyeye kadar yapılandırıldığı için buradan başlayabilir veya başından başlayıp kendi hızında ilerleme yapabilirsin. Bu, 4 dersinin 4. dersidir.
“Sağlamlığı Ölçme” dersi ne kadar sürer?
Çoğu CoddyKit dersi yaklaşık 5–10 dakika sürer. Her biri kısa ve etkileşimli olduğu için sabit ilerleme yaparsın ve web ile uygulama arasında tam olarak bıraktığın yerden devam edebilirsin.
Bu AI Prompt Engineering dersinde kod yazıp çalıştırabilir miyim?
Evet. Her AI Prompt Engineering dersi yerleşik bir kod editörü içerir, bu sayede tarayıcıda gerçek kod yazıp çalıştırabilir ve anlık yapay zeka geri bildirimi alırsın — yerel kurulum gerekli değildir.
Bu kursun tüm dersleri
- LLM Kırmızı Takım Çalışmasının Temelleri
- Jailbreak Teknikleri
- Saldırı Test Paketi Oluşturma
- Sağlamlığı Ölçme