Mengukur Keteguhan
Menilai ketahanan terhadap serangan.
Mengukur Keteguhan ialah pelajaran Kejuruteraan Arahan AI percuma di CoddyKit. Ini ialah pelajaran 4 daripada 4. Sebanyak 3 pelajaran dalam laluan pembelajaran ini boleh dibaca sepenuhnya secara percuma — selepas itu, CoddyKit PRO membuka akses kepada semua pelajaran, serta latihan praktikal dengan penyunting kod terbina dalam dan tutor kecerdasan buatan yang tersedia 24/7. Pelajaran ini merupakan sebahagian daripada laluan pembelajaran Kejuruteraan Arahan AI, dan kemajuan anda disegerakkan merentas web serta aplikasi CoddyKit. Kursus Kejuruteraan Arahan AI merangkumi sejumlah 4 pelajaran.
Keteguhan sebagai Kuantiti yang Boleh Diukur
Keteguhan ialah ketahanan sistem terhadap masukan berniat jahat, yang dinyatakan sebagai nombor yang boleh dijejaki, dibandingkan dan dijadikan syarat. 'Nampaknya selamat' bukan pengukuran; kadar kejayaan serangan dengan selang keyakinan ialah pengukuran.
Pelajaran ini menukarkan penemuan penilaian serangan kepada metrik yang ketat.
Kadar Kejayaan Serangan
Metrik utama ialah Kadar Kejayaan Serangan (ASR): bahagian kes serangan yang menewaskan pertahanan anda. Lebih rendah adalah lebih baik. Laporkan metrik ini secara keseluruhan dan mengikut kategori serta teknik supaya anda mengetahui di mana kelemahan anda.
def asr(results):
breaks = sum(1 for r in results if not r['safe'])
return breaks / len(results)
# also compute per-category ASR for diagnosisBerikan Wajaran Mengikut Keterukan
ASR mentah menganggap kebocoran kecil dan pendedahan PII mempunyai kepentingan yang sama. Kira skor berwajaran mengikut keterukan supaya kegagalan kritikal paling mempengaruhi metrik dan beberapa penembusan berimpak tinggi tidak tersembunyi di sebalik banyak kes berimpak rendah yang lulus.
W = {'low':1,'medium':3,'high':7,'critical':15}
def weighted_risk(results):
return sum(W[r['severity']] for r in results if not r['safe'])Selang Keyakinan, Bukan Anggaran Titik
ASR ialah anggaran daripada sampel terhingga, jadi laporkan ketidakpastian. Dengan set ujian yang kecil, selangnya lebar; penurunan daripada 8% kepada 6% mungkin hanya hingar. Gunakan selang keyakinan binomial dan hanya bertindak terhadap perubahan yang melampauinya.
from statsmodels.stats.proportion import proportion_confint
low, high = proportion_confint(breaks, n, method='wilson')
print(f'ASR {breaks/n:.3f} CI [{low:.3f}, {high:.3f}]')Padanan Positif Palsu
Keteguhan tanpa kebolehgunaan tidak bernilai. Padankan ASR dengan kadar penolakan berlebihan: bahagian permintaan tidak berbahaya yang disekat secara salah, diukur pada set bersih yang berasingan. Pengukuhan yang menyebabkan penolakan berlebihan meningkat menukar satu kegagalan dengan kegagalan yang lain.
over_refusal = sum(1 for r in benign_results if r['blocked']) / len(benign_results)
# track ASR and over_refusal together; optimize the frontierKecekapan Serangan
Ukur bukan sahaja sama ada serangan berjaya, tetapi betapa sukarnya serangan itu. Jejaki bilangan pertanyaan atau giliran sehingga berjaya menembusi: penembusan sekali cuba jauh lebih buruk daripada penembusan yang memerlukan 20 giliran yang direka khusus. Peningkatan usaha untuk menembusi merentas keluaran ialah tanda keteguhan yang bertambah baik walaupun ASR kekal.
def avg_turns_to_break(results):
succ = [r['turns_used'] for r in results if not r['safe']]
return sum(succ)/len(succ) if succ else float('inf')Tentukur Pengadil
Jika penilai LLM memberikan skor kejayaan, kualiti metrik anda hanya setinggi kualiti penilai itu. Bandingkan keputusan penilai dengan label manusia secara berkala dan laporkan kejituan serta dapatan semula penilai. Penilai yang terlalu longgar mengecilkan ASR dan mewujudkan keyakinan palsu.
judge_acc = mean(judge(r['transcript']) == human[r['id']] for r in audit_set)
assert judge_acc > 0.9, 'recalibrate judge before trusting ASR'Pelaporan Berstrata
Agregat tunggal menyembunyikan risiko. Pecahkan metrik mengikut kategori, teknik, satu giliran berbanding berbilang giliran dan langsung berbanding tidak langsung. ASR keseluruhan sebanyak 3% boleh menyembunyikan ASR sebanyak 40% bagi penyalahgunaan alat secara tidak langsung, dan itulah nombor yang patut memandu pelan hala tuju anda.
Jejaki Trend Merentas Keluaran
Keteguhan adalah relatif dan terikat pada masa. Simpan setiap pelaksanaan set ujian yang diindeks mengikut versi model dan konfigurasi, kemudian gambarkan ASR dan risiko berwajaran merentas keluaran. Matlamatnya ialah peningkatan monotonik dan sifar regresi, dipantau seperti mana-mana SLO kebolehpercayaan yang lain.
history.append({'version': cfg.model_version, 'asr': asr(results),
'weighted': weighted_risk(results), 'over_refusal': over_refusal})Tetapkan Syarat Pelepasan
Tukarkan metrik kepada dasar. Contoh syarat: ASR kritikal mestilah 0, ASR keseluruhan di bawah ambang, tiada regresi yang melebihi selang keyakinan dan penolakan berlebihan di bawah had maksimumnya. Syarat ini menjadikan keteguhan sebagai keperluan wajib pelepasan, bukan ciri tambahan.
def passes_gate(m, prev):
return (m['critical_asr'] == 0
and m['asr'] < 0.05
and m['asr'] <= prev['asr'] + ci_margin
and m['over_refusal'] < 0.02)Berwaspada terhadap Terlebih Suai pada Set Ujian
Jika anda melaraskan pertahanan secara langsung terhadap set ujian yang kelihatan, anda mungkin lulus ujian tetapi kekal terdedah kepada serangan yang tidak dilihat. Simpan set serangan persendirian untuk pengujian, tukar gilir kes dan pastikan model penyerang terus meneroka. Skor sempurna pada set ujian statik ialah tanda amaran, bukan kemenangan.
Semakan Pantas
ASR keseluruhan anda rendah, iaitu 3%, tetapi pihak berkepentingan terkejut dengan insiden penyalahgunaan alat di dunia sebenar. Amalan pengukuran manakah yang paling mungkin mendedahkan risiko itu lebih awal?
Imbas Kembali
Mengukur keteguhan:
- Kadar Kejayaan Serangan ialah metrik teras; berikan wajaran mengikut keterukan.
- Laporkan selang keyakinan dan padankan ASR dengan penolakan berlebihan.
- Jejaki kecekapan serangan (giliran atau pertanyaan sehingga berjaya menembusi) dan tentukur pengadil.
- Laporkan metrik secara berstrata, jejaki trend merentas keluaran dan kuatkuasakan syarat pelepasan.
- Simpan serangan persendirian untuk mengelakkan terlebih suai pada set ujian.
Anda telah melengkapkan penilaian serangan dan adversarial, serta laluan lanjutan PromptLab.
Pelajari Kejuruteraan Arahan AI dengan tutor kecerdasan buatan — percuma
Tulis dan jalankan kod sebenar dalam pelayar anda, dapatkan bantuan segera daripada tutor kecerdasan buatan yang tersedia 24/7, dan sambung semula dari tempat anda berhenti di web atau dalam aplikasi.
- Kursus
- 53
- Pelajaran
- 199
Soalan Lazim
Adakah pelajaran “Mengukur Keteguhan” percuma?
Ya — sebanyak 3 pelajaran dalam laluan pembelajaran Kejuruteraan Arahan AI, termasuk “Mengukur Keteguhan”, boleh dibaca sepenuhnya secara percuma di web ini. Selepas itu, CoddyKit PRO membuka akses kepada semua pelajaran, serta latihan interaktif dengan penyunting kod terbina dalam dan tutor kecerdasan buatan yang tersedia 24/7. Kursus Kejuruteraan Arahan AI merangkumi sejumlah 4 pelajaran.
Apakah yang akan saya pelajari dalam “Mengukur Keteguhan”?
Menilai ketahanan terhadap serangan. Anda berlatih Kejuruteraan Arahan AI menggunakan kod praktikal yang dijalankan terus dalam pelayar, manakala tutor kecerdasan buatan 24/7 menjawab soalan anda semasa anda mengikuti pelajaran.
Adakah saya memerlukan pengalaman untuk memulakan Kejuruteraan Arahan AI?
Tiada pengalaman terdahulu diperlukan. Pembelajaran Kejuruteraan Arahan AI di CoddyKit disusun untuk pelajar daripada peringkat pemula hingga lanjutan, jadi anda boleh bermula di sini atau dari awal dan belajar mengikut kadar anda sendiri. Ini ialah pelajaran 4 daripada 4.
Berapa lamakah pelajaran “Mengukur Keteguhan” diambil?
Kebanyakan pelajaran CoddyKit mengambil masa kira-kira 5–10 minit. Setiap pelajaran ringkas dan interaktif, jadi anda boleh membuat kemajuan secara berterusan dan menyambung tepat dari tempat anda berhenti di web atau aplikasi.
Bolehkah saya menulis dan menjalankan kod dalam pelajaran Kejuruteraan Arahan AI ini?
Ya. Setiap pelajaran Kejuruteraan Arahan AI menyertakan penyunting kod terbina dalam, jadi anda boleh menulis dan menjalankan kod sebenar terus dalam pelayar serta menerima maklum balas kecerdasan buatan serta-merta — tanpa memerlukan persediaan setempat.