60 saniyede kıyaslama (benchmark) sorusu
Asıl maliyetli soru, hangi yapay zeka modelinin en ikna edici güvenlik raporunu yazabildiği değildir.
Asıl soru, aynı araştırma bütçesi tükenmeden önce hangi yapılandırmanın en geniş gerçek ve yeniden üretilebilir zafiyet kümesini bulabildiğidir.
Bunlar tamamen farklı sorulardır. Bir model, ölü bir kod yolu (dead code path) hakkında kusursuz bir teknik açıklama yazabilir. Erişilebilir bir giriş noktasını gözden kaçırırken doğru zafiyet sınıfını adlandırabilir. Veya gerçek maliyeti bir insan incelemeciye yıkan yirmi tane akla yatkın aday üretebilir. Yalnızca ikna edici metinleri puanlayan bir liderlik tablosu (leaderboard) bu üç başarısızlık modunu da ödüllendirir.
Son çalışmalar daha faydalı bir deneye işaret ediyor. Aikido; dondurulmuş bir test ortamı, internet erişimi olmadan ve 30 turluk sınırla yakın zamanda açıklanmış 32 zafiyete karşı on modeli üçer kez test ettiğini bildirdi. Çalışmanın en önemli sonucu kazanan modelin adı değildir. Tek bir tarama ile tekrarlanan taramaların birleşimi arasındaki devasa uçurumdur: Bildirilen sonuçlardan birinde ilk turda 17 zafiyet bulan model, üç turun toplamında 28 zafiyete ulaştı. Farklı muhakeme yörüngeleri (trajectories), daha önceki turların kaçırdığı açıkları yakaladı.
Ancak bu durum uygulamadaki asıl soruyu yanıtsız bırakıyor:
Eğer üç bağımsız incelemeyi finanse edebiliyorsak, üç turda da aynı en güçlü modeli mi kullanmalıyız, yoksa kodu farklı açılardan arayacak üç farklı modelden oluşan bir takım mı kurmalıyız?
Bu makale, bu soruyu yanıtlamak için tasarlayacağım kıyaslama çalışmasının detaylarını ortaya koymaktadır. Gerçekleştirilmemiş hayali sonuçlar sunmaz. Buradaki çıktı doğrudan deney protokolüdür: Veri seti, denetimler, puanlama, kanıt standartları ve ölçümleri bir araştırma ekibi tasarımına dönüştüren karar kuralları.
Pratik yanıt: operasyonel kısıtlarınıza göre seçin
Bugün yayınlanan kanıtlara dayanarak bir yapılandırma seçmem gerekseydi, işe üç bağımsız çalıştırmayla DeepSeek V4 Flash 0731 ile başlardım. Aikido, bu üç çalıştırmanın 32 zafiyetin 24’ünü yaklaşık 108 dolar karşılığında bulduğunu belirtiyor. Bu, bu özel kıyaslama kapsamında tespit edilen vaka başına yaklaşık 4,50 dolar anlamına geliyor; bu da üç DeepSeek V4 Pro çalıştırmasının ima ettiği vaka başına yaklaşık 10,54 doların yarısından daha azdır.
Bu önerinin tek bir şartı vardır: Sürecin aday bulguları tekilleştirmesi (deduplication) ve bağımsız olarak doğrulaması gerekir. Aikido, daha ucuz ve keşif odaklı modellerin aynı zamanda daha fazla yanlış iz (gürültü) ürettiğini gözlemledi. Eğer insan triyajı kısıtlı bir kaynaksa, model token’ından yapılan tasarruf hızla eriyebilir.
| Operasyonel öncelik | Model ve çalıştırma planı | Neden seçerdim | Ödünleşim (Trade-off) |
|---|---|---|---|
| En iyi fiyat/kapsama oranı | DeepSeek V4 Flash 0731 × 3 | ~108 $ maliyetle 24/32 birleşim | Daha fazla aday gürültüsü; güçlü bir doğrulayıcı şart |
| Maksimum yayınlanan kapsama | DeepSeek V4 Pro 0813 × 3 | ~295 $ maliyetle 28/32 en yüksek birleşim | Yalnızca 10/32 vaka her turda tutarlıydı; yüksek triyaj |
| En düşük triyaj yükü (açık model) | Kimi K3 × 3 | %92,3 birleşik kesinlik, 25/32 kapsam, medyan 12 tur | DeepSeek Pro’nun toplam kapsamına ulaşamadı |
| Güçlü ilk tur (açık model) | GLM-5.3 | Açık modeller arasında en yüksek pass@1; 25/32 birleşim | Tespit edilen vaka başına yayınlanan maliyet 19,65 $ |
| En tekrarlanabilir davranış | Grok 4.6 × 3 | 21 vaka üç turda da bulundu; 26/32 birleşim | Daha ucuz takımların yaklaştığı kapsama için premium fiyat |
| En güçlü tek tur sonucu | Opus 5 × 1 | 25/32 ile en iyi bireysel tur; temiz raporlar | Tek bir premium tur yaklaşık 450–590 $ bandında |
| Temiz muhakeme raporları | Sol | 25/32 birleşim, 19 tutarlı; net girdi-etki analizleri | Premium fiyat ve DeepSeek Pro’dan daha düşük birleşim |
Bu nedenle varsayılan operasyonel rotam şu şekilde olurdu:
- DeepSeek V4 Flash 0731’i temiz oturum ve özdeş limitlerle üç kez çalıştırın.
- Adayları başlığa veya CWE etiketine göre değil, kök nedene (root cause) göre birleştirin.
- Yeniden üretimi ve düzeltilmiş sürümde negatif kontrolü zorunlu kılın.
- Yalnızca yüksek riskli veya düşük kapsama sahip bileşenleri DeepSeek V4 Pro 0813’e yükseltin.
- İncelemeci süresi darboğaz haline gelirse, model token maliyetinin tek maliyet olduğunu varsaymak yerine geniş ilk taramayı Kimi K3 ile değiştirin.
Bu öneri, Aikido’nun yayınladığı ölçümlerden çıkarılmış bir analizdir; evrensel ve değişmez bir model sıralaması değildir. Veri seti, test altyapısı (harness), prompt, sağlayıcı yönlendirmesi ve fiyatlar sıralamayı değiştirebilir. Çalışma bağımsız ve tekrarlanabilir bir kamu lider tablosu yerine üretici tarafından yürütüldüğünden, bu rakamları kalıcı bir tedarik kanıtı olarak değil, yerel bir karşılaştırma testi (bake-off) kurgulamak için kullanırdım.
Yayınlanan model sonuçları gerçekte ne söylüyor?
Kaynak makale, test edilen on modelin tamamı için tüm ham verileri açıklamamaktadır. Aşağıdaki tablo, grafikleri veya pazarlama metinlerini tahmin etmek yerine bilinmeyen hücreleri bilinmeyen olarak bırakmıştır. “Birleşik” (pooled), üç çalıştırmanın birleşimini; “tutarlı” (consistent) ise aynı vakanın üç çalıştırmanın tamamında bulunduğunu ifade eder.
| Model | İlk veya en iyi tur | Üç turun birleşimi | Üçünde de tutarlı | Kesinlik / araştırma sinyali | Yayınlanan maliyet sinyali |
|---|---|---|---|---|---|
| DeepSeek V4 Pro 0813 | 17 (ilk tur) | 28/32 | 10/32 | Medyan 24/30 tur; çok sayıda yanlış iz | Üç tur için yaklaşık 295 $ |
| DeepSeek V4 Flash 0731 | Açıklanmadı | 24/32 | Açıklanmadı | Keşif gürültüsü uyarısıyla birlikte ucuz kapsama | Üç tur için yaklaşık 108 $ |
| Qwen3.8-Max | 19 (ilk tur) | 26/32 | Açıklanmadı | 96 izin 95’inde eski yamalı CVE’leri hatırladı | Açıklanmadı |
| Kimi K3 | 17 (ilk tur) | 25/32 | Açıklanmadı | %92,3 birleşik kesinlik; medyan 12 tur | Açıklanmadı |
| Grok 4.6 | 24 (en iyi tur) | 26/32 | 21/32 | Test edilen en tekrarlanabilir model | Premium bant; tam fatura açıklanmadı |
| Opus 5 | 25 (en iyi tur) | 26/32 | 19/32 | Israrcı; daha temiz inceleme iş yükü | Premium tek tur bandı |
| Sol | Açıklanmadı | 25/32 | 19/32 | İnceleme başına ~2,74 aday; temiz muhakeme | Premium tek tur bandı |
| GLM-5.3 | En yüksek açık pass@1 | 25/32 | 18/32 | Medyan 23 tur; rekabetçi kesinlik | Kurtarılan vaka başına 19,65 $ |
En önemli satır yine de marka logoları değil, çalıştırma planıdır. DeepSeek Pro ilk turda 17 vakadan üç turun toplamında 28’e çıktı. Qwen 19’dan 26’ya, Kimi ise 17’den 25’e yükseldi. Zafiyet keşfi için yayınlanan kanıtlar, tek seferlik “en iyi model” alımından ziyade birkaç bağımsız aramayı çok daha güçlü bir şekilde desteklemektedir.
Sohbet modelini değil, araştırma ekibini kıyaslayın
Yapay zeka tabanlı bir zafiyet araştırmacısı sadece bir modelden ibaret değildir. Kod gezgini, arama aracı, derleme araçları, hata ayıklayıcı (debugger), bütçe, prompt ve doğrulayıcı içeren bir test altyapısı (harness) içindeki bir modeldir. Google Project Zero’nun Naptime çalışması bu etkinin büyüklüğünü kanıtladı: Özel ve etkileşimli bir araç ortamı, CyberSecEval 2 görevlerinde zero-shot bir modele kıyasla performansı çarpıcı biçimde artırdı. Project Zero ayrıca gerekli uyarıyı da yaptı: Bu sistemlerin günlük zafiyet araştırmalarında anlamlı bir etki yaratabilmesi için hala önemli ilerlemelere ihtiyaç vardı.
Bu durum, adil bir karşılaştırmanın her seferinde yalnızca tek bir değişkeni değiştirmesi gerektiği anlamına gelir. İlk deney model çeşitliliğini ölçer. İkinci ve isteğe bağlı deney ise rol uzmanlaşmasını ölçer.
Track A — Tek model, üç bağımsız tarama
En güçlü aday modeli üç kez çalıştırın. Her çalıştırma boş bir bellekle, aynı sistem prompt’uyla, aynı depo anlık görüntüsüyle ve aynı araç izinleriyle başlar. İkinci çalıştırmanın birinci çalıştırmanın hipotezlerini görmesine izin vermeyin. Bu, tek bir model ailesi içindeki stokastik keşfin değerini ölçer.
Track B — Üç model, birer tarama
Güçlü kod gezintisi ve araç kullanım yeteneğine sahip üç farklı model ailesi seçin. Her birine Track A’da kullanılan araştırmacı rolünün aynısını verin. Test altyapısını, depoyu, maksimum tur sayısını, araç çıktılarını ve durma koşullarını sabit tutun. Bu, model çeşitliliğinin aynı modelin tekrarlanmasının sağlayamadığı bulguları sağlayıp sağlamadığını izole eder.
Rol uzmanlaşması (örneğin girişten kritik noktaya iz sürme için bir ajan, yama kılavuzlu varyant analizi için bir ajan ve yeniden üretim için bir ajan) ancak bu karşılaştırmadan sonra üçüncü bir hatta dahil edilmelidir. Rol uzmanlaşmasını en baştan Track B’ye dahil etmek başlığı çekici kılsa da bilimsel sonucu zayıflatır.
Veri seti ezberlemeye değil, tanımaya karşı dirençli olmalıdır
“Yakın zamanda açıklanmış” olmak faydalı bir filtredir ancak modelin ilgili kodu, güvenlik bildirisini, pull request’i veya özel değerlendirme verilerini daha önce hiç görmediğinin kanıtı değildir. Eski bir CVE’yi tanıyan bir model yine de faydalı bir varyant analizi gerçekleştirebilir; ancak bu, kaynak koddan sıfırdan zafiyet keşfetmekten çok farklı bir yetenektir.
Yamalanmış açık kaynaklı depolardan 36 vaka oluşturur ve model karşılaştırması başlamadan önce bunları sabitlerdim. Her vaka hem zafiyetli hem de düzeltilmiş bir anlık görüntü içerir ancak ajan yalnızca zafiyetli olanı görür. Değerlendirici; yamayı, bildiriyi, tetikleyiciyi (trigger) ve beklenen yolu gizli tutar.
Altı dengeli katman (strata) kullanın:
| Katman | Vaka | Ajanı ne yapmaya zorlar |
|---|---|---|
| Bellek güvenliği (Memory safety) | 6 | Fonksiyonlar arası boyutları, ömürleri (lifetimes) ve durumları takip etme |
| Enjeksiyon ve ayrıştırma | 6 | Saldırgan kontrollü baytların yorumlayıcıya veya ayrıştırıcıya nasıl ulaştığını yeniden kurgulama |
| Kimlik doğrulama ve yetkilendirme | 6 | Geçerli kimlik verisi ile bir eylemi gerçekleştirme iznini birbirinden ayırma |
| Yol ve arşiv işleme | 6 | Kanonikleştirme, arşiv çıkarma kökleri ve dosya sistemi etkilerini analiz etme |
| Modüller arası iş mantığı | 6 | Rotalar, servisler ve veritabanı katmanları arasına dağılmış kararları birleştirme |
| Yama varyantları (Patch-sibling variants) | 6 | Bilinen bir düzeltme modelinden yola çıkarak güvenli bir anlık görüntüde düzeltilmemiş eşdeğeri bulma |
Proje düzeyindeki kapsam kritiktir. CyberSecEval 2, ezberlemeyi azaltan ve otomatik puanlamayı mümkün kılan sentetik istismar görevleri sunar. SEC-bench, gerçek zafiyetleri konteynerize edilmiş, tekrarlanabilir ortamlarda paketler. CVE-Bench, sandbox ortamlarında gerçek web uygulaması CVE’lerinin istismarına odaklanır. VulnGym, proje düzeyinde kod ve erişilebilir giriş noktasından kritik operasyona kadar insan tarafından incelenmiş anlamsal yollar ekler. Bunlar birlikte, “zafiyetli” olarak işaretlenmiş tek bir fonksiyonun bu deney için neden çok küçük bir birim olduğunu gösterir: Gerçek keşif, yolu bulmayı da kapsar.
İki kirlenme (contamination) kontrolü ekleyin
İlk olarak, tuzak vakalar (decoy cases) ekleyin: Ünlü bir geçmiş açığın zaten düzeltilmiş olduğu aynı projelere ait depolar. Eski CVE’yi ezberden bildiren bir model puan kazanmamalı, tam aksine kesinlik (precision) cezası almalıdır. Aikido, bir modelin araştırma süresini tekrar tekrar eski ve yamalanmış sorunlara harcadığını gözlemledi; bir kıyaslama bu davranışı açıkça ölçmelidir.
İkinci olarak, özel ve canlı ortamda olmayan bir fork üzerinde kardeş varyantlar (sibling variants) oluşturun. Orijinal güvenlik hatasını koruyun ancak adları, düzeni ve önemsiz sözdizimini değiştirin. Varyant incelenmiş ve tetiklenebilir olmalı ancak asla genel projeye karşı bir iddia olarak dağıtılmamalı veya sunulmamalıdır. Bu, bilinmeyen genel yazılımları bir değerlendirme hedefine dönüştürmeden muhakeme aktarımını test eder.
Test ortamını dondurun ya da test ortamını test ettiğinizi kabul edin
Her çalıştırma aynı yetenekleri alır:
case:
repository: isolated-vulnerable-snapshot
internet: false
advisory_visible: false
fixed_version_visible: false
researcher:
fresh_session: true
max_turns: 30
max_wall_minutes: 45
tools: [read, search, build, test, debugger]
write_scope: sandbox-only
output:
required: [entry_point, root_cause, reachable_path, impact, reproduction]
candidates_without_reproduction: triage_only
Tam sayılar bunları kaydetmekten daha az önemlidir. Model API’leri bağlam önbelleğe alma, muhakeme kontrolleri, araç şemaları ve fiyat açısından farklılık gösterir. Bu nedenle iki puan tablosu yayınlayın:
- Eşit iş puan tablosu (Equal-work) — Aynı tur, süre ve araç sınırları. Bu, aynı operasyonel çerçevede hangi ekibin daha fazla araştırma yaptığını ölçer.
- Eşit harcama puan tablosu (Equal-spend) — Önbelleğe alınmış token’lar ve araç çağrıları dahil aynı maksimum sağlayıcı maliyeti. Bu, bir güvenlik ekibinin sabit bir bütçeyle ne satın alabileceğini ölçer.
Bir modelin bağlamını sessizce artırmayın, bir diğerine daha iyi bir kod dizini sağlamayın veya yalnızca kazanmasını beklediğiniz modeli yeniden denemeyin. Bir model dondurulmuş araç arayüzünü güvenilir bir şekilde çalıştıramıyorsa, bu operasyonel bir sonuçtur. Project Naptime, çok adımlı araç kullanımı güvenilir kılınamayan modelleri hariç tuttu; aynı sınırlama bir prompt hatası olarak gizlenmek yerine burada açıkça görünmelidir.
Bir bulgu dört kapıdan geçmelidir
“Bulundu” kavramının kesin bir tanımı yapılmadığı sürece anma oranı (recall) anlamsızdır. Kıyaslama, bir raporun kulağa doğru gelip gelmediğini başka bir modele sorup buna zemin gerçeği (ground truth) diyemez.
Düzeltilmiş sürüm testi belirleyicidir. Aynı tetikleyici bilinen düzeltmeden sonra da sorunu “kanıtlamaya” devam ediyorsa, oracle zafiyeti değil; bir çökmeyi, hata mesajını veya genel bir davranışı ölçüyor demektir. İş mantığı vakalarında eşdeğer durum bir durum geçişidir: Yetkisiz eylem zafiyetli anlık görüntüde gerçekleşir ve yetkili kontrol başarılı olmaya devam ederken düzeltilmiş anlık görüntüde reddedilir.
Kör iki kişilik inceleme semantik eşleşmeleri çözmelidir. İncelemeciler raporu ve kanıtları görür ancak modeli veya hattı görmez. Anlaşmazlıklar, tetikleyici veya zemin gerçeği iyileştirilene kadar çözümsüz kalır. Bir LLM yargıcı kopyaları kümeleyebilir veya adayları yönlendirmeye yardımcı olabilir; değerlendirilen çıktının aynısı üzerinde nihai otorite olamaz.
Puan tablosu anma oranından (recall) fazlasına ihtiyaç duyar
Her hat için şu ölçümleri birlikte raporlayın:
| Metrik | Hesaplama | Neden önemlidir |
|---|---|---|
| Doğrulanmış birleşim anma oranı (Recall) | herhangi bir çalıştırmada bulunan benzersiz vakalar / tüm vakalar | Ekip tarafından satın alınan toplam kapsamı ölçer |
| Kesinlik (Precision) | kabul edilen adaylar / sunulan tüm adaylar | Agresif keşfin arkasında gizlenen insan maliyetini ortaya çıkarır |
| Tutarlılık (Consistency) | üç çalıştırmada da bulunan vakalar / herhangi birinde bulunan vakalar | Güvenilir davranışı şans eseri keşiften ayırır |
| Benzersiz katkı | yalnızca tek bir model veya çalıştırma tarafından üretilen bulgular | Çeşitliliğin gerçekten yeni kapsama alanı ekleyip eklemediğini gösterir |
| İkili örtüşme (Pairwise overlap) | her çift için kesişim / birleşim | Tek model ile tamamlayıcı aramayı görünür kılar |
| Doğrulanmış bulgu başına maliyet | model, işlem ve araç maliyeti / kabul edilen bulgular | Yeteneği bir işletme bütçesine bağlar |
| Bulgu başına triyaj dakikası | incelemeci süresi / kabul edilen bulgular | Ucuz token’ların pahalı gürültüyü gizlemesini engeller |
| Kanıt eksiksizliği | insan müdahalesi olmadan dört kapıyı da geçen bulgular | Çıktının sadece fikir verici değil, kullanılabilir olup olmadığını ölçer |
| İlk doğrulanmış bulguya kadar geçen süre | geçen çalışma ve inceleme süresi | İş akışı bir olaya veya sürüme bağlı olduğunda önemlidir |
Bunları tek bir sihirli puana indirgemeyin. Yüksek anma oranına sahip bir ekip üç aylık bir kaynak kodu denetimi için doğru, bir pull-request kapısı için yanlış olabilir. Temiz kanıtlara sahip tutarlı bir model hızlı hatta yer alabilirken, keşif modelleri yüksek riskli bileşenlere karşı asenkron olarak çalıştırılabilir.
En açıklayıcı görsel bir çubuk grafik değil, bir örtüşme haritasıdır. Track B aynı 22 vakayı üç kez bulursa, model çeşitliliği çok az şey katmış demektir. 27 vaka bulur ancak on biri yalnızca tek bir modelden gelirse, o model mutlaka “en iyi” değildir; belirli bir kod veya hata sınıfı için bir uzman olabilir. Canlıdaki ekibi değiştirmeden önce benzersiz katkıyı katmanlara göre ayrıştırın.
Sonuçları bir yönlendirme politikasına dönüştürün
Üç sonuç mümkündür:
- Track A kapsam ve maliyette kazanır. Tek bir modelin tekrarlanan taramalarını kullanın ancak oturumları bağımsız tutun. Bu model içindeki çeşitlilik bu veri seti için yeterlidir.
- Track B benzersiz katkılarla kazanır. Kodu her modelin doğrulanmış bulgular eklediği kategorilere göre yönlendirin. Her depoyu sonsuza kadar her modele göndermeyin.
- Kapsam benzerdir ancak kesinlik farklıdır. Temiz modeli senkron iş akışına yerleştirin ve gürültülü keşif modellerini daha güçlü yeniden üretim ve triyaj kapılarının arkasında çevrimdışı çalıştırın.
Bu nedenle uzman ekip bir varsayım değil, bir sonuçtur. Bir model ancak diğerlerinin kaçırdığı doğrulanmış yetkilendirme bulgularına tekrar tekrar katkıda bulunursa “yetkilendirme uzmanı” olur. Pazarlama açıklamaları, model boyutu ve tek bir başarı hikayesi bu rolü tayin edemez.
Bu kıyaslamanın hala kanıtlayamayacağı hususlar
Otuz altı bilinen vaka, kazanan yapılandırmanın yeni bir üründeki bilinmeyen zafiyetleri keşfedeceğini kanıtlamaz. Geçmiş CVE’ler zemin gerçeği sağlar ancak aynı zamanda halka açık kodlarda ve açıklamalarda temsil edilen modelleri de ödüllendirir. Özel kardeş varyantlar bu sorunu azaltır; tamamen ortadan kaldırmaz.
Test ayrıca bir kuruluşun canlı üretim ortamında otonom ajanları güvenle çalıştırıp çalıştıramayacağını da ölçmez. Buradaki tüm yürütme izole edilmiş zafiyetli anlık görüntüler içinde kalır. Depo erişimi, veri saklama, model sağlayıcı şartları, gizli anahtar yönetimi ve güvenlik açığı bildirim süreçleri ayrı güvenlik kararları olmaya devam eder.
Son olarak, bir kıyaslama sonucu eskir. Modeller, sağlayıcı yönlendirmeleri, fiyatlar, bağlam pencereleri ve test ortamları değişir. Model tanımlayıcısını ve yapılandırmasını sabitleyin, ham yörüngeleri saklayın, veri setini hash’leyin ve sonucu tarihleyin. Bu girdilerden herhangi biri değiştiğinde testi yeniden çalıştırın. Anlık görüntü ve altyapı sürümü belirtilmeyen bir model adı, tekrarlanabilir bir ölçüm değildir.
Kanıt matrisi (Evidence matrix)
| İddia | Gerekli kanıt | Negatif kontrol | Yetersiz olan durum |
|---|---|---|---|
| Bir hat bir zafiyet buldu | Doğru kök neden, erişilebilir yol, deterministik trigger, hakem uzlaşması | Yetkili bir kontrol başarılı olurken aynı tetikleyici düzeltilmiş anlık görüntüde başarısız olur | Bir CWE etiketi, şüpheli bir satır veya ikna edici bir rapor |
| Tekrarlama kapsamı artırır | Aynı model ve test ortamı, temiz oturumlar, çalıştırmalar arasında ek benzersiz doğrulanmış vakalar | Anma oranı hesaplanmadan önce mükerrer raporlar birleştirilir | Bir hatanın üç tanımını üç bulgu olarak saymak |
| Model çeşitliliği değer katar | Özdeş talimatlar altında farklı model ailelerine atfedilebilen benzersiz doğrulanmış bulgular | Track A’yı aynı sayıda bağımsız yörünge ile tekrarlayın | Bir çalıştırma ile üç çalıştırmayı karşılaştırmak |
| Bir model faydalı bir uzmandır | Tanımlanmış bir zafiyet katmanında tekrarlanabilir benzersiz katkı | Görünmeyen bir test katmanında aynı rolü değerlendirin | Tek bir istisnai başarı hikayesi |
| Bir hat daha ucuzdur | Çalıştırma başına kaydedilen sağlayıcı, bilgi işlem, araç ve incelemeci maliyetleri | Eşit iş ve eşit harcama görünümlerini yayınlayın | Yalnızca token fiyatı |
| Veri seti ezberlemeyi sınırlar | Zamansal ayrım, yamalanmış tuzaklar, gizli yamalar ve özel incelenmiş kardeş varyantlar | Bilinen düzeltilmiş CVE’ler puan almamalıdır | Bir CVE’ye yalnızca “yeni” demek |
| Bir rapor canlı ortamda kullanılabilir | İncelemeci onarımı olmadan eksiksiz dört kapılı kanıt paketi | İncelemeci kanıt paketini bağımsız olarak yeniden oynatabilir | Model güveni veya bir LLM-yargıç puanı |
Sonuç
Bir liderlik tablosuna bakarak tek bir modeli veya üç modeli doğrudan işe almazdım. Ölçülmüş bir araştırma hattını işe alırdım.
Net bir karşılaştırma ile başlayın: A + A + A ile A + B + C; özdeş test ortamı, özdeş vakalar, özdeş limitler. Yalnızca kök neden incelemesinden, yeniden üretimden ve düzeltilmiş sürüm testinden geçen bulguları sayın. Birleşik kapsamı; kesinlik, örtüşme, triyaj süresi ve maliyetle birlikte yayınlayın. Ardından modelleri uzman rollere yalnızca test verilerinin tekrarlanabilir bir katkı gösterdiği alanlarda terfi ettirin.
Zafiyet araştırmalarında yapay zekanın asıl avantajı, tek bir modelin kusursuz bir denetçiye dönüşmesi değildir. Birkaç sınırlandırılmış incelemenin farklı hipotezleri ucuza keşfedebilmesi ve deterministik bir kanıt katmanının yalnızca kanıtlanabilenleri tutmasıdır. Keşif olasılıksal olabilir; ancak bir zafiyetin tanımı asla olasılıksal olamaz.
İncelenen kaynaklar
- Aikido: We burned 11.7bn tokens to find the best cyber AI model
- Google Project Zero: Project Naptime
- Google Project Zero: From Naptime to Big Sleep
- CyberSecEval 2 paper and open evaluation design
- SEC-bench: reproducible real-world software security tasks
- CVE-Bench: sandboxed real-world web vulnerability exploitation
- VulnGym: project-level vulnerability hunting with semantic evidence paths
Bu teknik not ne kadar güncel?
En son kaynak incelemesi, içerik güncellemesi veya yayın tarihi gösterilmektedir.
Yazar teknik incelemeyi tamamladı. Bu etiket tek başına laboratuvar yeniden üretimi iddiası taşımaz.
