60 saniyede kıyaslama (benchmark) sorusu

Asıl maliyetli soru, hangi yapay zeka modelinin en ikna edici güvenlik raporunu yazabildiği değildir.

Asıl soru, aynı araştırma bütçesi tükenmeden önce hangi yapılandırmanın en geniş gerçek ve yeniden üretilebilir zafiyet kümesini bulabildiğidir.

Bunlar tamamen farklı sorulardır. Bir model, ölü bir kod yolu (dead code path) hakkında kusursuz bir teknik açıklama yazabilir. Erişilebilir bir giriş noktasını gözden kaçırırken doğru zafiyet sınıfını adlandırabilir. Veya gerçek maliyeti bir insan incelemeciye yıkan yirmi tane akla yatkın aday üretebilir. Yalnızca ikna edici metinleri puanlayan bir liderlik tablosu (leaderboard) bu üç başarısızlık modunu da ödüllendirir.

Son çalışmalar daha faydalı bir deneye işaret ediyor. Aikido; dondurulmuş bir test ortamı, internet erişimi olmadan ve 30 turluk sınırla yakın zamanda açıklanmış 32 zafiyete karşı on modeli üçer kez test ettiğini bildirdi. Çalışmanın en önemli sonucu kazanan modelin adı değildir. Tek bir tarama ile tekrarlanan taramaların birleşimi arasındaki devasa uçurumdur: Bildirilen sonuçlardan birinde ilk turda 17 zafiyet bulan model, üç turun toplamında 28 zafiyete ulaştı. Farklı muhakeme yörüngeleri (trajectories), daha önceki turların kaçırdığı açıkları yakaladı.

Ancak bu durum uygulamadaki asıl soruyu yanıtsız bırakıyor:

Eğer üç bağımsız incelemeyi finanse edebiliyorsak, üç turda da aynı en güçlü modeli mi kullanmalıyız, yoksa kodu farklı açılardan arayacak üç farklı modelden oluşan bir takım mı kurmalıyız?

Bu makale, bu soruyu yanıtlamak için tasarlayacağım kıyaslama çalışmasının detaylarını ortaya koymaktadır. Gerçekleştirilmemiş hayali sonuçlar sunmaz. Buradaki çıktı doğrudan deney protokolüdür: Veri seti, denetimler, puanlama, kanıt standartları ve ölçümleri bir araştırma ekibi tasarımına dönüştüren karar kuralları.

Pratik yanıt: operasyonel kısıtlarınıza göre seçin

Bugün yayınlanan kanıtlara dayanarak bir yapılandırma seçmem gerekseydi, işe üç bağımsız çalıştırmayla DeepSeek V4 Flash 0731 ile başlardım. Aikido, bu üç çalıştırmanın 32 zafiyetin 24’ünü yaklaşık 108 dolar karşılığında bulduğunu belirtiyor. Bu, bu özel kıyaslama kapsamında tespit edilen vaka başına yaklaşık 4,50 dolar anlamına geliyor; bu da üç DeepSeek V4 Pro çalıştırmasının ima ettiği vaka başına yaklaşık 10,54 doların yarısından daha azdır.

Bu önerinin tek bir şartı vardır: Sürecin aday bulguları tekilleştirmesi (deduplication) ve bağımsız olarak doğrulaması gerekir. Aikido, daha ucuz ve keşif odaklı modellerin aynı zamanda daha fazla yanlış iz (gürültü) ürettiğini gözlemledi. Eğer insan triyajı kısıtlı bir kaynaksa, model token’ından yapılan tasarruf hızla eriyebilir.

Operasyonel öncelikModel ve çalıştırma planıNeden seçerdimÖdünleşim (Trade-off)
En iyi fiyat/kapsama oranıDeepSeek V4 Flash 0731 × 3~108 $ maliyetle 24/32 birleşimDaha fazla aday gürültüsü; güçlü bir doğrulayıcı şart
Maksimum yayınlanan kapsamaDeepSeek V4 Pro 0813 × 3~295 $ maliyetle 28/32 en yüksek birleşimYalnızca 10/32 vaka her turda tutarlıydı; yüksek triyaj
En düşük triyaj yükü (açık model)Kimi K3 × 3%92,3 birleşik kesinlik, 25/32 kapsam, medyan 12 turDeepSeek Pro’nun toplam kapsamına ulaşamadı
Güçlü ilk tur (açık model)GLM-5.3Açık modeller arasında en yüksek pass@1; 25/32 birleşimTespit edilen vaka başına yayınlanan maliyet 19,65 $
En tekrarlanabilir davranışGrok 4.6 × 321 vaka üç turda da bulundu; 26/32 birleşimDaha ucuz takımların yaklaştığı kapsama için premium fiyat
En güçlü tek tur sonucuOpus 5 × 125/32 ile en iyi bireysel tur; temiz raporlarTek bir premium tur yaklaşık 450–590 $ bandında
Temiz muhakeme raporlarıSol25/32 birleşim, 19 tutarlı; net girdi-etki analizleriPremium fiyat ve DeepSeek Pro’dan daha düşük birleşim

Bu nedenle varsayılan operasyonel rotam şu şekilde olurdu:

  1. DeepSeek V4 Flash 0731’i temiz oturum ve özdeş limitlerle üç kez çalıştırın.
  2. Adayları başlığa veya CWE etiketine göre değil, kök nedene (root cause) göre birleştirin.
  3. Yeniden üretimi ve düzeltilmiş sürümde negatif kontrolü zorunlu kılın.
  4. Yalnızca yüksek riskli veya düşük kapsama sahip bileşenleri DeepSeek V4 Pro 0813’e yükseltin.
  5. İncelemeci süresi darboğaz haline gelirse, model token maliyetinin tek maliyet olduğunu varsaymak yerine geniş ilk taramayı Kimi K3 ile değiştirin.

Bu öneri, Aikido’nun yayınladığı ölçümlerden çıkarılmış bir analizdir; evrensel ve değişmez bir model sıralaması değildir. Veri seti, test altyapısı (harness), prompt, sağlayıcı yönlendirmesi ve fiyatlar sıralamayı değiştirebilir. Çalışma bağımsız ve tekrarlanabilir bir kamu lider tablosu yerine üretici tarafından yürütüldüğünden, bu rakamları kalıcı bir tedarik kanıtı olarak değil, yerel bir karşılaştırma testi (bake-off) kurgulamak için kullanırdım.

Yayınlanan model sonuçları gerçekte ne söylüyor?

Kaynak makale, test edilen on modelin tamamı için tüm ham verileri açıklamamaktadır. Aşağıdaki tablo, grafikleri veya pazarlama metinlerini tahmin etmek yerine bilinmeyen hücreleri bilinmeyen olarak bırakmıştır. “Birleşik” (pooled), üç çalıştırmanın birleşimini; “tutarlı” (consistent) ise aynı vakanın üç çalıştırmanın tamamında bulunduğunu ifade eder.

Modelİlk veya en iyi turÜç turun birleşimiÜçünde de tutarlıKesinlik / araştırma sinyaliYayınlanan maliyet sinyali
DeepSeek V4 Pro 081317 (ilk tur)28/3210/32Medyan 24/30 tur; çok sayıda yanlış izÜç tur için yaklaşık 295 $
DeepSeek V4 Flash 0731Açıklanmadı24/32AçıklanmadıKeşif gürültüsü uyarısıyla birlikte ucuz kapsamaÜç tur için yaklaşık 108 $
Qwen3.8-Max19 (ilk tur)26/32Açıklanmadı96 izin 95’inde eski yamalı CVE’leri hatırladıAçıklanmadı
Kimi K317 (ilk tur)25/32Açıklanmadı%92,3 birleşik kesinlik; medyan 12 turAçıklanmadı
Grok 4.624 (en iyi tur)26/3221/32Test edilen en tekrarlanabilir modelPremium bant; tam fatura açıklanmadı
Opus 525 (en iyi tur)26/3219/32Israrcı; daha temiz inceleme iş yüküPremium tek tur bandı
SolAçıklanmadı25/3219/32İnceleme başına ~2,74 aday; temiz muhakemePremium tek tur bandı
GLM-5.3En yüksek açık pass@125/3218/32Medyan 23 tur; rekabetçi kesinlikKurtarılan vaka başına 19,65 $

En önemli satır yine de marka logoları değil, çalıştırma planıdır. DeepSeek Pro ilk turda 17 vakadan üç turun toplamında 28’e çıktı. Qwen 19’dan 26’ya, Kimi ise 17’den 25’e yükseldi. Zafiyet keşfi için yayınlanan kanıtlar, tek seferlik “en iyi model” alımından ziyade birkaç bağımsız aramayı çok daha güçlü bir şekilde desteklemektedir.

Sohbet modelini değil, araştırma ekibini kıyaslayın

Yapay zeka tabanlı bir zafiyet araştırmacısı sadece bir modelden ibaret değildir. Kod gezgini, arama aracı, derleme araçları, hata ayıklayıcı (debugger), bütçe, prompt ve doğrulayıcı içeren bir test altyapısı (harness) içindeki bir modeldir. Google Project Zero’nun Naptime çalışması bu etkinin büyüklüğünü kanıtladı: Özel ve etkileşimli bir araç ortamı, CyberSecEval 2 görevlerinde zero-shot bir modele kıyasla performansı çarpıcı biçimde artırdı. Project Zero ayrıca gerekli uyarıyı da yaptı: Bu sistemlerin günlük zafiyet araştırmalarında anlamlı bir etki yaratabilmesi için hala önemli ilerlemelere ihtiyaç vardı.

Bu durum, adil bir karşılaştırmanın her seferinde yalnızca tek bir değişkeni değiştirmesi gerektiği anlamına gelir. İlk deney model çeşitliliğini ölçer. İkinci ve isteğe bağlı deney ise rol uzmanlaşmasını ölçer.

KONTROLLÜ DENEY SORUSUAYNI SENARYOLAR · AYNI HARNESS · AYNI TOPLAM BÜTÇE Sabitlenmiş girdiyamalanmış OSS anlık görüntüleri · gizli ground truth · internet yok · temiz oturum TRACK A · TEK MODEL (MONOCULTURE)tek güçlü model · üç bağımsız yörünge A · 1. turaynı rol A · 2. turtemiz durum A · 3. turtemiz durum TRACK B · ÇEŞİTLİ MODEL TAKIMIüç farklı model ailesi · birebir aynı araştırmacı rolü A · 1. turmodel A B · 1. turmodel B C · 1. turmodel C BAĞIMSIZ KANIT KAPISIerişilebilir yol + tetikleyici + kök neden + sabitlenmiş sürümde başarısızlık DOĞRULANMIŞ BİRLEŞİM · ÖRTÜŞME · MALİYET · TRİYAJ KARŞILAŞTIRMASI
İlk test model çeşitliliğini izole eder: Track B henüz uzman prompt'ları almaz. Aksi takdirde daha iyi bir sonuç model davranışından değil, farklı talimatlardan kaynaklanabilir.

Track A — Tek model, üç bağımsız tarama

En güçlü aday modeli üç kez çalıştırın. Her çalıştırma boş bir bellekle, aynı sistem prompt’uyla, aynı depo anlık görüntüsüyle ve aynı araç izinleriyle başlar. İkinci çalıştırmanın birinci çalıştırmanın hipotezlerini görmesine izin vermeyin. Bu, tek bir model ailesi içindeki stokastik keşfin değerini ölçer.

Track B — Üç model, birer tarama

Güçlü kod gezintisi ve araç kullanım yeteneğine sahip üç farklı model ailesi seçin. Her birine Track A’da kullanılan araştırmacı rolünün aynısını verin. Test altyapısını, depoyu, maksimum tur sayısını, araç çıktılarını ve durma koşullarını sabit tutun. Bu, model çeşitliliğinin aynı modelin tekrarlanmasının sağlayamadığı bulguları sağlayıp sağlamadığını izole eder.

Rol uzmanlaşması (örneğin girişten kritik noktaya iz sürme için bir ajan, yama kılavuzlu varyant analizi için bir ajan ve yeniden üretim için bir ajan) ancak bu karşılaştırmadan sonra üçüncü bir hatta dahil edilmelidir. Rol uzmanlaşmasını en baştan Track B’ye dahil etmek başlığı çekici kılsa da bilimsel sonucu zayıflatır.

Veri seti ezberlemeye değil, tanımaya karşı dirençli olmalıdır

“Yakın zamanda açıklanmış” olmak faydalı bir filtredir ancak modelin ilgili kodu, güvenlik bildirisini, pull request’i veya özel değerlendirme verilerini daha önce hiç görmediğinin kanıtı değildir. Eski bir CVE’yi tanıyan bir model yine de faydalı bir varyant analizi gerçekleştirebilir; ancak bu, kaynak koddan sıfırdan zafiyet keşfetmekten çok farklı bir yetenektir.

Yamalanmış açık kaynaklı depolardan 36 vaka oluşturur ve model karşılaştırması başlamadan önce bunları sabitlerdim. Her vaka hem zafiyetli hem de düzeltilmiş bir anlık görüntü içerir ancak ajan yalnızca zafiyetli olanı görür. Değerlendirici; yamayı, bildiriyi, tetikleyiciyi (trigger) ve beklenen yolu gizli tutar.

Altı dengeli katman (strata) kullanın:

KatmanVakaAjanı ne yapmaya zorlar
Bellek güvenliği (Memory safety)6Fonksiyonlar arası boyutları, ömürleri (lifetimes) ve durumları takip etme
Enjeksiyon ve ayrıştırma6Saldırgan kontrollü baytların yorumlayıcıya veya ayrıştırıcıya nasıl ulaştığını yeniden kurgulama
Kimlik doğrulama ve yetkilendirme6Geçerli kimlik verisi ile bir eylemi gerçekleştirme iznini birbirinden ayırma
Yol ve arşiv işleme6Kanonikleştirme, arşiv çıkarma kökleri ve dosya sistemi etkilerini analiz etme
Modüller arası iş mantığı6Rotalar, servisler ve veritabanı katmanları arasına dağılmış kararları birleştirme
Yama varyantları (Patch-sibling variants)6Bilinen bir düzeltme modelinden yola çıkarak güvenli bir anlık görüntüde düzeltilmemiş eşdeğeri bulma

Proje düzeyindeki kapsam kritiktir. CyberSecEval 2, ezberlemeyi azaltan ve otomatik puanlamayı mümkün kılan sentetik istismar görevleri sunar. SEC-bench, gerçek zafiyetleri konteynerize edilmiş, tekrarlanabilir ortamlarda paketler. CVE-Bench, sandbox ortamlarında gerçek web uygulaması CVE’lerinin istismarına odaklanır. VulnGym, proje düzeyinde kod ve erişilebilir giriş noktasından kritik operasyona kadar insan tarafından incelenmiş anlamsal yollar ekler. Bunlar birlikte, “zafiyetli” olarak işaretlenmiş tek bir fonksiyonun bu deney için neden çok küçük bir birim olduğunu gösterir: Gerçek keşif, yolu bulmayı da kapsar.

BİR TEST VAKASININ ANATOMİSİAJANIN GÖRDÜĞÜ İLE CEVABI KANITLAYANI BİRBİRİNDEN AYIRIN AJANA GÖRÜNÜR OLANLAR Zafiyetli anlık görüntütam depo · kesin commitbağımlılıklar sabit · ağ kapalıGÜVENLİK BİLDİRİMİ VEYA YAMA YOK Sınırlandırılmış araştırma araçlarıarama · derleme · test · debuggertur · süre · çıktı üst sınırlarıHER EYLEM KAYDEDİLİR Tarafsız görev tanımıverilen kaynak kodundaki güvenlikkusurlarını bul ve somutlaştırCWE VEYA DOSYA İPUCU YOK ADAY BULGU RAPORU + İZLEME (TRACE)iddia edilen girdi · kod yolu · eksik kontrol · etki · yeniden üretim AJANDAN GİZLENENLER Bilinen tetikleyicideterministik oracleYENİDEN ÜRETİR Düzeltilmiş anlık görüntüaynı test · tek yamaBAŞARISIZ OLMALI Semantik yolgirdi → kritik operasyonKÖK NEDEN EŞLEŞMESİ Kör incelemecilermodel kimliği gizliHÜKÜM VERİR YALNIZCA DÖRT ORACLE DA UZLAŞTIĞINDA KABUL ET
Zafiyetli depo asıl görevdir; düzeltilmiş anlık görüntü, tetikleyici, semantik yol ve hakem kararı ise puanlama sistemidir. Bunları ayrı tutmak etiket ezberlemeyi ve kendi kendini puanlamayı engeller.

İki kirlenme (contamination) kontrolü ekleyin

İlk olarak, tuzak vakalar (decoy cases) ekleyin: Ünlü bir geçmiş açığın zaten düzeltilmiş olduğu aynı projelere ait depolar. Eski CVE’yi ezberden bildiren bir model puan kazanmamalı, tam aksine kesinlik (precision) cezası almalıdır. Aikido, bir modelin araştırma süresini tekrar tekrar eski ve yamalanmış sorunlara harcadığını gözlemledi; bir kıyaslama bu davranışı açıkça ölçmelidir.

İkinci olarak, özel ve canlı ortamda olmayan bir fork üzerinde kardeş varyantlar (sibling variants) oluşturun. Orijinal güvenlik hatasını koruyun ancak adları, düzeni ve önemsiz sözdizimini değiştirin. Varyant incelenmiş ve tetiklenebilir olmalı ancak asla genel projeye karşı bir iddia olarak dağıtılmamalı veya sunulmamalıdır. Bu, bilinmeyen genel yazılımları bir değerlendirme hedefine dönüştürmeden muhakeme aktarımını test eder.

Test ortamını dondurun ya da test ortamını test ettiğinizi kabul edin

Her çalıştırma aynı yetenekleri alır:

case:
  repository: isolated-vulnerable-snapshot
  internet: false
  advisory_visible: false
  fixed_version_visible: false

researcher:
  fresh_session: true
  max_turns: 30
  max_wall_minutes: 45
  tools: [read, search, build, test, debugger]
  write_scope: sandbox-only

output:
  required: [entry_point, root_cause, reachable_path, impact, reproduction]
  candidates_without_reproduction: triage_only

Tam sayılar bunları kaydetmekten daha az önemlidir. Model API’leri bağlam önbelleğe alma, muhakeme kontrolleri, araç şemaları ve fiyat açısından farklılık gösterir. Bu nedenle iki puan tablosu yayınlayın:

  1. Eşit iş puan tablosu (Equal-work) — Aynı tur, süre ve araç sınırları. Bu, aynı operasyonel çerçevede hangi ekibin daha fazla araştırma yaptığını ölçer.
  2. Eşit harcama puan tablosu (Equal-spend) — Önbelleğe alınmış token’lar ve araç çağrıları dahil aynı maksimum sağlayıcı maliyeti. Bu, bir güvenlik ekibinin sabit bir bütçeyle ne satın alabileceğini ölçer.

Bir modelin bağlamını sessizce artırmayın, bir diğerine daha iyi bir kod dizini sağlamayın veya yalnızca kazanmasını beklediğiniz modeli yeniden denemeyin. Bir model dondurulmuş araç arayüzünü güvenilir bir şekilde çalıştıramıyorsa, bu operasyonel bir sonuçtur. Project Naptime, çok adımlı araç kullanımı güvenilir kılınamayan modelleri hariç tuttu; aynı sınırlama bir prompt hatası olarak gizlenmek yerine burada açıkça görünmelidir.

Bir bulgu dört kapıdan geçmelidir

“Bulundu” kavramının kesin bir tanımı yapılmadığı sürece anma oranı (recall) anlamsızdır. Kıyaslama, bir raporun kulağa doğru gelip gelmediğini başka bir modele sorup buna zemin gerçeği (ground truth) diyemez.

ADAY BULGU → KESİNLEŞMİŞ BULGUDÖRT KAPILI KANIT DURUM MAKİNESİ 1 · Kök neden (Root cause)eksik veya bozukgüvenlik kararıEŞLEŞTİ Mİ? 2 · Erişilebilirlik (Reachability)kontrol edilen girdidenkritik operasyonaİZLENDİ Mİ? 3 · Yeniden üretim (Reproduce)sınırlandırılmış triggergözlemlenebilir etkiTEKRARLANDI MI? 4 · Negatif testaynı trigger düzeltilmişsürüme karşıŞİMDİ BAŞARISIZ MI? Yanlış teori0 bulgu puanı Erişilemezkesinlik cezası Kanıtlanmamıştriyaj adayı Özgül değiltest geçersizdir DOĞRULANMIŞ BULGUtüm kapılar geçti · hakemler onayladı · kanıt paketi korundu Akıcı bir rapor hiçbir kapıyı atlayamaz.
Aday bulgu faydalı bir operasyonel veridir; ancak yalnızca iddia edilen neden, erişilebilir yol, yeniden üretim ve düzeltilmiş sürüm karşılaştırması uzlaştığında kıyaslama bulgusu haline gelir.

Düzeltilmiş sürüm testi belirleyicidir. Aynı tetikleyici bilinen düzeltmeden sonra da sorunu “kanıtlamaya” devam ediyorsa, oracle zafiyeti değil; bir çökmeyi, hata mesajını veya genel bir davranışı ölçüyor demektir. İş mantığı vakalarında eşdeğer durum bir durum geçişidir: Yetkisiz eylem zafiyetli anlık görüntüde gerçekleşir ve yetkili kontrol başarılı olmaya devam ederken düzeltilmiş anlık görüntüde reddedilir.

Kör iki kişilik inceleme semantik eşleşmeleri çözmelidir. İncelemeciler raporu ve kanıtları görür ancak modeli veya hattı görmez. Anlaşmazlıklar, tetikleyici veya zemin gerçeği iyileştirilene kadar çözümsüz kalır. Bir LLM yargıcı kopyaları kümeleyebilir veya adayları yönlendirmeye yardımcı olabilir; değerlendirilen çıktının aynısı üzerinde nihai otorite olamaz.

Puan tablosu anma oranından (recall) fazlasına ihtiyaç duyar

Her hat için şu ölçümleri birlikte raporlayın:

MetrikHesaplamaNeden önemlidir
Doğrulanmış birleşim anma oranı (Recall)herhangi bir çalıştırmada bulunan benzersiz vakalar / tüm vakalarEkip tarafından satın alınan toplam kapsamı ölçer
Kesinlik (Precision)kabul edilen adaylar / sunulan tüm adaylarAgresif keşfin arkasında gizlenen insan maliyetini ortaya çıkarır
Tutarlılık (Consistency)üç çalıştırmada da bulunan vakalar / herhangi birinde bulunan vakalarGüvenilir davranışı şans eseri keşiften ayırır
Benzersiz katkıyalnızca tek bir model veya çalıştırma tarafından üretilen bulgularÇeşitliliğin gerçekten yeni kapsama alanı ekleyip eklemediğini gösterir
İkili örtüşme (Pairwise overlap)her çift için kesişim / birleşimTek model ile tamamlayıcı aramayı görünür kılar
Doğrulanmış bulgu başına maliyetmodel, işlem ve araç maliyeti / kabul edilen bulgularYeteneği bir işletme bütçesine bağlar
Bulgu başına triyaj dakikasıincelemeci süresi / kabul edilen bulgularUcuz token’ların pahalı gürültüyü gizlemesini engeller
Kanıt eksiksizliğiinsan müdahalesi olmadan dört kapıyı da geçen bulgularÇıktının sadece fikir verici değil, kullanılabilir olup olmadığını ölçer
İlk doğrulanmış bulguya kadar geçen süregeçen çalışma ve inceleme süresiİş akışı bir olaya veya sürüme bağlı olduğunda önemlidir

Bunları tek bir sihirli puana indirgemeyin. Yüksek anma oranına sahip bir ekip üç aylık bir kaynak kodu denetimi için doğru, bir pull-request kapısı için yanlış olabilir. Temiz kanıtlara sahip tutarlı bir model hızlı hatta yer alabilirken, keşif modelleri yüksek riskli bileşenlere karşı asenkron olarak çalıştırılabilir.

En açıklayıcı görsel bir çubuk grafik değil, bir örtüşme haritasıdır. Track B aynı 22 vakayı üç kez bulursa, model çeşitliliği çok az şey katmış demektir. 27 vaka bulur ancak on biri yalnızca tek bir modelden gelirse, o model mutlaka “en iyi” değildir; belirli bir kod veya hata sınıfı için bir uzman olabilir. Canlıdaki ekibi değiştirmeden önce benzersiz katkıyı katmanlara göre ayrıştırın.

Sonuçları bir yönlendirme politikasına dönüştürün

LİDER TABLOSUNDAN TAKIM TASARIMINAÖLÇÜLEN DAVRANIŞA GÖRE YÖNLENDİRME Sabitlenmiş kıyaslama sonuçlarıkapsam · örtüşme · kesinlik · maliyet · katmanlar Birincil araştırmacıyüksek kesinlik · tekrarlanabilirgeniş ilk taramaVARSAYILAN KUYRUK Ölçülmüş uzman modellerkategoriye özgü benzersiz kapsamvaryant · yetkilendirme · bellekHEDEFLİ İKİNCİ TARAMA Yineleme hattıaynı model · temiz durumyörünge çeşitliliği kazandırdığındaYÜKSEK RİSKTE DERİNLİK DETERMİNİSTİK DOĞRULAMA + KÖR İNSAN İNCELEMESİtekilleştir · yeniden üret · yamayı karşılaştır · kabul et veya reddet MODEL GÜVENİNİ DEĞİL, KANITI RAPORLAYIN
Kıyaslama bir yönlendirme politikası üretmelidir. Bir model uzman rolünü yalnızca tanımlanmış bir zafiyet katmanında tekrarlanabilir benzersiz katkı sağlayarak kazanır.

Üç sonuç mümkündür:

  • Track A kapsam ve maliyette kazanır. Tek bir modelin tekrarlanan taramalarını kullanın ancak oturumları bağımsız tutun. Bu model içindeki çeşitlilik bu veri seti için yeterlidir.
  • Track B benzersiz katkılarla kazanır. Kodu her modelin doğrulanmış bulgular eklediği kategorilere göre yönlendirin. Her depoyu sonsuza kadar her modele göndermeyin.
  • Kapsam benzerdir ancak kesinlik farklıdır. Temiz modeli senkron iş akışına yerleştirin ve gürültülü keşif modellerini daha güçlü yeniden üretim ve triyaj kapılarının arkasında çevrimdışı çalıştırın.

Bu nedenle uzman ekip bir varsayım değil, bir sonuçtur. Bir model ancak diğerlerinin kaçırdığı doğrulanmış yetkilendirme bulgularına tekrar tekrar katkıda bulunursa “yetkilendirme uzmanı” olur. Pazarlama açıklamaları, model boyutu ve tek bir başarı hikayesi bu rolü tayin edemez.

Bu kıyaslamanın hala kanıtlayamayacağı hususlar

Otuz altı bilinen vaka, kazanan yapılandırmanın yeni bir üründeki bilinmeyen zafiyetleri keşfedeceğini kanıtlamaz. Geçmiş CVE’ler zemin gerçeği sağlar ancak aynı zamanda halka açık kodlarda ve açıklamalarda temsil edilen modelleri de ödüllendirir. Özel kardeş varyantlar bu sorunu azaltır; tamamen ortadan kaldırmaz.

Test ayrıca bir kuruluşun canlı üretim ortamında otonom ajanları güvenle çalıştırıp çalıştıramayacağını da ölçmez. Buradaki tüm yürütme izole edilmiş zafiyetli anlık görüntüler içinde kalır. Depo erişimi, veri saklama, model sağlayıcı şartları, gizli anahtar yönetimi ve güvenlik açığı bildirim süreçleri ayrı güvenlik kararları olmaya devam eder.

Son olarak, bir kıyaslama sonucu eskir. Modeller, sağlayıcı yönlendirmeleri, fiyatlar, bağlam pencereleri ve test ortamları değişir. Model tanımlayıcısını ve yapılandırmasını sabitleyin, ham yörüngeleri saklayın, veri setini hash’leyin ve sonucu tarihleyin. Bu girdilerden herhangi biri değiştiğinde testi yeniden çalıştırın. Anlık görüntü ve altyapı sürümü belirtilmeyen bir model adı, tekrarlanabilir bir ölçüm değildir.

Kanıt matrisi (Evidence matrix)

İddiaGerekli kanıtNegatif kontrolYetersiz olan durum
Bir hat bir zafiyet bulduDoğru kök neden, erişilebilir yol, deterministik trigger, hakem uzlaşmasıYetkili bir kontrol başarılı olurken aynı tetikleyici düzeltilmiş anlık görüntüde başarısız olurBir CWE etiketi, şüpheli bir satır veya ikna edici bir rapor
Tekrarlama kapsamı artırırAynı model ve test ortamı, temiz oturumlar, çalıştırmalar arasında ek benzersiz doğrulanmış vakalarAnma oranı hesaplanmadan önce mükerrer raporlar birleştirilirBir hatanın üç tanımını üç bulgu olarak saymak
Model çeşitliliği değer katarÖzdeş talimatlar altında farklı model ailelerine atfedilebilen benzersiz doğrulanmış bulgularTrack A’yı aynı sayıda bağımsız yörünge ile tekrarlayınBir çalıştırma ile üç çalıştırmayı karşılaştırmak
Bir model faydalı bir uzmandırTanımlanmış bir zafiyet katmanında tekrarlanabilir benzersiz katkıGörünmeyen bir test katmanında aynı rolü değerlendirinTek bir istisnai başarı hikayesi
Bir hat daha ucuzdurÇalıştırma başına kaydedilen sağlayıcı, bilgi işlem, araç ve incelemeci maliyetleriEşit iş ve eşit harcama görünümlerini yayınlayınYalnızca token fiyatı
Veri seti ezberlemeyi sınırlarZamansal ayrım, yamalanmış tuzaklar, gizli yamalar ve özel incelenmiş kardeş varyantlarBilinen düzeltilmiş CVE’ler puan almamalıdırBir CVE’ye yalnızca “yeni” demek
Bir rapor canlı ortamda kullanılabilirİncelemeci onarımı olmadan eksiksiz dört kapılı kanıt paketiİncelemeci kanıt paketini bağımsız olarak yeniden oynatabilirModel güveni veya bir LLM-yargıç puanı

Sonuç

Bir liderlik tablosuna bakarak tek bir modeli veya üç modeli doğrudan işe almazdım. Ölçülmüş bir araştırma hattını işe alırdım.

Net bir karşılaştırma ile başlayın: A + A + A ile A + B + C; özdeş test ortamı, özdeş vakalar, özdeş limitler. Yalnızca kök neden incelemesinden, yeniden üretimden ve düzeltilmiş sürüm testinden geçen bulguları sayın. Birleşik kapsamı; kesinlik, örtüşme, triyaj süresi ve maliyetle birlikte yayınlayın. Ardından modelleri uzman rollere yalnızca test verilerinin tekrarlanabilir bir katkı gösterdiği alanlarda terfi ettirin.

Zafiyet araştırmalarında yapay zekanın asıl avantajı, tek bir modelin kusursuz bir denetçiye dönüşmesi değildir. Birkaç sınırlandırılmış incelemenin farklı hipotezleri ucuza keşfedebilmesi ve deterministik bir kanıt katmanının yalnızca kanıtlanabilenleri tutmasıdır. Keşif olasılıksal olabilir; ancak bir zafiyetin tanımı asla olasılıksal olamaz.

İncelenen kaynaklar

Kaynaklar ve güncellik

Bu teknik not ne kadar güncel?

Kontrol edilen kaynaklar24 Ağustos 2026

En son kaynak incelemesi, içerik güncellemesi veya yayın tarihi gösterilmektedir.

İnceleme DurumuYazar incelemesi tamamlandı

Yazar teknik incelemeyi tamamladı. Bu etiket tek başına laboratuvar yeniden üretimi iddiası taşımaz.