Yapay Zeka6 dk Okuma Süresi

Değerlendirme seti olmadan yapay zekâ geliştirmek

Karyatif Ekibi
Yazar
04 Ağustos 2026
Yayın Tarihi
Değerlendirme seti olmadan yapay zekâ geliştirmek

Klasik yazılımda bir değişikliğin bir şeyi bozup bozmadığını testler söyler. Yapay zekâ projelerinde çoğu ekip bu güvenceden vazgeçip yerine "bir bakalım nasıl olmuş" yöntemini koyuyor. Sonuç: her düzeltme başka bir yeri sessizce bozuyor.

Sorun, çıktının tek doğrusunun olmaması değil

"Yapay zekâ çıktısı serbest metin, nasıl test edilecek?" itirazı haklı görünüyor ama yanıltıcı. Bir cevabın tek doğru hâli olmayabilir; buna rağmen kabul edilemez hâlleri nettir. Fiyat sorusuna fiyat vermemesi, iade politikasını uydurması, müşteriyi yanlış birime yönlendirmesi ölçülebilir hatalardır. Ölçemediğiniz şey üslup; ölçebileceğiniz şey doğruluk ve davranış.

Eval seti nedir

Gerçek kullanımdan toplanmış girdi örnekleri ve her biri için "bu cevap kabul edilir mi" ölçütünden ibaret. Yüzlerce örneğe gerek yok; 30-50 iyi seçilmiş vaka çoğu projede fark yaratır. Karışımı şöyle kurun:

  • Sıradan vakalar: kullanıcıların en sık sorduğu şeyler.
  • Sınır vakaları: eksik bilgiyle gelen, iki soruyu tek cümlede soran, konu dışına çıkan girdiler.
  • Sahada patlamış vakalar: gerçekten yanlış cevap alınmış her örnek doğrudan sete girer. Bu, en değerli kaynaktır.

Ölçütü davranış üstünden yazın

"Cevap şu metne benzesin" değil, "cevap şu davranışı göstersin" diye yazın. Örnekler: fiyat sorulduğunda kesin rakam vermeli, bilmediğini söylemeli, uydurmamalı, randevu talebinde tarihi teyit etmeli. Bu ölçütlerin çoğu basit kurallarla otomatik kontrol edilebilir; kalanı için bir kişinin gözden geçirmesi yeterli.

Değişiklikten önce ve sonra çalıştırın

Asıl kazanç burada. Prompt'u değiştirdiğinizde, modeli güncellediğinizde veya yeni bir belge eklediğinizde seti tekrar çalıştırın. Rakam yükseldiyse iyileştirme, düştüyse gerileme. Bu tek adım, "önceki hafta daha iyi çalışıyordu galiba" tartışmasını tamamen bitirir.

Model değiştirmenin gerçek maliyeti

Eval seti olmayan ekipler için model değiştirmek riskli bir hamledir; kimse neyin bozulacağını bilmez. Seti olan ekip için bu yarım saatlik bir iştir: yeni modeli aynı vakalarda çalıştırır, sonucu karşılaştırır, karar verir. Maliyet-performans dengesini maliyet yazısında ayrıntılandırmıştık; oradaki kararları sağlıklı verebilmek de bu ölçüme bağlı.

Ne zaman kurmalı

İlk günden. Pilot aşamasında beş vakayla başlamak bile, üç ay sonra yüz vakaya çıkmanın önünü açar. Projenin sonunda kurmaya kalkarsanız hem gerçek örnekleri toplamamış olursunuz hem de o ana kadar biriken gerilemeleri hiç göremezsiniz. Pilotun üretime geçememesinin sebeplerinden biri de tam olarak budur.

Özet

Yapay zekâ projelerinde ilerlemeyi hissetmek yeterli değil; ölçmek gerekiyor. Küçük ama gerçek bir değerlendirme seti, hem güvenli değişiklik yapmayı hem de sistemin gerçekten iyileşip iyileşmediğini bilmeyi sağlıyor.

Ölçemediğiniz bir sistem mi var?

Mevcut yapay zekâ çözümünüz için değerlendirme seti kuralım; nerede iyi, nerede zayıf olduğunu rakamla görün.

Görüşme planla
Değerlendirme seti olmadan yapay zekâ geliştirmek | Karyatif Blog