Türk Hukukuna Özel Yapay Zekâ · Agentic Mimari · Hibrit Arama · GraphRAG
Bu rapor hakkında
Bu rapor, Türk hukukuna özel yapay zekâ, agentic mimari, hibrit arama ve GraphRAG hukuki bilgi ağı ile tasarlanan
Adaletopia hukuk asistanının vatandaş sorularına ne kadar doğru, kaynağa dayalı ve tutarlı cevap
verdiğini ölçen bir yapay zekâ değerlendirmesidir (AI evaluation).
Test soruları, hukuki terminoloji ve kanun/madde numarası kullanılmadan, hukuk bilgisi olmayan bir vatandaşın
gündelik diliyle yazılmıştır. Bu bilinçli bir zorlaştırmadır: asistan, anlatılan olaydan doğru hukuki kavrama ve doğru
maddeye kendisi ulaşmak zorundadır. 14 kanundan 140 soru, sonuçların tek seferlik şansa dayanmaması için her biri
birbirinden bağımsız olarak 4 kez sorulmuştur.
Asistan, üretimdeki yapılandırmasıyla, yaklaşık 330 bin mevzuat maddesi arasından arama yaparak ve gerektiğinde
emsal karar araması da yaparak çalışmıştır. Doğru
maddenin bulunup bulunmadığı, kaynak gösterilip gösterilmediği ve araçların kurallara uygun kullanılıp kullanılmadığı
kayıtlardan kesin olarak hesaplanmıştır. Cevabın doğruluğu gibi yorum gerektiren boyutlar, test edilen modelden farklı
bir hakem modelle, önceden tanımlanmış ölçütlere göre puanlanmıştır. Asistanın bilgi uydurma eğilimini ölçmek için
cevabı olmayan ve yanlış öncüllü tuzak sorular, ifade değişikliğine dayanıklılığını ölçmek için aynı soruların farklı
ifadeleri de test edilmiştir. Oranlar, %95 güven aralıklarıyla birlikte verilmiştir (Bölüm 6).
Doğruluk ve answer relevance, test edilen modelden farklı bir hakem model tarafından puanlanmıştır. Doğruluk: cevabın, referans cevaptaki hukuki sonucu (varsa şart, istisna, süre ve oranlarıyla birlikte) doğru vermesi; esas sonuç doğru olup önemli bir şart veya istisna eksikse kısmen doğru sayılır. Answer relevance: cevabın, doğruluğundan bağımsız olarak sorunun tüm alt sorularını ele alması. Dayanaklı başarı: bulunması gereken maddelerin tamamının hem getirilmiş hem de cevapta kaynak olarak gösterilmiş olması; hakem gerektirmeyen, kesin bir ölçüttür.
Soru tipi bazında
Soru tipi
Çalıştırma
Doğru
Kısmen doğru
Yanlış
İlgili
Kısmen ilgili
İlgisiz
Dayanaklı başarı
Tek madde
292
%98.6
%1.4
%0.0
%100.0
%0.0
%0.0
%98.6
Çok madde
156
%99.4
%0.6
%0.0
%100.0
%0.0
%0.0
%85.9
İstisna / şart
112
%99.1
%0.9
%0.0
%100.0
%0.0
%0.0
%95.5
Zorluk bazında
Zorluk
Çalıştırma
Doğru
Kısmen doğru
Yanlış
İlgili
Kısmen ilgili
İlgisiz
Dayanaklı başarı
Kolay
172
%98.8
%1.2
%0.0
%100.0
%0.0
%0.0
%99.4
Orta
236
%98.7
%1.3
%0.0
%100.0
%0.0
%0.0
%93.2
Zor
152
%99.3
%0.7
%0.0
%100.0
%0.0
%0.0
%90.8
2. Hibrit Arama ve GraphRAG: Bilgi Getirme
Metrik
Değer
Kümülatif recall
%98.6 (797 / 808 madde)
Çalıştırma başına ortalama recall
%98.9
Tam isabet (tüm maddeler bulundu)
%98.0 (549 çalıştırma)
Kısmi isabet
%1.6 (9 çalıştırma)
Hiç bulunamadı
%0.4 (2 çalıştırma)
Hit@1 (beklenen madde ilk 1 sonuçta)
%52.6 (425 / 808 madde)
Hit@3 (beklenen madde ilk 3 sonuçta)
%78.5 (634 / 808 madde)
Hit@5 (beklenen madde ilk 5 sonuçta)
%90.3 (730 / 808 madde)
Hit@10 (beklenen madde ilk 10 sonuçta)
%98.3 (794 / 808 madde)
MRR (ortalama ters sıra)
0.820
Context precision — ilk 3 sonuç
%39.0 ilgili · %60.8 ilgili veya destekleyici
Context precision — ilk 5 sonuç
%26.9 ilgili · %48.8 ilgili veya destekleyici
Context precision — tüm sonuçlar
%14.0 ilgili · %31.1 ilgili veya destekleyici
Çalıştırma başına getirilen madde
11.2
Asistan, gerektiğinde mevzuat maddelerinin yanında emsal karar araması da yapar; bu bölümdeki metrikler, her soru için önceden belirlenmiş mevzuat maddelerinin bulunmasını ölçer (emsal karar kullanımı: Bölüm 3). Kümülatif recall: bulunan madde toplamı / bulunması gereken madde toplamı; bir madde, çalıştırmadaki araç çağrılarının herhangi birinde dönmüşse bulunmuş sayılır. Ortalama recall: her çalıştırmanın kendi recall değerinin ortalaması. Hit@k: bulunması gereken maddenin, arama sonuç listesinde ilk k sırada yer alma oranı. MRR: bulunması gereken ilk maddenin sırasının tersinin ortalaması (1 = hep ilk sırada). Context precision: getirilen her madde, hakem model tarafından referans cevaba ulaşmaktaki katkısına göre ilgili (doğrudan dayanak), kısmen (destekleyici veya tamamlayıcı) ya da ilgisiz olarak puanlanmıştır. Asistan doğrudan dayanağın yanında tamamlayıcı maddeleri de getirdiği için tüm sonuçlar üzerinden precision düşük, ilk sonuçlarda daha yüksektir.
Soru tipi bazında
Soru tipi
Çalıştırma
Kümülatif recall
Ortalama recall
Tam isabet
Hiç bulunamadı
Hit@1
Hit@5
MRR
Tek madde
292
%99.7
%99.7
%99.7
1
%71.6
%93.8
0.813
Çok madde
156
%98.2
%98.0
%95.5
0
%38.0
%86.7
0.882
İstisna / şart
112
%97.7
%98.2
%97.3
1
%53.0
%93.2
0.752
Zorluk bazında
Zorluk
Çalıştırma
Kümülatif recall
Ortalama recall
Tam isabet
Hiç bulunamadı
Hit@1
Hit@5
MRR
Kolay
172
%99.4
%99.4
%99.4
1
%73.8
%94.2
0.829
Orta
236
%97.9
%98.3
%97.0
1
%54.2
%88.7
0.820
Zor
152
%99.0
%99.2
%98.0
0
%38.7
%90.0
0.809
3. Halüsinasyon ve Güvenilirlik
Metrik
Değer
İddia düzeyi faithfulness (desteklenen iddia)
%94.3 (2693 / 2856 iddia)
Kısmen desteklenen iddia
%0.5 (15 iddia)
Desteklenmeyen iddia
%5.2 (148 iddia)
En az bir desteklenmeyen iddia içeren cevap
%17.5 (98 / 560 çalıştırma)
Araç çıktısında olmayan maddeye atıf (uydurma madde atfı)
Getirilen doğru maddenin cevapta kaynak gösterilmesi
%97.5 (777 / 797 madde)
Doğru çekimserlik (tuzak sorular)
%92.6
Tuzakta kısmen doğru davranış
%5.9
Tuzakta yanlış davranış (uydurma / öncülü kabul)
%1.5
İddia düzeyi faithfulness: hakem model cevaptaki hukuki iddiaları (kural, şart, süre, oran, sonuç) çıkarır ve her birini yalnızca o çalıştırmada araçların getirdiği mevzuat maddeleri ve emsal karar metinlerine göre değerlendirir; hakem, referans cevabı ve kendi hukuk bilgisini dayanak saymaz. Bu nedenle doğru olup getirilen metinde açıkça yer almayan bilgi de desteklenmeyen sayılır; ölçüt yanlışlığı değil kaynaksızlığı gösterir. Uydurma atıf: cevapta bağlantıyla atıf yapılan maddenin, o çalıştırmadaki araç çıktılarında hiç yer almaması; emsal kararlar için de aynı kontrol yapılır. Hakem gerektirmeyen, kesin bir ölçüttür. Getirilen doğru maddenin kaynak gösterilmesi: araçların getirdiği ve bulunması gereken maddelerin cevapta bağlantıyla kaynak gösterilme oranı. Doğru çekimserlik: cevabı olmayan, yanlış öncüllü, kapsam dışı veya eksik bilgili tuzak sorularda asistanın bilgi uydurmak yerine beklenen davranışı (maddenin olmadığını söylemek, öncülü düzeltmek, kapsam dışı olduğunu belirtmek, ek bilgi istemek) göstermesi; hakem model tarafından puanlanmıştır.
Soru tipi bazında
Soru tipi
Çalıştırma
Desteklenen iddia
Desteklenmeyen iddia
Desteklenmeyen iddialı cevap
Uydurma atıf
Doğru maddenin kaynak gösterilmesi
Tek madde
292
%92.6
%6.5
%20.5
2
%99.0
Çok madde
156
%96.0
%3.8
%14.1
0
%96.0
İstisna / şart
112
%95.5
%4.4
%14.3
0
%98.4
Zorluk bazında
Zorluk
Çalıştırma
Desteklenen iddia
Desteklenmeyen iddia
Desteklenmeyen iddialı cevap
Uydurma atıf
Doğru maddenin kaynak gösterilmesi
Kolay
172
%91.1
%8.0
%25.0
2
%100.0
Orta
236
%94.6
%4.9
%16.9
0
%97.3
Zor
152
%96.6
%3.2
%9.9
0
%96.3
Emsal karar kullanımı
Metrik
Değer
Emsal karar araması yapılan çalıştırma
%17.7 (99 / 560 çalıştırma)
Getirilen emsal karara cevapta atıf yapılan çalıştırma
%76.8 (76 / 99)
Emsal karara yapılan atıf
153 atıf · 0 uydurma
Bu çalıştırmalarda doğruluk
%100.0 (99 / 99)
Bu çalıştırmalarda iddia düzeyi faithfulness
%96.8 (544 / 562 iddia)
Asistan, soruya göre gerekli gördüğünde mevzuat maddelerinin yanında emsal karar araması da yapar ve cevabını yargı kararlarıyla destekler. Bu tabloda, emsal karar araması yapılan çalıştırmalarda getirilen kararların cevapta kaynak gösterilmesi, emsal atıflarının gerçekten getirilmiş kararlara dayanması ve bu cevapların doğruluğu ile kaynağa sadakati verilmiştir.
Tuzak türü bazında
Tuzak türü
Doğru davranış
Kısmen
Yanlış davranış
Var olmayan madde
%93.8
%6.2
%0.0
Yanlış öncül
%100.0
%0.0
%0.0
Kapsam dışı
%100.0
%0.0
%0.0
Yetersiz bilgi
%75.0
%18.8
%6.2
4. Tutarlılık
Metrik
Değer
pass^1 — Doğruluk
%98.9
pass^2 — Doğruluk
%98.1
pass^3 — Doğruluk
%97.5
pass^4 — Doğruluk
%97.1
pass^1 — Dayanaklı başarı
%94.5
pass^2 — Dayanaklı başarı
%92.5
pass^3 — Dayanaklı başarı
%91.1
pass^4 — Dayanaklı başarı
%90.0
4 tekrarda da aynı beklenen maddeler getirildi
%95.7 (134 / 140 soru)
4 tekrarda da aynı doğruluk kararı
%97.1 (136 / 140 soru)
Parafrazda sonucu korunan soru — doğruluk
%92.9
Parafrazda sonucu korunan soru — tam isabet
%96.4
pass^k: bir sorunun k bağımsız denemenin hepsinde başarılı olma olasılığı (τ-bench yöntemi; her soru 4 kez sorulmuştur, n denemenin c'si başarılıysa C(c,k)/C(n,k), sorular üzerinden ortalama). pass^1 ortalama başarıya eşittir; k büyüdükçe düşüş, sonucun tekrarlarda korunmadığını gösterir. Doğruluk hakem modelin "doğru" kararına, dayanaklı başarı bulunması gereken maddelerin getirilip cevapta kaynak gösterilmesine dayanır. Tekrarlar arası tutarlılık: aynı sorunun tüm tekrarlarında birebir aynı kalan sonuçların oranı. Parafraz tutarlılığı: örneklenen soruların anlamı aynı, ifadesi farklı hâli sorulmuş; bir sorunun sonucu, orijinalde ve parafrazda tüm tekrarlarda başarılı olup olmaması aynıysa korunmuş sayılır.
Soru tipi bazında
Soru tipi
Soru
pass^1 doğruluk
pass^4 doğruluk
pass^1 dayanaklı
pass^4 dayanaklı
Aynı maddeler
Tek madde
73
%98.6
%97.3
%98.6
%97.3
%98.6
Çok madde
39
%99.4
%97.4
%85.9
%79.5
%94.9
İstisna / şart
28
%99.1
%96.4
%95.5
%85.7
%89.3
Zorluk bazında
Zorluk
Soru
pass^1 doğruluk
pass^4 doğruluk
pass^1 dayanaklı
pass^4 dayanaklı
Aynı maddeler
Kolay
43
%98.8
%97.7
%99.4
%97.7
%97.7
Orta
59
%98.7
%96.6
%93.2
%88.1
%94.9
Zor
38
%99.3
%97.4
%90.8
%84.2
%94.7
Parafraz karşılaştırması
Metrik
Orijinal
Parafraz
Fark (puan)
Doğruluk
%98.2
%98.2
+0.0
Dayanaklı başarı
%93.8
%92.9
-0.9
Tam isabet (tüm beklenen maddeler getirildi)
%95.5
%96.4
+0.9
5. Agentic Mimari: Araç Kullanımı
Metrik
Değer
Tool seçim doğruluğu (çağrı)
%100.0 (723 / 723 çağrı)
Tüm çağrıları doğru seçilmiş çalıştırma
%100.0 (560 / 560)
Parametre doğruluğu (çağrı)
%95.6 (691 / 723 çağrı)
Tüm parametreleri doğru çalıştırma
%94.8 (531 / 560)
Sorgu kalitesi: iyi
%100.0 (560 / 560 çalıştırma)
Sorgu kalitesi: zayıf / hatalı
%0.0 / %0.0
Ortalama tool çağrısı / çalıştırma
1.29
Tek çağrıyla biten çalıştırma
%78.6
Aynı çağrıyı birebir tekrarlayan çalıştırma
0
Hiç tool çağırmayan çalıştırma
0
Tur limitine takılan çalıştırma
0
Tool seçim doğruluğu: çağrılan aracın duruma uygun olması. Sorularda kanun adı veya madde numarası bulunmadığından ilk adımda künye/kimlik aracı kullanmak, soru belge istemediği hâlde belge aracı kullanmak ve tanımsız araç çağırmak hatalı seçim sayılır. Parametre doğruluğu: zorunlu parametrelerin bulunması, tiplerin doğru ve parametrelerin tanımlı olması; kanun ve madde numarası gibi künye değerlerinin soruda veya önceki araç çıktılarında geçmesi, kimlik değerlerinin önceki araç çıktılarından alınmış olması. Sorgu kalitesi: araç çağrılarındaki arama sorgusunun, sorudaki hukuki meseleyi doğru kavramlarla ifade edip etmediği; hakem model tarafından puanlanmıştır.
Soru tipi bazında
Soru tipi
Çalıştırma
Ort. çağrı
Seçim doğruluğu
Parametre doğruluğu
Sorgu iyi
Tek madde
292
1.22
%100.0
%96.6
%100.0
Çok madde
156
1.41
%100.0
%92.7
%100.0
İstisna / şart
112
1.31
%100.0
%97.3
%100.0
Zorluk bazında
Zorluk
Çalıştırma
Ort. çağrı
Seçim doğruluğu
Parametre doğruluğu
Sorgu iyi
Kolay
172
1.31
%100.0
%95.6
%100.0
Orta
236
1.25
%100.0
%95.9
%100.0
Zor
152
1.32
%100.0
%95.0
%100.0
6. Yöntem Bilgisi
Metodoloji
Test soruları, rastgele seçilen mevzuatlardan rastgele türetilmiştir. Sorular, hukuki terminoloji ve kanun/madde numarası kullanılmadan, bir vatandaşın gündelik dilde soracağı biçimde yazılmıştır; bu tercih, testi bilinçli olarak zorlaştırmak ve modelin gündelik bir anlatımdan doğru hukuki kavrama ve maddeye ulaşma becerisini ölçmek amacıyla yapılmıştır. Modelin tutarlılığını ve sonuçların güvenilirliğini ölçmek amacıyla her soru birbirinden bağımsız olarak 4 kez sorulmuş; raporlanan metrikler bu tekrarların toplamına/ortalamasına dayanmaktadır. Raporda çalıştırma, bir sorunun tek bir tekrarını ifade eder (140 soru × 4 tekrar = 560 çalıştırma).
Asistan, üretimdeki sistem talimatları ve araç tanımlarıyla birebir aynı yapılandırılmış bir ortamda çalıştırılmış; araçlar yaklaşık 330 bin mevzuat maddesini içeren gerçek arama altyapısına bağlanmıştır. Her çalıştırmada modelin yaptığı araç çağrıları, dönen sonuçlar ve nihai cevap eksiksiz kaydedilmiştir. Getirme ve araç kullanımı metrikleri bu kayıtlardan kesin olarak hesaplanmış; cevabın doğruluğu, ilgililiği, kaynağa sadakati, getirilen maddelerin katkısı ve tuzak sorulardaki davranış ise test edilen modelden farklı bir hakem modelle, önceden tanımlanmış ölçütlere göre puanlanmıştır. Hakem değerlendirmeleri, girdi değişmedikçe yeniden yapılmayacak şekilde kayıt altına alınmıştır.
Test kapsamındaki kanunlar; ceza, ceza muhakemesi, medeni, borçlar, ticaret, icra ve iflas, iş, vergi, sosyal güvenlik, idare ve siber güvenlik alanlarından rastgele seçilmiş bir örneklemdir. Asistan belirli kanunlarla sınırlı değildir; mevzuatın tamamında ve emsal kararlarda arama yapar. Bilgi getirme metrikleri (Bölüm 2), her soru için önceden belirlenmiş mevzuat maddelerinin bulunmasını ölçer.
Güven aralıkları (%95)
Metrik
Değer
%95 güven aralığı
Doğruluk
%98.9
%97.7 – %99.8
Dayanaklı başarı
%94.5
%90.9 – %97.5
Kümülatif recall
%98.6
%97.2 – %99.6
Hit@1
%52.6
%47.6 – %58.1
Hit@5
%90.3
%87.6 – %93.0
MRR
0.820
0.780 – 0.859
İddia düzeyi faithfulness
%94.3
%92.2 – %96.2
pass^4 — doğruluk
%97.1
%94.3 – %99.3
Doğru çekimserlik (tuzak)
%92.6
%83.8 – %98.5
Güven aralıkları, soru düzeyinde bootstrap ile hesaplanmıştır: sorular yerine koyarak yeniden örneklenmiş (2000 örnekleme), aynı sorunun tekrarları birlikte tutulmuştur; çünkü aynı sorunun tekrarları birbirinden bağımsız değildir. Aralıklar yüzdelik yöntemiyle verilmiştir.