Latest / Levent Bulut - Objective Projection

LLM Benchmark Hatası: Yapay Zekâ Nerede Yanıldı?
Yapay zekâ bir metin analizinde %96 uyum sağlarken nasıl tamamen başarısız sayılabilir?İşte LLM benchmark testlerinin arkasındaki büyük istatistiki yanılsama: Cohen's Kappa paradoksu!Büyük dil modellerinin (LLM) ve kural tabanlı dedektörlerin metin anlama kapasitesi ölçülürken şaşırtıcı bir istatistiksel sonuç ortaya çıkıyor: Bağımsız insan etiketleyici ile yapay zekâ arasında %96 ham uyum görülmesine rağmen, Cohen's Kappa katsayısı tam 0.000 olarak hesaplanıyor. Feinstein ve Cicchetti'nin literatüre kazandırdığı "yüksek uyum, düşük kappa" paradoksu, incelenen özelliğin veri setinde aşırı…
The skinny
The skinny isn't ready yet — notes appear once the transcript is processed.