Yapay zeka (AI) sistemlerinin ve dijital ürünlerin gerçek dünya kullanıcıları için nasıl performans gösterdiğini anlamak, bu sistemlerin yaygınlaştırılması için önemli bir aşamadır. Geleneksel pazar araştırmaları  ve insan temelli değerlendirmeler, kullanıcı ihtiyaçlarını ve tercihlerini anlamada etkili olsa da , bu süreçlerin maliyetli olması ve yavaş ilerlemesi çoğu geliştirme ekibi tarafından nadiren uygulanmaktadır.  Benzer şekilde, otomatik testler  genellikle görev çıktılarını ölçmekte ancak heterojen kullanıcıların etkileşimli davranışlarını ve çeşitliliğini modellemekte yetersiz kalmaktadır. Bu durum, yapay zeka sistemlerinin farklı toplum kesimleri üzerindeki gerçek etkisinin tam olarak ölçülebilmesi için yeni simülasyon teknolojilerine duyulan ihtiyacı artırmaktadır.

Mevcut değerlendirme yöntemlerindeki en temel problem, insan çeşitliliğinin ve etkileşimli davranışların genellikle soyutlanmasıdır. Örneğin, bir kodlama asistanı ölçütü teknik doğruluğu test edebilirken, yeni başlayan bir kullanıcının açıklama beklentisi ile bir uzmanın kısa yanıt tercihini aynı anda modelleyememektedir. Araştırmacılar, AI sistemlerini ve dijital ürünleri çok çeşitli kullanıcı gruplarıyla test edebilmek amacıyla MatrAIx adını verdikleri, nüfus ölçeğinde bir simüle edilmiş kullanıcı değerlendirme altyapısı geliştirmeyi amaçlamaktadırlar. Bu çalışma, heterojen kullanıcıların sistemlerle nasıl etkileşime girdiğini ve sonuçları nasıl yargıladığını simülasyon yoluyla ortaya koyarak insan temelli çalışmaların kapsamını genişletmeyi hedeflemektedir.

MatrAIx platformu üç temel bileşenden oluşmaktadır: İlk olarak, Persona 8B adı verilen veri seti, 1.290 kategorik boyutta temsil edilen 8,3 milyar persona (bir bireyin özelliklerini yansıtan yapay profil) kaydı içermektedir. Bu kayıtlar, demografik özellikler arasındaki bağımlılıkları koruyan istatistiksel verilere dayalı sentetik veriler ile Wikipedia ve Amazon yorumları gibi kaynaklardan elde edilen insan temelli profillerin birleşiminden oluşmaktadır. İkinci bileşen olan MatrAIx Playground, persona ajanlarının (bir modelle eşleştirilmiş persona kaydı) anket, yapay zeka sohbet robotu, web ve uygulama gibi dört farklı ortamda etkileşime girmesine olanak sağlamaktadır. Son olarak, MatrAIx Applications kütüphanesi; ticaret, yazılım, finans ve sağlık gibi 25’ten fazla alanı kapsayan 1.010 uygulama görevi sunmaktadır.

Araştırmacılar, sekiz temsilci görev üzerinde 18.189 değerlendirme denemesi gerçekleştirerek sistemin etkinliğini doğrulamışlardır. Yapılan 400 denemelik kontrollü bir çalışma, persona ajanlarının kendilerine atanan davranış özelliklerini %91,5 oranında (400 denemenin 366’sında)  doğru bir şekilde sergilediğini veya doğru şekilde bastırdığını ortaya koymaktadır. Denemeler sırasında kullanılan Claude Opus 4.8, GPT 5.5 ve Claude Haiku 4.5 gibi büyük dil modelleri ile güçlendirilen ajanlar, fiyat artışlarına karşı tereddüt veya bir yapay zeka asistanının hatasından sonra devam etme isteği gibi insan benzeri tercihler göstermişlerdir. Ayrıca, insan değerlendiriciler tarafından yapılan kalite kontrollerinde, insan kaynaklı personaların veri çıkarma kalitesi 5 üzerinden ortalama 4,135 puan alarak yüksek bir doğruluk düzeyi sergilemiştir.

Bu yeni altyapı, yapay zeka sistemlerinin ve dijital ürünlerin piyasaya sürülmeden önce kapsamlı bir şekilde taranması, alt grup analizlerinin yapılması ve stres testlerine tabi tutulması için önemli bir potansiyel sunmaktadır. MatrAIx, toplu puanların gözden kaçırabileceği özgün kullanıcı sorunlarını ve başarısızlık modlarını (sistemin hata verme biçimleri) ortaya çıkararak ürün geliştirme süreçlerini optimize etmektedir. Araştırmacılar, simüle edilmiş kullanıcı değerlendirmelerinin, gerçek insan çalışmalarının yerine tamamen geçmese de, sorunları daha erken, daha sık ve daha geniş bir yelpazede tespit etmek için kritik bir ön aşama teşkil ettiğini ve önemli bulguların gerçek insanlarla doğrulanması gerektiğini vurgulamaktadır. Gelecekte bu tür platformların yaygınlaşması, daha kapsayıcı ve kullanıcı odaklı yapay zeka teknolojilerinin geliştirilmesine temel oluşturacaktır.

Yazar: Asmin Petekbaşı

Editör: Hazel Birgül

 

Referans: MatrAIx. Simulating the World with 8.3 Billion Personas. MatrAIx Research (2026). https://matraix.ai/research/persona-8b.html