Yapay Zekâ Markanızı Tanıyor Ama Önermiyor: AIVI Endeksi ve Altı Boyutlu Görünürlük Ölçümü
7 dk · 2026-07-25
Yapay zekâya "hangi X’i önerirsin" diye sorduğunuzda markanız çıkmıyorsa iki ihtimal vardır: model sizi hiç bilmiyordur, ya da biliyordur ama önermeye değer bulmuyordur. Bu ikisi tamamen farklı problemlerdir ve tamamen farklı çözümler gerektirir. Bugüne kadar hangisinde olduğunuzu söyleyen bir ölçü yoktu. Bu yazı, o ölçüyü kuran akademik ön baskı çalışmamın blog uyarlamasıdır.

Pilot çalışmada altı gözlemlenebilirlik yazılımını üç farklı dil modeline sordum. Sorularda hiçbir ürünün adı geçmiyordu; "orta ölçekli bir mühendislik ekibi hangi platformu seçmeli" gibi açık uçlu sorulardı. Yani her marka adı, modelin kendi seçimiydi.
Sonuçlardan biri diğerlerinden ayrıldı. Coroot adlı ürünü üç modelin ikisi doğrudan sorulduğunda tanıdı, ne olduğunu ve kimin yaptığını doğru anlattı. Ama on sekiz açık uçlu yanıtın hiçbirinde adı geçmedi. Hiçbirinde.
- Tanınma oranı 0.67 — modeller ürünü biliyor.
- Görünürlük oranı 0.00 — ama hiçbir öneride anmıyorlar.
- Bu marka için SEO çalışması da, tanınırlık çalışması da yanlış tedavi olurdu.
Tanınmak ile önerilmek aynı şey değil
Klasik dijital görünürlük ölçümleri tek boyutludur: sıradasınız ya da değilsiniz, trafik var ya da yok. Üretken yapay zekâda ise görünürlük bir zincir. Model önce varlığınızı tanımalı, sonra sizinle ilgili bilgiyi getirmeli, sonra soruya uygun bulmalı, sonra cevaba koymaya karar vermeli. Zincirin herhangi bir halkasında kopuş olursa cevapta yoksunuz.
Coroot örneği bu zincirin ilk halkasının sağlam, sonraki halkalarının kopuk olduğu bir durumu gösteriyor. Tek sayılık bir "yapay zekâ görünürlük skoru" bu ayrımı yapamaz; size sadece düşük bir puan verir ve nedenini söylemez.
AIVI’nin altı boyutu
Bu yüzden endeksi altı ayrı ölçüye böldüm. Her biri zincirin farklı bir halkasını ölçüyor ve her biri 0 ile 1 arasında normalize ediliyor.
- Entity Recognition Rate (ERR) — model varlığınızı tanıyor mu? Zincirin ön koşulu.
- Visibility Recall (VR) — konuyla ilgili sorularda cevapta gerçekten çıkıyor musunuz?
- Citation Consistency (CC) — sizi desteklerken tekrar tekrar aynı kaynaklara mı dayanıyor?
- Recommendation Confidence (RC) — sadece anılıyor musunuz, yoksa öneriliyor musunuz? İkisi arasında büyük fark var.
- Prompt Robustness (PR) — aynı niyeti farklı cümlelerle sorduğunuzda görünürlüğünüz sabit mi?
- Cross-Model Stability (CMS) — bir modelde var olup diğerinde yok olmuyor musunuz?
Altısı ağırlıklandırılıp tek bir AIVI skoruna indirgenebiliyor. Ama makalede sabit ağırlık önermiyorum; ağırlıkların veriyle belirlenmesi gerektiğini savunuyorum. Elinizde veri yoksa başlangıç için altısına eşit ağırlık (1/6) vermek en dürüst varsayım.
Pilotun sonuçları
| Ürün | ERR | VR | RC | AIVI |
|---|---|---|---|---|
| Grafana | 1.00 | 0.83 | 0.56 | 0.78 |
| Datadog | 1.00 | 0.83 | 0.44 | 0.74 |
| New Relic | 1.00 | 0.72 | 0.41 | 0.65 |
| Honeycomb | 1.00 | 0.67 | 0.44 | 0.64 |
| SigNoz | 1.00 | 0.39 | 0.24 | 0.49 |
| Coroot | 0.67 | 0.00 | 0.00 | 0.22 |
Dikkat çeken bir başka nokta: hepsi tanınma boyutunda tam puan alan beş üründen SigNoz’un görünürlüğü diğerlerinin yarısı kadar. Üstelik bu ortalama bir yanılsama — bir model SigNoz’u yanıtlarının üçte ikisinde anarken başka bir model hiç anmadı. Tek modelde ölçüm yapsanız tamamen yanlış sonuca varırdınız.
Sahada çıkan iki sınır durumu
Pilotun asıl değeri, çerçevenin kâğıt üstünde görünmeyen iki zayıf noktasını ortaya çıkarması oldu.
Birincisi: Prompt Robustness ve Cross-Model Stability düşük değişkenliği ödüllendirir. Hiçbir yerde görünmeyen bir marka için değişkenlik sıfırdır — yani hiç görünmeyen marka bu iki boyutta tam puan alır. Coroot tam olarak bu durumdaydı. Çerçeveye bir koşul ekledim: görünürlük sıfırsa bu iki boyut hesaplanmaz, tanımsız yazılır.
İkincisi: Citation Consistency hiçbir üründe hesaplanamadı. Çünkü modeller web erişimi olmadan çalıştırıldı ve hiçbir yanıtta kaynak yoktu. Bu, bir hata değil bir bulgu: atıf tutarlılığı yalnızca arama yapabilen kurulumlarda ölçülebilen bir boyut. Aynı markayı hem erişimli hem erişimsiz kipte ölçmek gerekiyor.
Beş katmandan altı boyuta
Daha önceki çalışmamda AIVI’yi beş katmanlı bir çerçeve olarak sunmuştum: teknik erişilebilirlik, bilgi kalitesi, makine okunabilirliği, semantik güven ve atıf otoritesi. O model, görünürlüğü etkileyen faktörleri sınıflandıran bir teşhis aracıydı — neyi düzeltmeniz gerektiğini söylüyordu.
Bu çalışma o çerçevenin devamı ve tamamlayıcısı. Beş katman girdileri tarif ediyor; altı boyut ise çıktıyı ölçüyor. Biri sitenizde ne yapmanız gerektiğini, diğeri yaptığınızın modelin cevabında karşılık bulup bulmadığını söylüyor. Aynı sorunun iki ucu: yapılacak iş listesi ve termometre.
Ne işe yarar, ne işe yaramaz
AIVI bir kalite ölçüsü değil. Yüksek skor işinizin iyi olduğunu göstermez; sadece üretken sistemlerin sizi bulup önerme olasılığının yüksek olduğunu gösterir. Zaten "üretilmiş otorite" üzerine yazdığım çalışmanın tüm noktası, bu ikisinin birbirinden kopabildiğiydi.
Pilotun sınırlarını da açık yazayım: üç model de tek sağlayıcıdan. Yani ölçtüğüm şey gerçek anlamda sağlayıcılar arası tutarlılık değil, aynı ailenin sürümleri arası tutarlılık. Tek alan, tek dil, tek gün. Kodlama güvenilirliği iki değerlendiriciyle sınandı (uyum κ = 0.87) ama ikinci değerlendirici insan değil, bir dil modeliydi. Bunların hepsi makalede yazıyor; çünkü ölçüm önerisi yapan bir çalışmanın kendi ölçümünü abartması en baştan çelişki olurdu.
- Tanınmak ve önerilmek ayrı şeyler; tek skorlu ölçümler bu farkı gizler.
- AIVI görünürlüğü altı boyuta ayırır: ERR, VR, CC, RC, PR, CMS.
- Hiç görünmeyen bir marka, düşük değişkenlik yüzünden yanlışlıkla yüksek puan alabilir; koşullu okuma şart.
- Atıf tutarlılığı yalnızca web erişimli kurulumlarda ölçülebilir.
- Tek modelde yapılan ölçüm yanıltıcıdır; markalar arası fark modelden modele değişiyor.
Bu makaleye atıf
Göktaş, İ. (2026). Yapay Zekâ Markanızı Tanıyor Ama Önermiyor: AIVI Endeksi ve Altı Boyutlu Görünürlük Ölçümü. Zenodo (preprint). DOI: 10.5281/zenodo.21567901
Sıkça sorulan sorular
AIVI skoru kaç olmalı?
Mutlak bir eşik yok ve makalede bilerek eşik önermiyorum. AIVI göreli bir ölçü: aynı soru setiyle, aynı modellerde, aynı dönemde ölçülen rakiplerinizle karşılaştırıldığında anlam kazanır. Farklı koşullarda alınmış iki skoru yan yana koymak yanıltıcıdır.
Yapay zekâ beni tanıyor ama önermiyorsa ne yapmalıyım?
Bu, tanınırlık probleminiz değil seçilme probleminiz olduğu anlamına gelir. Model varlığınızı biliyor ama sizi öneri listesine koyacak gerekçeyi bulamıyor. Genellikle eksik olan şey, bağımsız ve doğrulanabilir kaynaklarda sizi belirli bir kullanım senaryosuyla eşleştiren içeriktir. Kendi sitenizde ne yazdığınız burada yeterli olmuyor.
Ölçümü tek bir yapay zekâda yapsam olmaz mı?
Olmaz. Pilotta bir ürün, bir modelin yanıtlarının üçte ikisinde çıkarken başka bir modelde hiç çıkmadı. Tek modelde ölçüm yaparsanız, ölçtüğünüz şey markanızın görünürlüğü değil o modelin eğilimi olur.
Bu çerçeve önceki AIVI modelinin yerine mi geçiyor?
Hayır, tamamlıyor. Beş katmanlı çerçeve görünürlüğü etkileyen faktörleri sınıflandırır ve ne yapmanız gerektiğini söyler. Altı boyutlu endeks ise sonucu ölçer ve yaptığınızın işe yarayıp yaramadığını söyler. Biri yol haritası, diğeri termometre.
Çalışmanın tamamına nereden ulaşabilirim?
Ön baskının tamamı Zenodo’da açık erişimle yayımlandı (CC BY 4.0). Soru seti, kodlanmış gözlem matrisi ve hesaplama yöntemi makalenin 5. ve 7. bölümlerinde ayrıntılı biçimde yer alıyor.