1 of 31

BBY 156 Bilgi Erişim�2022-2023�http://bby156.blogspot.com ��👉 Bilgi erişim kuralları �(erişim fonksiyonları)- II �Olasılık Modeli �Sorgu modifikasyonları�

2 of 31

Erişim fonksiyonları (hatırlatma)

  • Bilgi erişim sistemlerinde kullanılan erişim kuralları (fonksiyonları/modelleri) kabaca üç başlık altında sınıflandırılabilir:
    • Boole (kesin çakışma - exact match)
      • Sorgu ve dizin terimleri arasında kesin eşleşme (exact match) gerektiren erişim fonksiyonları
    • Vektör uzayı
      • Sorgu ve dizin terimlerinin n-boyutlu bir uzaydaki vektörler olarak işlem gördüğü ve ağırlıklandırıldığı erişim fonksiyonu
    • Olasılık kuramı
      • Sorgu ve dizin terimlerinin olasılık kuramına göre ağırlıklandırılmasına dayalı erişim fonksiyonları

3 of 31

Boole modeli ~ avantaj-dezavantaj (hatırlatma)

  • Boole modelinin temel avantajı tasarımındaki basitlik.
  • En önemli dezavantajı ise tam çakışma (exact match) erişim kuralının çok az ya da çok fazla sonuç getirebilecek olması.
  • Benzerlik derecelendirmesi yok: Sorgu ile belgenin ne kadar ilgili olduğunu gösteren bir skor değeri üretilmiyor bunun yerine ilgili / ilgisiz (1/0) yargısı var.
  • Eşleştirmelerde terim ağırlıklandırma yok: Bir belge içerisinde 1 kez geçen terimle 100 kez geçen terim aynı ağırlıkta, bu belge içeriğini ifade eden değerli terimleri seçmemizi engelliyor.
  • Sorgu oluşturmak zor: Kullanıcıların bilgi ihtiyaçlarını ifade edebilmek için karmaşık sorgular kurabilmesi gerekiyor.
  • Hata toleransı yok: Bilgi ihtiyacı tam ifade edilmek zorunda, yaklaşık sonuç alma olasılığı yok.

4 of 31

Vektör uzayı modeli (avantaj-dezavantaj)

  • Sorgu sonucu derecelendirilebiliyor.
  • Kosinüs ölçümüne göre her belgeye bir sorgu ile ilgili benzerlik değeri verilebiliyor.
  • Terim ağırlıklandırma ile sorgu sonucu elde edilen belgelerin kalitesini artırmak mümkün oluyor (yani daha başarılı bilgi erişim süreci).
  • Hızlı ve etkin bir model, hala popüler olarak kullanılıyor.
  • Terimleri birbirlerinden bağımsız görmesi dezavantajı (belgedeki kelimeler arası ilişkiler göz ardı ediliyor).

5 of 31

Olasılık sıralama prensibi (probability ranking principle)

  • Olasılığa dayalı etkin bir erişim modeli oluşturabilmek için:
    • Belgelerin “ilgililiğe” ne tür bir katkı yaptığını tahmin etmek isteriz.
    • Yani, bir belgenin ilgililik kararını verirken;
      • terim sıklığı,
      • belge sıklığı,
      • belge uzunluğu ve
      • hesaplanabilecek diğer istatistikleri

bilmek isteriz.

    • Bu noktada, olasılık sıralama prensibi şu sorunun yanıtını arar:
      • Bu istatistikler/veriler ne şekilde birleştirilsin ya da ne tür bir hesaplama yapılsın ki ilgililik olasılığı en iyi şekilde hesaplanabilsin?
    • Böylece,
      • yapılan bir sorgu ile elde edilecek sonuçlar içinde yer alacak, birbirine “benzer” belgeleri, ilgililiklerine (işe yararlılık ihtimallerine) göre azalan sırada dizmek mümkün olabilir.
    • Bilgi erişim çalışmalarında ortaya koyulan olasılık modellerinin hemen hemen tümü bu prensipten hareketle geliştirilmiştir.

6 of 31

Olasılık modelleri

  • Olasılık modellerinde, kullanıcı geribildirimi aracılığı ile sorgu terimlerinin ilgili belgelerde bulunabilme olasılıkları temel alınarak sorgu terimleri ağırlıklandırılır.
  • Bir belgenin bir sorgu sonucunda ilgili olarak değerlendirilip değerlendirilemeyeceği konusunda birçok model oluşturma teşebbüsü olmuştur.
  • Bu modeller, erişilen belgeleri ilgililik olasılığına göre sıralamayı amaçlar. Buna, «olasılık sıralama prensibi» (probability ranking principle) adı verilir.
  • Temeli, olasılığın doğru tahmin edilmesi ile ilgili bazı matematiksel formüllere dayanır.

Olasılık modelleri, temel olarak, İLGİLİLİK olasılıklarının tahmin edilmesine yönelik hesaplamaları gerçekleştirebilmek için şu soruyla hareket eder:

«Bir kullanıcı sisteme ti terimini kullanarak bir sorgu yöneltirse, derlemdeki Bj belgesinden memnun olma olasılığı nedir?»

7 of 31

Olasılık modelleri..

  • Bir kullanıcı kendi bilgi ihtiyacını kapsayan bazı özellikleri taşıyan Q sorgusunu sisteme yöneltti diyelim.
  • Farklı kullanıcıların aynı ifadeyi kullanarak sorgu yöneltmesi, onların başka kullanıcılarla aynı belgeyi ilgili olarak değerlendirecekleri anlamına gelmez.
  • Bilgi erişim sisteminin görevi, Q sorgusunu yönelten kullanıcıların sorguya karşılık gelecek olan her bir belgeyi ilgili olarak değerlendirip değerlendirmeyecekleri olasılığını hesaplamaktır.

Robertson, Maron & Cooper, 1982

8 of 31

..Olasılık modelleri

  • Belgelerin çok farklı özellikleri olabilir.
  • Bazı belgeler kullanıcıların aradığı her özelliği karşılıyor olabilirken, bazı belgeler ise kısmen karşılıyor ya da hiç karşılamıyor olabilir.
  • Sisteme sorgu yönelten kullanıcılar derlemde yer alan tüm belgeleri değerlendirse, bazıları (aynı özellikleri taşıyan) belgeleri ilgili bazıları ise ilgisiz olarak değerlendirebilir.
  • Bunun tam tersi de geçerlidir.
  • Bilgi erişim sisteminin işlevi, belgelerin aranılan belirli bir veya bir grup niteliğe göre ilgili olup olmama olasılığını hesaplamaktır.

Robertson, Maron & Cooper, 1982

9 of 31

..Olasılık modelleri - notasyon

  • Olasılıklar, öncelikli kullanım ya da ilgililik olasılığı temel alınarak tahmin edilebilir:
    • D = Sistemde var olan ve gelecekte var olacak olan tüm belgeler
    • Q = Halihazırda sisteme yöneltilmiş ve gelecekte yöneltilebilecek olan sorgular
    • x = benzer belgeler sınıfı
    • y = benzer sorgular sınıfı
    • (Di,Qj) = Bir belge-sorgu çifti
    • İlgililik (R) şöyle bir matematiksel ilişki ile temsil edilebilir:

Buna göre, Di belgesi Qj sorgusunu yönelten kullanıcı tarafından ilgili

olarak değerlendirilir.

10 of 31

D = Sistemde var olan ve gelecekte var olacak olan tüm belgeler

Q = Halihazırda sisteme yöneltilmiş ve gelecekte yöneltilecek olan sorgular

x = benzer belgeler sınıfı

y = benzer sorgular sınıf

(Di,Qj) = Bir belge-sorgu çifti

Probabilistic model seeks to answer this basic question:

What is the probability that this document is relevant to this query?

  • This model ranks documents in order of their relevance, thus answering the basic question above.
  • Therefore, here, retrieval is a ranking process.
  • Ranking gives user the control of how much material to look at, and thus he has the choice to deal only with more precise results.

Othman, 2009, p.39

11 of 31

..Olasılık modelleri (hedef)

  • Kullanıcılar, sorgu terimlerine dönüştürdükleri bilgi ihtiyaçları aracılığıyla sistemle ilişki kurar. Benzer şekilde sistemde, belge temsillerine (dizin terimlerine) dönüştürülmüş belgeler bulunmaktadır. Sistem, belgelerin bilgi ihtiyaçlarını ne kadar iyi karşıladığını bu iki temsile dayalı olarak, belirlemeye çalışır.
  • Bilgi erişim kapsamında yer alan Boole veya vektör uzayı modellerinde, eşleştirme, biçimsel olarak tanımlanmış ancak anlamsal olarak kesin olmayan dizin terimlerine yönelik hesaplamalar yapılarak gerçekleştirilir (bkz. 26 Nisan 2022 dersi: http://bby156.blogspot.com/2022/03/15-nisan-bilgi-erisim-kurallar-boole.html).
  • Bir bilgi erişim sisteminin, yalnızca kullanıcının girdiği bir sorgu formülasyonuna bakarak bilgi ihtiyacını net bir şekilde algılaması zordur.
  • Bir bilgi erişim sisteminin, sorgu ve belge gösterimlerine bir arada bakarak (örneğin benzerlik hesaplamaları vb.), bir belgenin bilgi ihtiyacıyla ilgili içeriğe sahip olup olmadığını «tahmin etmesi» zordur.
  • Olasılık teorisi, belirsizlik altında böyle bir muhakeme için ilkeli bir temel sağlar.

«»

«»

12 of 31

..Olasılık modelleri (avantaj-dezavantaj)

  • Avantaj
    • Güçlü teorik temellere dayanır.
    • Prensipte, var olan bilgi ile ilgili en iyi ilgililik tahminlerini sunacağı varsayılır.
    • Uygulama şekilleri vektör uzayı modeli ile benzerdir.
  • Dezavantaj
    • «İlgili» belgelerin hangileri olduğunun bilinmesi gerekir – ya da net olarak tahmin edilmeli.
    • İlgililiğin en temel göstergeleri terimler olmayabilir. Yine de çoğu zaman ilgililiğe yalnızca terimlere bakılarak karar verilebilir.
    • Eklenen yeni belgelerin ilgililik değerlendirmesinin de sürekli olarak yapılmasını gerektirir.

13 of 31

Vektör uzayı ve olasılık modelleri

  • Doğal dil ile yapılan sorguları destekler.
  • Belgelere ve sorgulara aynı şekilde davranır.
  • İlgililik geri bildirimi ile arama yapmayı destekler.
  • Sıralanmış sorgu sonuçları getirir.
  • Teorik temeller ile sıralamanın nasıl hesaplanacağı konusunda birbirinden farklılık gösterir.
    • Vektör uzayı modeli ilgililiği “varsayar”.
    • Olasılık modeli ilgililik değerlendirmeleri ya da tahminlerine yönelik hesaplamalara dayanır.

14 of 31

Bilgi erişim sistemlerinde sorgu modifikasyonları

Arama

İlgi alanı/profil

ve sorgular

Belgeler ve

Veriler

«Oyunun» kuralları =

Konu dizinlemesi için gerekli

kurallar

Thesaurus

Göndermeler

(Bkz., Ayr. Bkz., ..)

ve

Dizinleme dili

Depolama

Potansiyel İlgili

Belgeler

Kıyaslama /

Eşleştirme

Depo1: Profiller/

Sorgu istekleri

Depo2: Belge

Gösterimi

Dizinleme

(Tanımlayıcı – Konu)

Belirteçler aracılığı ile

sorgu fomülasyonu

Profillerin

depolanması

Belgelerin

depolanması

Bilgi Depolama ve Erişim Sistemi

Seçilen ilgili belgeler

15 of 31

Sorun:

  • Kullanıcılar mutlaka kendileri ile ilgili olmayan belgeleri de sonuç listesinde görüyor.
  • Ya da kullanıcıların her ilgili belgeyi sonuç listesinde görebilmeleri mümkün değil.
  • Bu, bilgi erişim sistemlerinin “mekanik” yapısının dezavantajı.
  • Yapılan çalışmalar gösteriyor ki, tek bir sorguya dayalı olarak sonuç listesi getirilmesindense sorguların birkaç aşamalı olarak modifiye edilmesi bilgi erişim sisteminin etkinliğini ve kullanıcı memnuniyetini artırıyor.

16 of 31

Sorgu modifikasyonu (query modification/reformulation)..

  • Neden sorgu modifikasyonu?
    • Kullanıcılar genellikle sorguları sonucunda bazı ilgili belgelere ulaşırlar ama sistemdeki “tüm” ilgili belgelere neredeyse asla ulaşamazlar.
    • Bu durum, çoğu kullanıcı için önemli değildir, ancak sistemdeki tüm ilgili belgelere erişmenin kritik önem taşıdığı durumlarda, kullanıcılar için daha fazla ilgili belgeye erişme imkanı nadiren vardır.

Soru: Bir sistemdeki tüm ilgili belgelere ulaşmak örneğin nasıl bir senaryoda kritik öneme sahip olabilir?

17 of 31

..Sorgu modifikasyonu (query modification/reformulation)..

  • Kullanıcılar her zaman sorgu modifikasyonuna ihtiyaç duyarlar (önceki haftalarda da belirttiğimiz gibi tek bir sorgu ile ihtiyaç duyulan belgelere ulaşmak çoğu zaman mümkün olmaz).
  • Kullanıcılar ilk seçenek olarak genellikle aramalarını “genişletirler” (expanding the search).
    • Örnek?
    • Bu iş için genelde ya aradıkları terimin kavramsal olarak daha geniş olanını (broader term) kullanarak yeniden bir Boole sorgusu oluştururlar ya da ilk sorguları sonucunda elde ettikleri sıralanmış sonuç listesinde daha aşağılara bakarlar.
    • Bu, çoğu zaman boşuna bir çabadır. Çünkü genişletilmiş terimleri kullanarak yapılan Boole sorgusu çok fazla ilgisiz sonucu da beraberinde getirecektir.
  • Kullanıcılar için ikinci seçenek, orijinal sorgularını değiştirmek olabilir.
    • Örnek sorgu:
      • => «indeks değeri belirleme yöntemi» / «madde analizi»
    • Bu da genellikle rastgele bir işlemdir çünkü kullanıcı muhtemelen bilgi ihtiyacı ile ilgili orijinal sorguyu ilk tasarlarken zaten en iyi performanslarını sergilemiştir ve dolayısı ile hangi değişikliği yapsalar daha iyi sonuç elde edecekleri belirsizdir.

Bu noktada sistem, kullanıcıya yardımcı olarak şekilde tasarlanmışsa sistem tarafından sorgu modifikasyonu devreye sokulur.

  • Sorgu modifikasyonu genelde ya sistem tarafından otomatik olarak yapılır ya da kullanıcı geri bildirimi alınarak gerçekleştirilir.

18 of 31

Sorgu modifikasyonu yöntemleri..

  • Yazım denetimi / düzeltmesi (spelling correction):

19 of 31

..Sorgu modifikasyonu yöntemleri..

  • Sorgu genişletme: (Query expansion / expanding the search)
    • Bu yöntemde sorgu terimlerine benzer terimler sistem tarafından (genellikle sistemdeki thesaurustan yararlanılarak) kullanıcıya önerilir.

20 of 31

..Sorgu modifikasyonu yöntemleri..

  • İlgililik geri bildirimi (relevance feedback)
    • Temel amaç: Var olan sorguyu kullanıcıdan gelen ilgililik değerlendirmelerine göre yeniden düzenlemek.
    • İki temel yaklaşım:
      • Otomatik (“uydurma” [psuedo] ilgililik geribildirimi)
        • «The basic assumption of PRF is that the top-ranked documents in the first retrieval result contain many useful terms that can help discriminate relevant documents from irrelevant ones.»
      • Kullanıcıların seçtiği ilgili belgeler
        • Ancak, kullanıcılardan talep edilen ilgililik geri bildirimi kullanıcıların çok tercih ettiği bir yöntem değil. Neden?
          • Arama sürecini uzatıyor.
          • Kullanıcılar sistemle etkileşime girme konusunda genellikle gönülsüz oluyor.

21 of 31

«Bike» sorugusu için kullanıcının seçtiği sonuçlar (yeşil ile işaretli)

Kullanıcının «ilgili» olarak işaretlediği sonuçların ardından gelen yeni sonuç listesi.

22 of 31

..Sorgu modifikasyonu yöntemleri..

  • İlgililik geri bildirimi (relevance feedback)
    • Sorunlar
      • Alternatif kullanım alanlarında çok fazla dikkate alınması gereken nokta var:
        • Örtük (implicit) / açık (explicit) değerlendirmeler.
          • Örtük: «Implicit feedback is inferred from user behavior, such as noting which documents they do and do not select for viewing, the duration of time spent viewing a document, or page browsing or scrolling actions.»
          • Açık: «Explicit feedback is obtained from assessors of relevance indicating the relevance of a document retrieved for a query. This type of feedback is defined as explicit only when the assessors (or other users of a system) know that the feedback provided is interpreted as relevance judgments. Users may indicate relevance explicitly using a binary or graded relevance system.»
        • Bireysel / grup değerlendirmeleri
        • Durağan / dinamik konu başlıkları
        • Değerlendirilen belgelerin benzerliği / değerlendirenlerin benzerliği

23 of 31

..Sorgu modifikasyonu yöntemleri..

  • Sosyal filtreleme (collaborative / social filtering)
    • Bu yapı, içeriği bir tarafa bırakıp yalnızca değerlendiricilerin benzer düşüncelerine bakar.
    • Beğenilere dayalı veriler söz konusu olduğunda sosyal filtreleme daha çok işe yarar.

24 of 31

..Sorgu modifikasyonu yöntemleri..

  • Sosyal filtreleme (collaborative / social filtering)
    • Bazı sosyal filtreleme yöntemleri
      • Kullanıcılar arasında tercihleri sizinkine benzer olanları bulma.
        • Örneğin: “Onların beğendiğini siz de beğenebilirsiniz.”
      • Sistemin arka planında kullanıcı hareketlerini izleme.
        • Örneğin: “Sistemde gerçekleştirdiği son işlemler, kullanıcıların gelecekte ne talep edeceğini tahmin etmek için kullanılabilir.”
      • Bir çok insanın ne yapmakta olduğunu tahmin etme.
        • Örneğin, “Belirli bir sayıda / sürede belirli bir içeriğe odaklanılmışsa benzer içerikler etkileşimi artırabilir.”

25 of 31

..Sorgu modifikasyonu yöntemleri..

  • Sosyal filtreleme (collaborative / social filtering)
    • “Ahmet bu makaleyi beğendiyse ben de beğenirim”
    • “Eğer Yıldız Savaşları’nı sevdiysen, Kurtuluş Günü’nü de seversin”
    • Bu örneklerde derecelendirme (rating), benzer insanlar tarafından yapılan sıralamalara dayanmaktadır.
      • Temel mantık: Sistemi halihazırda kullanan kullanıcılar gelecekteki kullanıcıların görüşlerini tahmin etmeyi sağlayabilir..

?

Benzerlik (similarity) hesaplaması

26 of 31

Örnek

.

27 of 31

Sosyal filtreleme yöntemi örneği: Ringo Collaborative Filtering

  • Kullanıcıların aktörler için beğenmemeden beğenmeye doğru giden puanlama sistemi ile sıralama yaptıklarını düşünelim. Buna göre puanlama;
    • 1= nefret ederim .. 4 = kararsızım .. 7= onsuz yaşayamam

olsun.

    • 4 puan civarında normal bir dağılım söz konusu olacaktır.
  • Ancak bu durumda uç noktalar daha önemlidir.
  • «En Yakın Komşu» Stratejisi (Nearest Neighbors Strategy)=> “Benzer puan vermiş kullanıcıları ve tahmini (ağırlıklandırılmış) ortalama kullanıcı puanlarını bul”
    • Pearson r algoritması: kullanıcı U ve kullanıcı J arasındaki korelasyon derecesine bakarak ağırlıklandırma
      • 1, iki kullanıcının görüşlerinin çok benzer olduğunu, 0, korelasyon olmadığını, -1 görüşler arasında benzeşme olmadığını gösterir

28 of 31

..Sorgu modifikasyonu yöntemleri

  • Öğrenebilir arayüzler:
    • Kullanıcı arayüzüne eklenen bazı uygulamalara (agents), bazı görevler atanır.
    • Makine öğrenme (machine learning) teknikleri kullanılarak bilgi erişim performansının artırılması amaçlanır.
      • Kullanıcı davranışları ve tercihleri takip edilir. Öneri sistemleri (recommendation systems) geliştirilir.
    • Şu durumlarda işe yarar:
    • Geçmiş davranışlar gelecekteki davranışların tahmin edilmesine yarar.
    • Çok farklı kullanıcı davranışı biçimlerini ortaya koyar.
    • Örnekler:
      • Posta düzenleyici: gelen postaları doğru klasörlere ya da posta kutularına gönderir
      • Takvim yöneticisi: toplantı zamanlarını otomatik olarak ayarlar

29 of 31

Örnek: Rank Dynamics (Surf Canyon)

  • «Discovering discovery»

http://www.c4lpt.co.uk/blog/2010/03/05/surf-canyon-wins-best-search-engine/

30 of 31

Sorgu modifikasyonu (query modification/reformulation) ~ ö z e t

  • Modifikasyon doğrudan ya da dolaylı kullanıcı girdisi ile yapılabilir.
  • Modifikasyon birey ya da grupların geçmiş girdileri temel alınarak yapılabilir.
  • Bir sorgu modifikasyonu yöntemi olan «ilgililik geribildirimi» kullanıcı güdümlü (user-directed) sorgu modifikasyonlarında daha etkilidir.

31 of 31

Okuma listesi

Tonta, Y. (1995). Bilgi erişim sistemleri. (http://yunus.hacettepe.edu.tr/~soydal/bby156_2013/3/BilgiErisimSistemleri_tonta1995.pdf)

Buckland, M. (1991). Information as thing. (http://people.ischool.berkeley.edu/~buckland/thing.html)

Tonta, Y., Bitirim, Y. ve Sever, H. (2002). Türkçe Arama Motorlarında Performans Değerlendirme. (Tam metin)

Manning, C.D., Raghavan, P. & Schütze, H. (2008). Principles of Information Retrieval.

* Relevance feedback and query expansion: http://nlp.stanford.edu/IR-book/html/htmledition/relevance-feedback-and-query-expansion-1.html

* Probabilistic information retrieval: http://nlp.stanford.edu/IR-book/html/htmledition/probabilistic-information-retrieval-1.html

Baeza-Yates, R. and Ribeiro-Neto, B. (1999). Modern Information Retrieval. (Tam metin)

Bu derste kullanılan slaytların çoğunluğu

Information organization and retrieval (R. Larson & W. Sack, 2001)

Bilgi erişim ilkeleri (Y. Tonta, 2002)

Bilgi erişim (G. Köse, 2012)

derslerine ait slaytlardan derlenmiştir.