Jev ve Laya Türkçe müşteri mesajını doğru ayırıyor mu? 200 mesajla ölçtük
Ekip yönlendirme, hakaret tespiti ve güven eşiği: sayılar, hatalar ve sınırlar.
Neyi merak ettik
Eylülün ortasında TypeSafe, Jev adında bir model yayımladı. Jev sohbet etmiyor, metin de yazmıyor. Ona bir metin ve bir soru veriyorsunuz; o da seçeneklerden birini, bir puanı ya da evet-hayır olasılığını döndürüyor. Birkaç gün sonra Convai Innovations aynı işi yapan açık kaynak bir model çıkardı: Laya.
İki modelin belgesinde de ana dilin İngilizce olduğu yazıyor. Türkçe bir pazaryeri mesajını ne kadar doğru okuduklarını sayıyla görmek istedik.
Nasıl denedik
200 pazaryeri müşteri mesajını kendimiz yazdık ve her birini elle etiketledik. Gerçek müşteri verisi kullanmadık. Mesajlar altı konuya dağılıyor: iade, kargo, ürün sorusu, hasarlı ürün, fatura ve teşekkür. 21 mesajda hakaret var.
63 mesajı bilerek zor seçtik. Bir kısmı Türkçe karakter kullanılmadan yazıldı (“kargom hala gelmedi bekliyom”), bir kısmı deyimle anlatıyor (“Beklemekten ağaç oldum”), bir kısmı da iki konuyu birden taşıyor (“Kargo biraz gecikti ama ürün o kadar güzel ki affettim”).
Her mesaja tek seferde üç soru sorduk: hangi ekibe gitmeli, kargo şikayeti var mı, hakaret var mı. Soruları bir kez Türkçe, bir kez İngilizce yazdık. Mesajın kendisi iki durumda da Türkçe kaldı.
Sonuç
| Jev | Laya | |
|---|---|---|
| Doğru ekibe yönlendirme | %95 | %66 |
| Zor mesajlarda doğru yönlendirme | %89 | %56 |
| 21 hakaretten yakalanan | 20 | 5 |
| Temiz mesajı hakaret sayma | 0 | 1 |
| Mesaj başına süre | yaklaşık 330 ms, internet üzerinden | yaklaşık 41 ms, kendi ekran kartımızda |
Jev ile yapılan 400 isteğin toplam maliyeti 0,009 dolar oldu. Laya'yı kendi bilgisayarımızda çalıştırdığımız için ayrı bir ücreti olmadı.
Emin olmadığında ne oluyor
Jev her cevabın yanında bir güven değeri de veriyor. Güveni belli bir eşiğin altında kalan mesajları insana bırakıp kalanların ne kadar doğru ayrıldığına baktık.
| Güven eşiği | Kendisi ayırdı | Ayırdıklarında doğru |
|---|---|---|
| Eşik yok | %100 | %95,0 |
| 0,5 | %98,0 | %96,4 |
| 0,7 | %95,0 | %98,4 |
| 0,9 | %89,5 | %99,4 |
0,7 eşiğinde mesajların yüzde 95'ini kendisi ayırıyor ve bunların yüzde 98'i doğru çıkıyor. Kararsız kaldığı yüzde 5'i ise okumanız için ayrı tutuyor.
Jev nerede yanıldı
Türkçe talimatla 200 mesajda 10 hata yaptı. Çoğu iki yöne okunabilen mesajlardı. “İade ettiğim ürün için iade faturası kesmem gerekiyor mu?” hem iade hem fatura sayılabilir. Bu tür mesajlarda güveni zaten düşüktü, yani eşik bunları insana bırakıyor.
Emin olarak yaptığı üç hata aynı kalıbı paylaşıyor: mesajda başka bir ekibin kelimesi geçiyor. “Yorumlarda kırık geldi diyenler var, paketleme sağlam mı?” satın almadan önce sorulmuş bir ürün sorusu. Jev “kırık” kelimesine bakıp hasarlı ürün dedi.
Laya'da dikkat edilecek şey
Laya'nın hakaret sorusundaki doğruluğu ilk bakışta yüzde 91 görünüyor. Oysa 21 hakaretin yalnızca 5'ini yakaladı. Mesajların çoğu temiz olduğu için her şeye “yok” demek de yüksek doğruluk veriyor. Bu yüzden tabloya oranı değil, yakalanan sayıyı yazdık.
Laya'da talimatı İngilizce yazmak ekip doğruluğunu yüzde 66'dan 69'a çıkardı. Jev'de iki dil arasında fark çıkmadı.
Sınırlar
- Mesajları biz yazdık. Gerçek müşteri mesajları daha dağınık olabilir.
- Her konuda 33 civarı örnek var. Tek bir konunun sonucu birkaç puan oynayabilir.
- Jev'in 1.13.0 sürümünü ölçtük. Model güncellenirse sonuç değişebilir.
- Laya'yı hiç eğitmeden, olduğu gibi kullandık. Türkçe veriyle eğitilirse fark kapanabilir.
Bununla ne yaptık
Bu sonuçla Çözümce'de ücretsiz bir araç açtık. Mesajları ve yorumları yapıştırıyorsunuz; her birinin konusu, hakaret içerip içermediği ve emin olunmayan satırlar ayrı ayrı çıkıyor. Araç cevap yazmıyor, önce hangi mesaja bakmanız gerektiğini gösteriyor.
Denemek isterseniz
Araç sitede ücretsiz ve kayıt gerektirmeden çalışıyor: Yorum ve Mesaj Ayırıcı. Sayfadaki “Örnek mesajlar” düğmesiyle kendi mesajınızı yapıştırmadan da deneyebilirsiniz. Ne yaptığını, sınırlarını ve verinizin nereye gittiğini araç tanıtım sayfasında anlattık.
Daha fazlası için Destekçi (aylık 149 TL, günde 500 satır, reklamsız) ve Ticari (aylık 1.490 TL, günde 10.000 satır) paketleri var; paket, satın alınca gelen lisans anahtarıyla aracın sayfasında açılır.
Kaynaklar
Alıntı
Bahsedilen
- Jev - TypeSafe AI'ın metin yazmak yerine seçim, puan ve evet-hayır olasılığı döndüren karar modeli.
- Laya - Convai Innovations'ın Apache 2.0 lisanslı açık kaynak karar modeli.
- TypeSafe AI - Jev modelini geliştiren yapay zeka şirketi.
Temel Alınan Çalışma
- Belirtilmemiş