choice
seçeneklerden biriWhich team should this support ticket go to?
orijinal dil: İngilizce- Billing0,50
- Technical0,32
- Refunds0,18
çizim #1
- Türkçe açıklama (çeviri)
- Bu destek bileti hangi ekibe gitsin? — Faturalama / Teknik / İade
Bağımsız rehber · 948 puanlanmış repo · 90 kaynak
TypeSafe AI'nin System One karar modeli: cümle kurmaz, seçenekler üzerinde olasılık döndürür.
Bu bilet hangi ekibe gitsin?
Sohbet modeli→ cümle
Bu bilet büyük olasılıkla faturalama ekibine gitmeli, çünkü müşteri iki kez ücretlendirildiğini yazıyor…
Jev→ dağılım
0,71eşiği geçti → kod devam eder
※Bu site TypeSafe AI ile bağlantılı değildir. Bağımsız ve kaynaklı bir araştırmadır; ürün satmaz, API anahtarı istemez, Jev'i çağırmaz.
01 — Nasıl çalışır
Serbest metin değil: bir state ve "Bu bilet hangi ekibe gitsin?" artı üç seçenek. Üç soru tipi var — choice (255 seçeneğe kadar), score (sıralı basamaklar), noul (evet/hayır). Jev yalnız bu kalıbı kabul eder.
Cevap yok, gerekçe yok, cümle yok. Her seçeneğe bir olasılık; toplamları 1,00. Aynı soru bir sonraki çağrıda birkaç puan oynayabilir.
Bir eşik koyarsın. En yüksek olasılık eşiği aşıyorsa akış devam eder; düz bir dağılımsa insana ya da büyük modele devredilir. Jev hakem değil, kapıdır.
02 — 30 saniye
Jev metin yazmaz: bir state ve tipli bir soru alır, her seçeneğe bir olasılık verir.
Which team should this support ticket go to?
orijinal dil: İngilizceçizim #1
How frustrated is the customer?
orijinal dil: İngilizceçizim #1
Does the customer need a reply today?
orijinal dil: İngilizceçizim #1
Şematik örnek — ölçüm değil. Örnekler orijinal dilinde (İngilizce) bırakıldı; çeviri soruyu değiştirir. Bu sayfa Jev'i çağırmaz; kartlarda canlı bir istek yoktur.
Karşılaştırma
Jev yalnız tipli bir karar döndürür; diğerleri metin üretir. Bu yüzden kaliteyi değil, 1.000 kısa kararın maliyetini, hızını ve teknik sınırlarını karşılaştırıyoruz.
Seçim, skor veya olasılık dağılımı döndürür. Cümle kurmaz.
Sohbet eder, özetler ve yazar; karar işi promptla yaptırılır.
Kısa olan daha ucuz. 300 girdi + 5 çıktı token'lık 1.000 çağrı, liste fiyatından. log ölçek
Veri tarihi: . Kaynaklar ve yöntem ayrıntılı tabloda.
03 — Bulgular
Her madde ve hüküm etiketi FINDINGS.md'deki bölümüne bağlı. Tam tablo: FINDINGS.md ↗
Birincil kaynak ya da belgelenmiş API'ye karşı tekrarlanabilir bir çağrı.
Üreticinin söylediği doğru; bağımsız olarak doğrulanmış değil.
Bağımsız kanıt bu iddiayla çelişiyor ya da onu sınırlıyor.
04 — Kullanım
Tek bir ölçeğe karşı puanlanan açık GitHub depolarının kesiti. Sayılar depodaki STATS bloğundan gelir.
Veri kaynağı: README.md · data/stats.json · veri tarihi
05 — Desenler
En az iki depoda görülen tasarım kalıpları. Karttaki sayı, o desene kanıt olarak bağlanan depo sayısıdır. PATTERNS.md ↗
Kaydır, sürükle ya da ok tuşlarını kullan.
06 — Testler
Her kart bir kaynağın kendi bildirdiği sonuçtur; henüz hiçbirini yeniden koşmadık.
Prompt-injection tespiti
Bildirilen sayı
Bizim sayımız
henüz koşulmadı
Zafiyetli kodun eşli sıralanması
Bildirilen sayı
Bizim sayımız
henüz koşulmadı
Dört görev tipi: yönlendirme, evet/hayır, puanlama, belirsizlik
Bildirilen sayı
Bizim sayımız
henüz koşulmadı
Kalibrasyon: belirtilen olasılık gerçek orana uyuyor mu?
Bildirilen sayı
Bizim sayımız
henüz koşulmadı
Temsil ve ifade biçiminin en-iyi-hamle isabetine etkisi
Bildirilen sayı
Bizim sayımız
henüz koşulmadı
win if you can, otherwise blockörnek girdi · question phrasing21 kaynağın bildirdiği · 21 kayıt. Buradaki her sayı kaynağında aynen görülmüştür.
07 — Sorulmayacaklar
Bu liste bizim değil, üreticinin kendi zayıflık listesi ("model jaggedness"). Sonuç yine bir olasılık dağılımı olur — anlamsız bir tane. [kaynak]
Anahtarını üçüncü taraf bir siteye yapıştırma.Bu site dahil — zaten hiçbir yerinde anahtar istemiyoruz. Bazı Jev siteleri anahtarı kendi sunucusundan geçiriyor; "sunucudan geçer" ile "asla saklanmaz" aynı söz değil. [kaynak]
08 — Yöntem
Her sayının nasıl üretildiği ve nereye kadar güvenilebileceği: METHODOLOGY.md ↗
90 kaynak
Birincil kaynaklar tek tek kaydedilir.
948 repo
Yazılı ölçek: 5 eksen × 0–3.
353 repo
Bir denetçi puanları yeniden okur.
2026-09-21 veri tarihi
Veri açık depoda, tarihiyle yayımlanır.
0 / 21 test
Testler orijinal dilinde yeniden koşulacak.
Puanlar bir dil modelinin yazılı ölçeğe göre yargısıdır; benchmark değildir.
Depoların README'si ve üstverisi okundu; kod satır satır incelenmedi.
Yıldız, takipçi ve görüntülenme sayısı hiçbir puana girmez.
İlk kesit tek güne aittir; her satır puanlandığı tarihi taşır.