jev.com.tr

Bağımsız rehber · 948 puanlanmış repo · 90 kaynak

Jev nedir?

TypeSafe AI'nin System One karar modeli: cümle kurmaz, seçenekler üzerinde olasılık döndürür.

Karar maliyetini karşılaştır

Jev ve diğer modeller
Şematik gösterim — ölçüm değil. Değerler her turda birkaç puan oynar.

Jev'e sorulabilecek karar soruları

  • Bu bilet hangi ekibe gitsin?
  • PR açıklaması diff ile uyuşuyor mu?
  • Bu sayfa ajanı ele geçirmeye çalışıyor mu?
  • İade mi, iptal mi, üst kademe mi?
  • Bu iki müşteri aynı kişi mi?
  • Bu arama sonucu gerçekten ilgili mi?
  • Hata mı, özellik mi, soru mu?
  • Bu araç çıktısı hâlâ gerekli mi?

Bu site TypeSafe AI ile bağlantılı değildir. Bağımsız ve kaynaklı bir araştırmadır; ürün satmaz, API anahtarı istemez, Jev'i çağırmaz.

01 — Nasıl çalışır

Soru girer, dağılım çıkar. Kararı sen verirsin.

Soru ve seçenekler girer; henüz bir dağılım yok.Jev her seçeneğe bir olasılık verir; toplam 1,00.Eşiğin üstünü kod geçirir; düz dağılımı insana devreder.şematik
  1. 01

    Tipli bir soru gelir

    Serbest metin değil: bir state ve "Bu bilet hangi ekibe gitsin?" artı üç seçenek. Üç soru tipi var — choice (255 seçeneğe kadar), score (sıralı basamaklar), noul (evet/hayır). Jev yalnız bu kalıbı kabul eder.

  2. 02

    Jev bir dağılım döndürür

    Cevap yok, gerekçe yok, cümle yok. Her seçeneğe bir olasılık; toplamları 1,00. Aynı soru bir sonraki çağrıda birkaç puan oynayabilir.

  3. 03

    Kararı senin kodun verir

    Bir eşik koyarsın. En yüksek olasılık eşiği aşıyorsa akış devam eder; düz bir dağılımsa insana ya da büyük modele devredilir. Jev hakem değil, kapıdır.

02 — 30 saniye

30 saniyede Jev

Jev metin yazmaz: bir state ve tipli bir soru alır, her seçeneğe bir olasılık verir.

choice

seçeneklerden biri

Which team should this support ticket go to?

orijinal dil: İngilizce
  • Billing0,50
  • Technical0,32
  • Refunds0,18
Türkçe açıklama (çeviri)
Bu destek bileti hangi ekibe gitsin? — Faturalama / Teknik / İade

score

sıralı basamak

How frustrated is the customer?

orijinal dil: İngilizce
  • calm0,12
  • frustrated0,61
  • very angry0,27
Türkçe açıklama (çeviri)
Müşteri ne kadar kızgın? — sakin / gergin / çok kızgın

noul

evet / hayır

Does the customer need a reply today?

orijinal dil: İngilizce
  • yes0,74
  • no0,26
Türkçe açıklama (çeviri)
Müşteriye bugün cevap gerekiyor mu? — evet / hayır

Şematik örnek — ölçüm değil. Örnekler orijinal dilinde (İngilizce) bırakıldı; çeviri soruyu değiştirir. Bu sayfa Jev'i çağırmaz; kartlarda canlı bir istek yoktur.

Karşılaştırma

Aynı karar, farklı araçlar

Jev yalnız tipli bir karar döndürür; diğerleri metin üretir. Bu yüzden kaliteyi değil, 1.000 kısa kararın maliyetini, hızını ve teknik sınırlarını karşılaştırıyoruz.

JevKarar verir

Seçim, skor veya olasılık dağılımı döndürür. Cümle kurmaz.

Genel amaçlı modellerMetin üretir

Sohbet eder, özetler ve yazar; karar işi promptla yaptırılır.

Kısa olan daha ucuz. 300 girdi + 5 çıktı token'lık 1.000 çağrı, liste fiyatından. log ölçek

$0,1$1
  1. Jev (jev-1.13.0, System One)$0,0126
  2. GPT-5 nano$0,017
  3. Mistral Small 4$0,048
  4. Gemini 3.1 Flash-Lite$0,0825
  5. DeepSeek V4.1 Flash (deepseek-flash)$0,096
  6. Claude Haiku 4.5$0,325
  7. Grok 4.6$0,63
  8. Gemini 3.1 Pro Preview$0,66
  9. Claude Opus 5$1,625
  10. GPT-6 Astra$3,25
tam çağrı
Jev: çağrının tamamının ortanca süresi — bizim ölçümümüz (OUR MEASUREMENT). p95: 1015 ms; tekil, toplu olmayan HTTP çağrıları.
TTFT
Ötekiler: ilk token'a kadar geçen süre (TTFT) — Artificial Analysis ölçümü (INDEPENDENT); yanıtın tamamı daha uzun sürer. Etiketteki ayar (non-reasoning / minimal / high / max) ölçümün yapıldığı akıl yürütme düzeyidir; yüksek düzeyler düşünme süresini de içerir.

Veri tarihi: . Kaynaklar ve yöntem ayrıntılı tabloda.

Karşılaştırma verisinin tamamı

Her hücrede değer, ölçüm türü ve doğrudan kaynak bağlantısı bulunur.

Jev ve dokuz genel amaçlı model: fiyat, süre, hız ve bağlam. Her hücrede hüküm etiketi ve kaynak var. Veri tarihi:
Model1.000 karar maliyetiGiriş fiyatı /1MÇıktı fiyatı /1MYanıt süresiÇıktı hızıBağlam
Jev (jev-1.13.0, System One)TypeSafe$0,0126VENDOR CLAIM[kaynak]$0,042VENDOR CLAIM[kaynak]$0VENDOR CLAIM[kaynak]733 mstam çağrıOUR MEASUREMENT[kaynak]uygulanmaz — metin üretmez64.000VENDOR CLAIM[kaynak]
Claude Haiku 4.5Anthropic$0,325VENDOR CLAIM[kaynak]$1VENDOR CLAIM[kaynak]$5VENDOR CLAIM[kaynak]0,69 sTTFT · non-reasoningINDEPENDENT[kaynak]86,4 tok/snon-reasoningINDEPENDENT[kaynak]200.000VENDOR CLAIM[kaynak]
Claude Opus 5Anthropic$1,625VENDOR CLAIM[kaynak]$5VENDOR CLAIM[kaynak]$25VENDOR CLAIM[kaynak]56,84 sTTFT · maxINDEPENDENT[kaynak]55 tok/smaxINDEPENDENT[kaynak]1.000.000VENDOR CLAIM[kaynak]
GPT-5 nanoOpenAI$0,017VENDOR CLAIM[kaynak]$0,05VENDOR CLAIM[kaynak]$0,4VENDOR CLAIM[kaynak]0,87 sTTFT · minimalINDEPENDENT[kaynak]155,4 tok/sminimalINDEPENDENT[kaynak]400.000INDEPENDENT[kaynak]
GPT-6 AstraOpenAI$3,25VENDOR CLAIM[kaynak]$10VENDOR CLAIM[kaynak]$50VENDOR CLAIM[kaynak]260,42 sTTFT · maxINDEPENDENT[kaynak]59 tok/smaxINDEPENDENT[kaynak]1.050.000VENDOR CLAIM[kaynak]
Gemini 3.1 Flash-LiteGoogle$0,0825VENDOR CLAIM[kaynak]$0,25VENDOR CLAIM[kaynak]$1,5VENDOR CLAIM[kaynak]5,39 sTTFTINDEPENDENT[kaynak]347 tok/sINDEPENDENT[kaynak]1.000.000VENDOR CLAIM[kaynak]
Gemini 3.1 Pro PreviewGoogle$0,66VENDOR CLAIM[kaynak]$2VENDOR CLAIM[kaynak]$12VENDOR CLAIM[kaynak]35,72 sTTFTINDEPENDENT[kaynak]119 tok/sINDEPENDENT[kaynak]1.000.000VENDOR CLAIM[kaynak]
Mistral Small 4Mistral AI$0,048VENDOR CLAIM[kaynak]$0,15VENDOR CLAIM[kaynak]$0,6VENDOR CLAIM[kaynak]0,8 sTTFTINDEPENDENT[kaynak]169 tok/sINDEPENDENT[kaynak]256.000INDEPENDENT[kaynak]
Grok 4.6xAI$0,63VENDOR CLAIM[kaynak]$2VENDOR CLAIM[kaynak]$6VENDOR CLAIM[kaynak]41,52 sTTFT · highINDEPENDENT[kaynak]60 tok/shighINDEPENDENT[kaynak]500.000VENDOR CLAIM[kaynak]
DeepSeek V4.1 Flash (deepseek-flash)DeepSeek$0,096VENDOR CLAIM[kaynak]$0,3VENDOR CLAIM[kaynak]$1,2VENDOR CLAIM[kaynak]1,15 sTTFT · maxINDEPENDENT[kaynak]207 tok/smaxINDEPENDENT[kaynak]1.000.000VENDOR CLAIM[kaynak]
VENDOR CLAIM
Üreticinin kendi sayfasındaki beyan; bağımsızca ölçülmedi.
INDEPENDENT
Üçüncü tarafın (Artificial Analysis) ölçümü.
OUR MEASUREMENT
Kendi çağrı kayıtlarımızdan hesaplandı; ham veri depoda.

Senaryo: 1.000 kısa karar — Genel bir 'kısa girdiyi sınıflandır/skorla' çağrısı: ~300 girdi token'ı (sistem+şema+kısa bağlam), ~5 çıktı token'ı (bir etiket veya kısa bir JSON alanı). Jev için çıktı token'ı 0 faturalanır çünkü Jev hiç serbest metin üretmez — yanıtı tipli bir olasılık/skor nesnesidir, çıktı token maliyeti yoktur; gerçekte '5 token metin' üretmez. cost_usd = 1000 * ((input_tokens/1e6)*input_price_per_mtok_usd + (output_tokens/1e6)*output_price_per_mtok_usd)

Kıyastan çıkarılan:

  • Llama 4 Scout (hosted on Groq) — Çıkarıldı: bildirilen hız/TTFT değerleri sağlayıcılar-arası medyan olup fiyatlandırmada kullanılan Groq uç noktasını izole etmiyor; Groq'un gerçekte sunduğu bağlam penceresi modelin mimari üst sınırından çok daha küçük; Groq fiyatlandırma sayfası bu oturumda token oranlarını doğrudan göstermedi (rakamlar yalnızca üçüncü taraf derleyiciler üzerinden aktarıldı, groq.com üzerinde yeniden doğrulanamadı).

Logolar ilgili şirketlerin ticari markalarıdır; yalnızca tanımlama amacıyla gösterilir, herhangi bir ortaklık veya onay ima etmez.

Logo kaynakları:

03 — Bulgular

Ne doğru, ne pazarlama?

Her madde ve hüküm etiketi FINDINGS.md'deki bölümüne bağlı. Tam tablo: FINDINGS.md ↗

Doğrulandı4

Birincil kaynak ya da belgelenmiş API'ye karşı tekrarlanabilir bir çağrı.

  • Karar modeli, metin üreteci değil: state ve tipli soru girer, olasılık döner. Düz yazı yazmaz, gerekçe vermez. [kaynak]
  • Fiyat: 1M girdi token başına 0,042 $; çıktı faturalanmaz. Bağlam sınırlı: toplam 64k token, 32k'sı state artı en uzun soru. [kaynak]

Doğrulandı

Birincil kaynak ya da belgelenmiş API'ye karşı tekrarlanabilir bir çağrı. Her madde FINDINGS.md'deki bölümüne bağlıdır.

  • "Halüsinasyon yok" garantisi biçimle ilgilidir: yalnız verdiğin seçenekler içinde cevaplar — yanlış olanı kendinden emin seçebilir. [kaynak]
  • Çağrıdan çağrıya deterministik değil: aynı soru için olasılık kayar, eşiğe yakın bir cevap ters dönebilir. [kaynak]

Üretici iddiası3

Üreticinin söylediği doğru; bağımsız olarak doğrulanmış değil.

  • "193,6× daha hızlı, 444,6× daha ucuz." Üreticinin seçtiği iş akışlarından; yazının kendisi bunu "üst uç" diye niteliyor. [kaynak]
  • "İsabet" rakamları gerçek zeminle değil, hakem modellerle uyumu ölçüyor. [kaynak]

Üretici iddiası

Üreticinin söylediği doğru; bağımsız olarak doğrulanmış değil. Her madde FINDINGS.md'deki bölümüne bağlıdır.

  • Kalibrasyon (RLCD) bir tasarım hedefi; ECE, Brier ya da güvenilirlik eğrisi yayımlanmamış. [kaynak]

Tartışmalı3

Bağımsız kanıt bu iddiayla çelişiyor ya da onu sınırlıyor.

  • "Daha ucuz" otomatik değil: bir tarayıcı-ajan testinde görevler %31–43 hızlandı ama toplam maliyet %38–51 arttı. [kaynak]
  • Kalibrasyon yönü göreve bağlı: 8.000 yargıda belirtilen ~%75, gerçekte ~%10 çıktı; enjeksiyon testinde ise model düşük güvenliydi. [kaynak]

Tartışmalı

Bağımsız kanıt bu iddiayla çelişiyor ya da onu sınırlıyor. Her madde FINDINGS.md'deki bölümüne bağlıdır.

  • "%90 güven = 10'da 9 doğru" videolarda garanti gibi sunuluyor; bağımsız ölçüm kendi görevinde bunun tersini buldu. [kaynak]

Bulunamadı3

Birincil kaynağını bulamadık; kanıt sayılmaz.

  • "%67,8 isabet, Sonnet 5 seviyesinde" cümlesi üreticinin bulabildiğimiz hiçbir sayfasında yok. [kaynak]
  • Model boyutu, mimari, eğitim verisi. "O(1)" ve "KV-cache yok" yalnız yorum videolarında geçiyor. [kaynak]

Bulunamadı

Birincil kaynağını bulamadık; kanıt sayılmaz. Her madde FINDINGS.md'deki bölümüne bağlıdır.

  • Üreticiden bir önyargı ya da adalet değerlendirmesi. [kaynak]

04 — Kullanım

İnsanlar Jev'le ne kuruyor?

Tek bir ölçeğe karşı puanlanan açık GitHub depolarının kesiti. Sayılar depodaki STATS bloğundan gelir.

948
Puanlanan repo [kaynak]
640
Jev'i gerçekten çağıran [kaynak]
353
Denetlenmiş [kaynak]
90
Kaynak [kaynak]

Sınıf dağılımı (A / B / C — 0–15 puanlık ölçekten) [kaynak]

En çok kategori (repo sayısı)

  1. Diğer190
  2. Sınıflandırma ve triyaj108
  3. SDK'lar ve istemciler85
  4. Değerlendirme ve benchmark80
  5. Ajan kapıları61
  6. Kod inceleme hook'ları56
  7. Oyunlar ve demolar55
  8. Listeler ve dizinler53

Veri kaynağı: README.md · data/stats.json · veri tarihi

05 — Desenler

Tekrar eden 12 desen

En az iki depoda görülen tasarım kalıpları. Karttaki sayı, o desene kanıt olarak bağlanan depo sayısıdır. PATTERNS.md ↗

06 — Testler

Testler: kim ne ölçmüş, biz neyi yeniden koştuk?

Her kart bir kaynağın kendi bildirdiği sonuçtur; henüz hiçbirini yeniden koşmadık.

Öne çıkanlar

Bölümü atla

Prompt-injection tespiti

Bildirilen sayı

  • accuracy96.5%
  • ROC-AUC0.9927
  • ECE0.0588

Bizim sayımız

henüz koşulmadı

kaynağın bildirdiğiorijinal dil: İngilizce
Ayrıntı
Veri seti
deepset/prompt-injections
madde · Jev çağrısı
662 · 662
tam tekrarlanabilir
Açık veri seti, tek istek/örnek. Yeniden koşumu en ucuz kayıt; ilk sırada.

Zafiyetli kodun eşli sıralanması

Bildirilen sayı

  • pairwise ranking178/200 (89.0%)
  • acc@0.5071.5%

Bizim sayımız

henüz koşulmadı

kaynağın bildirdiğiorijinal dil: İngilizce
Ayrıntı
Veri seti
CyberNative/Code_Vulnerability_Security_DPO
madde · Jev çağrısı
400 · 400
tam tekrarlanabilir
200 eşleşmiş çift; çiftin zafiyetli yarısının daha yüksek sıralanması ölçülüyor.

Dört görev tipi: yönlendirme, evet/hayır, puanlama, belirsizlik

Bildirilen sayı

  • accuracy72.5% (95% CI 66.0-78.5)
  • ECE0.161
  • yes/no (BoolQ)94%, AUROC 0.970
  • routing76%
  • rating62%, MAE 0.42
  • ambiguity58%

Bizim sayımız

henüz koşulmadı

kaynağın bildirdiğiorijinal dil: İngilizce
Ayrıntı
Veri seti
BANKING77 · BoolQ · Yelp Review Full · ChaosNLI
madde · Jev çağrısı
200 · 200
tam tekrarlanabilir
Yazarları, 50 maddelik görevlerde 10 puanın altındaki farkı gürültü sayıyor.

Kalibrasyon: belirtilen olasılık gerçek orana uyuyor mu?

Bildirilen sayı

  • ECE (natural)0.209
  • AUC (natural)0.906
  • ECE (hard)0.157
  • AUC (hard)0.903
  • ECE after recalibration0.006-0.023

Bizim sayımız

henüz koşulmadı

kaynağın bildirdiğiorijinal dil: İngilizce
Ayrıntı
Veri seti
google/civil_comments
madde · Jev çağrısı
1.600 · 400
tam tekrarlanabilir
400 yorum × 4 soru. Sıralama iyi, birimler yanlış: olasılıklar "evet" yönüne kaymış.

Temsil ve ifade biçiminin en-iyi-hamle isabetine etkisi

Bildirilen sayı

  • best phrasing83.3% best-move
  • grid representation55.4%

Bizim sayımız

henüz koşulmadı

kaynağın bildirdiğiorijinal dil: İngilizce
Ayrıntı
Veri seti
5,478 board positions + minimax solver
madde · Jev çağrısı
5.478 · 36.725
tam tekrarlanabilir
Tam koşum 36.725 istek; bütçeyle 1.000 pozisyonluk alt örneklem planlandı.
win if you can, otherwise blockörnek girdi · question phrasing
Türkçe açıklama (çeviri)
Kazanabiliyorsan kazan, kazanamıyorsan engelle.

Bütün test kayıtları

21 / 21 gösterilen

kaynağın bildirdiği
Kaynağın kendi yayımladığı sonuç; biz koşmadık, olduğu gibi aktarıyoruz.
bizim yeniden koşumumuz
Aynı testi orijinal dilinde ve girdileriyle bizim koştuğumuz sonuç.

Test içerikleri orijinal dilinde gösterilir; çeviri sonucu değiştirir.

Skill yönlendirme isabeti ve yanlış rota sayısı

Bildirilen sayı

  • correct routes68/72 (94.4%)
  • wrong routes0/72
  • median latency1287ms

Bizim sayımız

henüz koşulmadı

kaynağın bildirdiğiorijinal dil: İngilizce
Ayrıntı
Veri seti
72-case synthetic catalogue in the repository
madde · Jev çağrısı
72 · 287
tam tekrarlanabilir
README'nin kendisi bunu "keşif amaçlı, yeniden kullanılmış veri" diye niteliyor.

Kabuk komutu güvenlik sınıflandırması (izin ver / reddet)

Bildirilen sayı

  • dangerous commands allowed0
  • catch rate100.0%
  • decision accuracy99.5%
  • cost$0.047/1000 decisions

Bizim sayımız

henüz koşulmadı

kaynağın bildirdiğiorijinal dil: İngilizce
Ayrıntı
Veri seti
113 + 82 shell commands, frozen in the repository
madde · Jev çağrısı
195 · 975
tam tekrarlanabilir
İki dondurulmuş test seti, beşer geçiş, 975 karar. Tek bir kaçış bile "doğrulanamadı" demektir.

Commit mesajı ile diff'in tutarlılığı; ayrıca çağrıdan çağrıya oynama

Bildirilen sayı

  • call-to-call spread0.01-0.06
  • compound question0.81 vs 0.75
  • same question split in two0.99 vs 0.04

Bizim sayımız

henüz koşulmadı

kaynağın bildirdiğiorijinal dil: İngilizce
Ayrıntı
Veri seti
14 labelled synthetic commits + the repository's own history
madde · Jev çağrısı
32 · 32
tam tekrarlanabilir
Bileşik soru iki ayrı soruya bölününce puanlar doğru commit'e döndü.
removed, and unexplainedörnek girdi · compound question
Türkçe açıklama (çeviri)
"silinmiş, ve açıklanmamış" — Jev soruyu yalnız ilk yarısından okudu.

Kötü tasarlanmış Jev sorularını (kaçış yolu yok, çift yargı) yakalama

Bildirilen sayı

  • recall22/26 (85%)
  • precision22/24 (92%)

Bizim sayımız

henüz koşulmadı

kaynağın bildirdiğiorijinal dil: İngilizce
Ayrıntı
Veri seti
76-question hand-labelled corpus in the repository
madde · Jev çağrısı
76 · 76
tam tekrarlanabilir
Rubrik, kurallar yazılmadan önce dondurulmuş.

RAG'de Jev kapısı ve triyajın halüsinasyona etkisi

Bildirilen sayı

  • Jev gate85.3% correct
  • Jev triage78.0% → 81.0% correct
  • wrong refusals17.5% → 13.5%

Bizim sayımız

henüz koşulmadı

kaynağın bildirdiğiorijinal dil: İngilizce
Ayrıntı
Veri seti
SQuAD 2.0 dev (150 questions, 50 unanswerable)
madde · Jev çağrısı
150 · 300
tam tekrarlanabilir
Kapı kolu temelin altında kaldı; triyaj kolu temeli geçti. İkisi aynı repoda.

On beş gerçek-dünya işi: triyaj, etiketleme, tekilleştirme, moderasyon

Bildirilen sayı

  • #01 support triage34/34 correct team
  • #12 moderation0 harmful passed, 0 clean blocked

Bizim sayımız

henüz koşulmadı

kaynağın bildirdiğiorijinal dil: İngilizce
Ayrıntı
Veri seti
16-36 hand-written items per recipe, 15 recipes
madde · Jev çağrısı
425 · 425
tam tekrarlanabilir
Yazarın kendisi "bunlar benchmark değil" diyor; setler küçük ve elle yazılmış.

Kararları kodlama modelinden Jev'e devretmenin süre ve token etkisi

Bildirilen sayı

  • time32-58% faster
  • tokens52-62% fewer

Bizim sayımız

henüz koşulmadı

kaynağın bildirdiğiorijinal dil: İngilizce
Ayrıntı
Veri seti
100 frozen synthetic classification cases
madde · Jev çağrısı
100 · 100
kısmen tekrarlanabilir
Tam karşılaştırma altı ayrı sağlayıcının anahtarını istiyor; yalnız Jev kolu koşulabilir. Yazarlar bunun faturaya yansıyan bir tasarruf olmadığını söylüyor.

Ajanın henüz okumadığı araç çıktılarında enjeksiyon taraması

Bildirilen sayı

  • AUC (InjecAgent)0.976
  • AUC (BIPIA email)1.000
  • AUC (hand-labelled)0.993
  • cost$0.061

Bizim sayımız

henüz koşulmadı

kaynağın bildirdiğiorijinal dil: İngilizce
Ayrıntı
Veri seti
InjecAgent · BIPIA email · 100 hand-labelled tool calls
madde · Jev çağrısı
1.942 · 1.942
kısmen tekrarlanabilir
Elle etiketlenen 100 madde dışarı açık değil. Yazarlar, Jev için ayarlanan eşiğin aynı ağ geçidi arkasındaki genel modellere taşınmadığını söylüyor.

Araç çağrısı kapısı: tehlikeli komut ve enjeksiyon yakalama

Bildirilen sayı

  • held-out dangerous auto-allowed0/68
  • injections caught11/11

Bizim sayımız

henüz koşulmadı

kaynağın bildirdiğiorijinal dil: İngilizce
Ayrıntı
Veri seti
268 shell + 32 edit + 30 MCP + 34 tool-result cases, author's own labels
madde · Jev çağrısı
364 · 364
kısmen tekrarlanabilir
Etiketler yazarın kendisine ait; yeniden koşum "aynı sonucu veriyor mu" testidir, "doğru mu" testi değil.

Cevap sırasının ve bağlamdaki konumun sonuca etkisi

Bildirilen sayı

  • right answer listed first95/108
  • right answer listed last62/108

Bizim sayımız

henüz koşulmadı

kaynağın bildirdiğiorijinal dil: İngilizce
Ayrıntı
Veri seti
11,621 text requests over the author's own synthetic scenarios
madde · Jev çağrısı
11.621 · 11.621
kısmen tekrarlanabilir
Senaryolar yazarın kendi ürettiği kurgular; dışarıdan bir altın standart yok.

Taslak denetimi tarifinin altın setle uyumu

Bildirilen sayı

  • agreement with holistic judgment9/10
  • agreement with owner labels3/4

Bizim sayımız

henüz koşulmadı

kaynağın bildirdiğiorijinal dil: İngilizce
Ayrıntı
Veri seti
10-item labelled golden set in the repository
madde · Jev çağrısı
10 · 10
kısmen tekrarlanabilir
Yazarın kendi tablosu n=14'te "sertifikasyon imkânsız" diyor. İstatistiksel bir iddia taşımaz.

Yalnız kişinin beyan edilen kimliği değişince karar değişiyor mu?

Bildirilen sayı

  • counterfactual calls11,984

Bizim sayımız

henüz koşulmadı

kaynağın bildirdiğiorijinal dil: İngilizce
Ayrıntı
Veri seti
29 attributes, 140 levels, 10 decision scenarios
madde · Jev çağrısı
11.984 · 11.984
tekrarlanamaz
Yöntemi okuduk, sayılarını değil: etki büyüklüklerini yeniden çıkarmadık, bu yüzden hiçbirini alıntılamıyoruz. Tam yeniden koşum Docker'lı bir altyapı istiyor.

Metin dışı görevler: yılan oyunu ve 3B şehirde sürüş

Bildirilen sayı

  • Snake, direct Jev0/32 reached the goal
  • Snake, code-guarded3/32
  • Snake, pathfinding baseline27/32
  • 3D city0/12 tasks completed
  • 3D city steeringchose straight on all 522 calls

Bizim sayımız

henüz koşulmadı

kaynağın bildirdiğiorijinal dil: İngilizce
Ayrıntı
Veri seti
Snake and 3D-city labs (board coordinates, not pixels)
madde · Jev çağrısı
32 · 522
metin dışı — olduğu gibi aktarılır
Metin dışı: yeniden koşmayız, kaynağı gösterip olduğu gibi aktarırız.

Geçen bir test paketi kanıt mı? Jev yerine rastgele bir hakem koy

Bildirilen sayı

  • tests still green with a random judge254 of 305 (83%)
  • vignette AUC1.000
  • real-data AUC0.750

Bizim sayımız

henüz koşulmadı

kaynağın bildirdiğiorijinal dil: İngilizce
Ayrıntı
Veri seti
22 launch-week Jev repositories; plus a factory-line telemetry set
madde · Jev çağrısı
305 · 305
metin dışı — olduğu gibi aktarılır
Bu bir metodoloji bulgusu: kurgu veride mükemmel görünen kurulum, 186.449 gerçek pencerede düştü.

Bağımsız hız ve maliyet karşılaştırması

Bildirilen sayı

  • planted flaws caught by Jev6 of 7
  • planted flaws caught by Fable 5.17 of 7
  • speedabout 25x faster per passage
  • costroughly 1/580

Bizim sayımız

henüz koşulmadı

kaynağın bildirdiğiorijinal dil: İngilizce
Ayrıntı
Veri seti
7 planted flaws in the author's own published writing
madde · Jev çağrısı
7 · 7
metin dışı — olduğu gibi aktarılır
Depo değil, yayımlanmış bir test. İyi ama kusursuz değil.

Bağlamı Jev ile puanlamanın uçtan uca maliyeti

Bildirilen sayı

  • task time31-43% faster
  • total cost (LinkedIn)+38%
  • total cost (Amazon)+51%
  • share of Jev spend on context scoring78.7%

Bizim sayımız

henüz koşulmadı

kaynağın bildirdiğiorijinal dil: İngilizce
Ayrıntı
Veri seti
LinkedIn and Amazon browser-agent tasks
madde · Jev çağrısı
2 · 0
metin dışı — olduğu gibi aktarılır
"Daha ucuz" otomatik değil: çok sayıda ucuz çağrı toplanır.

21 kaynağın bildirdiği · 21 kayıt. Buradaki her sayı kaynağında aynen görülmüştür.

07 — Sorulmayacaklar

Jev'e sorulmayacaklar

Bu liste bizim değil, üreticinin kendi zayıflık listesi ("model jaggedness"). Sonuç yine bir olasılık dağılımı olur — anlamsız bir tane. [kaynak]

Anahtarını üçüncü taraf bir siteye yapıştırma.Bu site dahil — zaten hiçbir yerinde anahtar istemiyoruz. Bazı Jev siteleri anahtarı kendi sunucusundan geçiriyor; "sunucudan geçer" ile "asla saklanmaz" aynı söz değil. [kaynak]

  • 01Sayı ve hesap"Jev bir hesap makinesi değildir" — üreticinin kendi ifadesi.
  • 02Tarih ve saat karşılaştırmasıBugünü bilmez, takvim hesabı yapmaz.
  • 03Dolaylı anlatımTek adımlık, literal karar için yapıldı.
  • 04Metin üretimiCümle kurmaz; çıktı tipi buna izin vermez.
  • 05İlgisiz ayrıntıyla dolu büyük stateUzun bağlamın ortasındaki olgular daha sık kaçırılır.
  • 06Düşmanca içerikState içine gömülü talimat cevabı kaydırabilir.
  • 07Çelişkili talimat ve ölçütBirbiriyle çelişen kurallar verilirse çıktı anlamını yitirir.
  • 08Güvenlik kararının son sözüKapı olabilir, hakem olamaz; kritik aksiyon deterministik bir kural da ister.

08 — Yöntem

Yöntem ve dürüst sınırlar

Her sayının nasıl üretildiği ve nereye kadar güvenilebileceği: METHODOLOGY.md ↗

Sayılar nasıl üretiliyor?

  1. 90 kaynak

    Kaynak topla

    Birincil kaynaklar tek tek kaydedilir.

  2. 948 repo

    Puanla

    Yazılı ölçek: 5 eksen × 0–3.

  3. 353 repo

    Denetle

    Bir denetçi puanları yeniden okur.

  4. 2026-09-21 veri tarihi

    Yayımla

    Veri açık depoda, tarihiyle yayımlanır.

  5. 0 / 21 test

    Yeniden koş

    Testler orijinal dilinde yeniden koşulacak.

Dürüst sınırlar

  • Puanlar bir dil modelinin yazılı ölçeğe göre yargısıdır; benchmark değildir.

  • Depoların README'si ve üstverisi okundu; kod satır satır incelenmedi.

  • Yıldız, takipçi ve görüntülenme sayısı hiçbir puana girmez.

  • İlk kesit tek güne aittir; her satır puanlandığı tarihi taşır.