A feladatcím és a csoportleírás közötti koszinusz-hasonlóság nem osztályozó.

Benchmark, esetek, nyers ítéletek: backend/bench/categorization a TODOforAI repóban. Teljes költség ~$0.50.

Felállás

A TODOforAI táblákon csoportok vannak (SEO, Paid, Frontend…); az új feladatok kapnak egy javasolt csoportot. V1: beágyazom a címet, valamint a csoport nevét + leírását, a legnagyobb koszinusz-hasonlóságú csoport nyer. Embedder: Qwen/Qwen3-Embedding-4B DeepInfrán keresztül, 512 dimenzió, egységnormájúra normalizálva, lekérdezési utasítás: “Given a task, retrieve the workstream whose purpose best matches the task”. Tartózkodik, ha a legjobb < 0.50, vagy a második helyezettel a különbség < 0.06.

100%-os precizitás 18 kézzel összeállított teszteseten. A valódi táblám nagy része Unsorted-ban maradt.

Bírák

Ugyanaz a 138 cím, ugyanaz a 8 csoport, ugyanaz a leírásszöveg, példafeladatok nélkül — pontosan az, amit az éles rendszer lát. A címek valódi todókhoz hasonlóak: rövidek, fele magyar, 15 értelmetlen (call mom, asdf), 5 kétértelmű.

  • embedding — az éles verzió, változatlanul
  • jev — TypeSafe Jev, nem autoregresszív döntési modell a Vercel AI Gateway-en. Egy choice kérdés, 8 csoport + none. $0.04/MTok bemenet, a kimenet ingyenes.
  • sonnet — Claude Sonnet 4.6, temp 0, egy slug vagy none
  • opus — Claude Opus 5, ugyanaz a prompt. Az igazság. Az én címkéim csak még egy vélemény.

Csapda: az Opus 5 válasz előtt gondolkodik; a max_tokens: 20 mellett úgy tűnt, mintha 88/138 esetben tartózkodna. Adj neki 400-at.

Számok

Bíróegyezik az Opusszalrossz csoportkihagyott138 feladat
embedding77/138160/1128 s
jev130/13853/11224 s
sonnet 4.6131/13870/11257 s

Az Opus 112-t sorolt be, 26-ra none-t mondott (15 értelmetlen + 11 homályos). Embedding: egyszer tévedett, 54%-ot kihagyott. Jev: 97% besorolva, 5 rossz. A Sonnet 7 eltérő besorolásánál nem egyértelmű, neki vagy az Opusnak van-e igaza. A valódi táblámon a Jev és az Opus 21/26-ban egyezik.

Miért tartózkodik az embedding

Nem a különbségi küszöb miatt:

                         agree   wrong   missed
margin 0.06  floor 0.50    76      2       60     ← production
margin 0     floor 0.50    79     41       18
margin 0     floor 0       76     62        0

Ha elhagyod a küszöbfeltételt, az eddig Unsortedban maradó feladatok rossz csoportba kerülnek. A top-1 a feladatok ~45%-ánál téves.

bun test flaky on CI          frontend 0.540   development 0.537
call mom                      email 0.540      plg 0.525
asdf                          development 0.663  frontend 0.659

A pontszámok 0.42–0.72 között mozognak; az asdf többet kap, mint egy valódi feladat, így semmilyen alsó küszöb nem szűri ki az értelmetlent. A Frontend/Development, Paid/SEO, Enterprise/Paid átfed, ezért a valódi feladatok bármilyen különbségi küszöbön belülre esnek. A Jev és az LLM-ek értik a kívánt eredményt: egy CI-hiba azért Development, mert a kijavításával elért eredmény ennek a csoportnak a céljához illik. A hasonlóság ezt nem tudja megmondani.

Mi ment élesbe

A Jev sorol be; az embedding a tartalék, ha a gateway nincs beállítva vagy nem elérhető. 25-ös kötegekben dolgozik, a none külön válaszlehetőség, és ≥ 0,5-ös valószínűségnél fogadjuk el a besorolást. ~0.3 s feladatonként.

Nem Sonnet: 57 s a 24 s helyett és ~100-szoros ár, egy olyan javaslatért, ami 400 ms-mal azután jön, hogy abbahagyod a gépelést.

Router1000 feladatra1M feladatra
embedding (~15 tok, $0.01/MTok)$0.0002$0.15
jev (kérdésenként ~260 tokenes katalógus, $0.04/MTok bemenet, kimenet ingyenes)$0.01$10
sonnet 4.6 (~350 be / 10 ki)$1.20$1,200
opus 5 (~350 be / ~200 ki gondolkodással)$7$7,000

Listaárak, 8 csoport. A Jev ~70-szer annyiba kerül, mint az embedding, és kétszer annyit sorol be.

A Jev öt hibája a csatorna és az eredmény összekeveréséből adódik (sponsor a newsletter, measure signups → email, nem paid). Tévedéskor alacsonyabb a magabiztosság (0.70 vs 0.94), de a 0.6-os küszöb 2 rossz helyett 7 Unsortedet ad. Maradunk az 5-nél.

Tanulságok

  • A precizitás önmagában hazudik. Jelenítsd meg a recallt valamihez képest, amiben megbízol.
  • Erős modellhez mérj, ne a saját címkéidhez.
  • Ellenőrizd a referencia kimeneti keretét. A csonkolt válasz óvatosnak látszik.

A 138 eset kevés. Elég ahhoz, hogy látsszon az 54%-os recall-rés; csak ennyit állítok.