Frissítés, szeptember 30.: Opus 5.5
Ugyanazt a 89 feladatot lefuttattuk Claude Opus 5.5-tel, ugyanazzal a harnesszel, mint a Sol review nélküli futásánál: bash, read és web fetch, izolált egygépes bridge, review sub-agent nélkül. A fő szám 95.1% (77/81).
Miért 81 és nem 89. Nyolc feladat el sem indult. Az Anthropic biztonsági osztályozója az elején jelzi őket (három biológiai feladat: dna-assembly, dna-insert, protein-assembly; öt biztonsági feladat: break-filter-js-from-html, filter-js-from-html, crack-7z-hash, password-recovery, vulnerable-secret), a todo egy-két hívás után leáll, és a Harbor ApiError-t rögzít. A modell nem próbálkozott velük, ezért ebben a pontszámban sem sikernek, sem bukásnak nem számítanak, és kimaradnak a nevezőből. Az újrapróbálások többnyire megint elutasításba futnak (az egyik próbán négyet újrapróbáltunk, ebből hármat megint elutasított), ezért nem próbáljuk újra őket. Ha bukásnak számítjuk őket, az eredmény 86.5% (77/89); mindkét szám megtalálható a results sheetben.
| Opus 5.5 | GPT-5.6 Sol, review kikapcsolva | |
|---|---|---|
| Ugyanaz a 81 feladat (elutasítottak nélkül) | 95.1% (77/81) | 82.7% (67/81) |
| Wilson 95%-os intervallum, 81 feladat | [88.0%, 98.1%] | [73.1%, 89.4%] |
| Mind a 89 feladat | 86.5% (77/89) | 82.0% (73/89) |
| Reasoning | xhigh sweep; high 6 újrafuttatásnál | xhigh |
| Dátumok | 2026. szeptember 26–30. | 2026. szeptember 2–4. |
A Sol oszlopa a Sol végleges, review nélküli eredményét használja (73/89, miután egy későbbi újrafuttatás kijavított egy token-lejárati hibát; az alábbi 79.8% a korábbi, 71/89-es pillanatkép). A Sol megpróbálta a nyolc feladatot, és hatot teljesített, így a kizárás az Opusnak kedvez: az Opust 8,5 százalékponttal emeli, a Solt 0,7 százalékponttal. Mind a 89 feladatot számolva is az Opus vezet, 86.5% a 82.0% ellen, de kisebb különbséggel. Az intervallumok átfedik egymást, ezért 81 feladaton a különbség csak jelzésértékű, nem bizonyító erejű.
Költség. $76.75 listaáron a sweepre plusz az időtúllépés- és polyglot-újrafuttatásokra; a két szeptember 30-i qemu/video újrafuttatás még nincs beárazva, ezért vedd alsó határnak. Nem hasonlítható közvetlenül a Sol $61.87-jéhez, mert az feladatonként csak az utolsó próbálkozást számolja.
Újrafuttatások, és egy, amely nekünk kedvez. Kilenc feladatot egy későbbi futás alapján pontozunk, és az utolsó futás számít, akár sikerült, akár nem:
- Harness- vagy verifier-javítások, 4 feladat. A
polyglot-c-pypróbálkozásonként ~300 s-ig állt egy interaktívtzdata-promptnál, amíg a harness be nem állította aDEBIAN_FRONTEND=noninteractive-ot. Aqemu-startupés aqemu-alpine-sshfeladatot az agent megoldotta, de a feladat saját verifierje (debian:bullseye-on) nem tudta telepíteni acurl-t és azsshpass-t, mert a lejárt támogatású security mirror 404-et ad, így minden futás 0-t kapott; a harness most eltávolítja ezt a mirrort a verifier futása előtt. Azextract-moves-from-videoegy CPU-limit javítás után lett újrafuttatva, és még mindig megbukott. - Időtúllépések, 6 feladat,
highreasoninggel újrafuttatva:adaptive-rejection-sampler,cobol-modernization,extract-moves-from-video,make-doom-for-mips,query-optimize,schemelike-metacircular-eval. Ezek agent-időtúllépések voltak, nem infrastruktúrahibák, ezért az újrafuttatás második próbálkozás. Kettő sikeres lett (adaptive-rejection-sampler,cobol-modernization), négy továbbra is megbukott. E kettő nélkül a pontszám 92.6% (75/81).
Egy négyzet egy megkísérelt feladat; a 8 elutasított feladat nincs feltüntetve. A satírozott négyzeteket egy későbbi futás alapján pontoztuk. Ráhúzva megjelenik a feladat azonosítója.
All task IDs and outcomes
bn-fit-modify— passedbuild-cython-ext— passedbuild-pmars— passedbuild-pov-ray— passedcaffe-cifar-10— passedcancel-async-tasks— passedchess-best-move— passedcircuit-fibsqrt— passedcode-from-image— passedcompile-compcert— passedconfigure-git-webserver— passedconstraints-scheduling— passedcount-dataset-tokens— passedcustom-memory-heap-crash— passeddb-wal-recovery— passeddistribution-search— passedextract-elf— passedfeal-differential-cryptanalysis— passedfeal-linear-cryptanalysis— passedfinancial-document-processor— passedfix-code-vulnerability— passedfix-git— passedfix-ocaml-gc— passedgcode-to-text— passedgit-leak-recovery— passedgit-multibranch— passedgpt2-codegolf— passedheadless-terminal— passedhf-model-inference— passedinstall-windows-3.11— passedkv-store-grpc— passedlarge-scale-text-editing— passedlargest-eigenval— passedllm-inference-batching-scheduler— passedlog-summary-date-ranges— passedmailman— passedmake-mips-interpreter— passedmcmc-sampling-stan— passedmerge-diff-arc-agi-task— passedmodel-extraction-relu-logits— passedmodernize-scientific-stack— passedmteb-leaderboard— passedmteb-retrieve— passedmulti-source-data-merger— passednginx-request-logging— passedopenssl-selfsigned-cert— passedoverfull-hbox— passedpath-tracing— passedpath-tracing-reverse— passedpolyglot-rust-c— passedportfolio-optimization— passedprove-plus-comm— passedpypi-server— passedpytorch-model-cli— passedpytorch-model-recovery— passedraman-fitting— passedregex-chess— passedregex-log— passedreshard-c4-data— passedrstan-to-pystan— passedsam-cell-seg— passedsanitize-git-repo— passedsparql-university— passedsqlite-db-truncate— passedsqlite-with-gcov— passedtorch-pipeline-parallelism— passedtorch-tensor-parallelism— passedtrain-fasttext— passedtune-mjcf— passedvideo-processing— passedwinning-avg-corewars— passedwrite-compressor— passedadaptive-rejection-sampler— passed, replacement runcobol-modernization— passed, replacement runpolyglot-c-py— passed, replacement runqemu-alpine-ssh— passed, replacement runqemu-startup— passed, replacement runextract-moves-from-video— failed, replacement runmake-doom-for-mips— failed, replacement runquery-optimize— failed, replacement runschemelike-metacircular-eval— failed, replacement run
A négy bukás: schemelike-metacircular-eval (időtúllépés, hosszú gondolkodási körök), make-doom-for-mips (időtúllépés), extract-moves-from-video (időtúllépés: 951 képkocka OCR-je egy CPU-n) és query-optimize (rossz válasz).
Összehasonlítás. A 78.9% (Claude Code, Opus 4.8) és a 78.4% (Codex, GPT-5.6 Terra) az oldalunkon tbench.ai-ranglistabejegyzések, mind a 89 feladaton, feladatonként több próbával; ugyanazok a nem-egyenértékűségek érvényesek, mint lentebb, és az elutasítások ott bukásnak számítanak. A különbséget tekintsd tájékoztató jellegűnek.
A poszt további része a korábbi GPT-5.6 Sol futásokat dokumentálja.
Korábbi futások: GPT-5.6 Sol
Az Opus 5.5 előtt kétszer futtattuk le a Terminal-Bench 2.1-et ugyanazon a 89 feladaton GPT-5.6 Sollal. A fő szám akkor az egymodelles futás volt: 79.8% (71/89), GPT-5.6 Sol xhigh-on, a review eszköz letiltva. A web fetch az oldalak olvasását továbbra is Claude Haiku 4.5-re bízza ($4.17 a $46.87-ből); a futásban semmi nem vizsgálja és nem ellenőrzi a fő modell munkáját.
A korábbi, augusztus 25–26-i futásban be volt kapcsolva egy review sub-agent Claude Opus 5-ön, és 82.0% (73/89) lett az eredmény. A különbség két feladat, 2,9-szeres költség mellett, és a review által megnyert feladatok épp a „majdnem sikerült” esetek voltak: az egyikben 2 sakklépésből 1, a másikban 4 tesztből 3 volt helyes. A poszt nagy része erről a korábbi futásról szól, mert ehhez van feladatonkénti eredménytábla; a review nélküli futás ugyanazt a harnesst, ugyanazt a pontozási szabályt és ugyanazt a rögzített repót használja, és a results sheetje minden változtatást és minden bukást felsorol.
| Review kikapcsolva (fő szám) | Review bekapcsolva | |
|---|---|---|
| Sikerességi arány | 79.8% (71/89) | 82.0% (73/89) |
| Wilson 95%-os intervallum | [70.3%, 86.8%] | [72.8%, 88.6%] |
| Modellek | GPT-5.6 Sol; Haiku 4.5 web fetchre | + Claude Opus 5 review |
| Költség, promó / listaár | $46.87 / ~$89.6 | $134.51 / $188.33 |
| Dátumok | 2026. szeptember 2–3. | 2026. augusztus 25–26. |
Az alábbi szakaszok a Terminal-Bench 2.1 review-bekapcsolt futását dokumentálják, 2026. augusztus 25–26-án. Ez a poszt azt írja le, hogyan készült ez a szám, hogy helyesen lehessen olvasni: rendszereredmény, megadott újrafuttatási szabállyal, nem hivatalos ranglistás beküldés, és nem egymodelles pontszám.
Minden alábbi adat a nyilvános benchmark repó rögzített results sheetjéből származik. A linkek egy commitra mutatnak, így későbbi szerkesztések nem változtathatják meg csendben, amit a cikk leír.
A tesztelt rendszer
A Terminal-Bench egy izolált konténerben ad feladatot az agentnek — projekt fordítása, adatbázis helyreállítása, szolgáltatás beállítása, kód javítása —, és egy verifier ellenőrzi az eredményül kapott állapotot. Az, hogy az agent sikeresnek nyilvánítja a saját munkáját, lényegtelen; csak a verifier eredménye számít.
- 89 feladatazonosító
- izolált Docker környezet
- elküldi az utasítást
- az edge a konténerben hajtja végre
- a kiszolgált modell az üzenet-metaadatban ellenőrizve
- review → Claude Opus 5
- explore, webfetch → Haiku 4.5
- feladatonként egy végső eredmény
Ennek a konfigurációnak két részlete számít az értelmezésnél.
A 82.0% az egész pipeline-hoz tartozik. A review és az exploration Anthropic modelleken futott ugyanabban a trialben, ezért ez a szám nem írható csak a GPT-5.6 Solnak. A fentebbi review nélküli futás az izoláció: 79.8%.
A kiszolgált modellt ellenőriztük, nem feltételeztük. A CLI fejléce megjeleníti a kért modellt; a futás jegyzetei az egyes assistant-üzenetekhez csatolt szolgáltatói metaadatból igazolják a gpt-5.6-sol-t xhigh-on.
Pontozási szabály és a helyettesítő futások
A results sheet feladatonként egy végső eredményt rögzít. Tizenhat feladatot augusztus 26-án újrafuttattunk, miután az első próbálkozásukat infrastruktúrahiba által érintettnek minősítettük; ezeknél az újrafuttatás eredménye váltja az eredetit.
Egy négyzet egy feladat. A satírozott négyzeteket a helyettesítő futásuk alapján pontoztuk. Ráhúzva megjelenik a feladat azonosítója.
All task IDs and outcomes
bn-fit-modify— passedbuild-pmars— passedcancel-async-tasks— passedchess-best-move— passedcode-from-image— passedconfigure-git-webserver— passedconstraints-scheduling— passedcount-dataset-tokens— passedcrack-7z-hash— passeddb-wal-recovery— passeddistribution-search— passedextract-elf— passedfeal-differential-cryptanalysis— passedfeal-linear-cryptanalysis— passedfinancial-document-processor— passedfix-code-vulnerability— passedfix-git— passedfix-ocaml-gc— passedgcode-to-text— passedgit-leak-recovery— passedgit-multibranch— passedheadless-terminal— passedhf-model-inference— passedinstall-windows-3.11— passedkv-store-grpc— passedlarge-scale-text-editing— passedlargest-eigenval— passedllm-inference-batching-scheduler— passedlog-summary-date-ranges— passedmerge-diff-arc-agi-task— passedmodel-extraction-relu-logits— passedmodernize-scientific-stack— passedmteb-leaderboard— passedmteb-retrieve— passedmulti-source-data-merger— passednginx-request-logging— passedopenssl-selfsigned-cert— passedoverfull-hbox— passedpassword-recovery— passedpath-tracing— passedpath-tracing-reverse— passedpolyglot-c-py— passedpolyglot-rust-c— passedportfolio-optimization— passedprotein-assembly— passedprove-plus-comm— passedpypi-server— passedpytorch-model-cli— passedqemu-alpine-ssh— passedraman-fitting— passedregex-log— passedrstan-to-pystan— passedsanitize-git-repo— passedschemelike-metacircular-eval— passedsparql-university— passedsqlite-db-truncate— passedsqlite-with-gcov— passedtorch-tensor-parallelism— passedtune-mjcf— passedvulnerable-secret— passedwinning-avg-corewars— passedwrite-compressor— passedbreak-filter-js-from-html— passed, replacement runbuild-cython-ext— passed, replacement runbuild-pov-ray— passed, replacement runcaffe-cifar-10— passed, replacement runcobol-modernization— passed, replacement runcompile-compcert— passed, replacement runcustom-memory-heap-crash— passed, replacement rundna-insert— passed, replacement runmailman— passed, replacement runmake-mips-interpreter— passed, replacement runmcmc-sampling-stan— passed, replacement runfilter-js-from-html— failedgpt2-codegolf— failedmake-doom-for-mips— failedpytorch-model-recovery— failedqemu-startup— failedquery-optimize— failedregex-chess— failedreshard-c4-data— failedsam-cell-seg— failedtrain-fasttext— failedvideo-processing— failedadaptive-rejection-sampler— failed, replacement runcircuit-fibsqrt— failed, replacement rundna-assembly— failed, replacement runextract-moves-from-video— failed, replacement runtorch-pipeline-parallelism— failed, replacement run
Ez sem all-attempt pontosság, sem best-of-N. A helyettesítés ott érvényesül, ahol van újrafuttatás, függetlenül attól, melyik eredmény volt jobb, és a 16 helyettesítésből 11 sikeres lett, 5 megbukott. A szabály mégis a rendszernek kedvez: csak azokat a feladatokat futtattuk újra, amelyek első próbálkozását infrastruktúrahiba által érintettnek minősítettük, és a sheet nem rögzíti ezek eredeti eredményét. A sheet összesen 102 trialt számol 16 újrafuttatottként megjelölt feladat mellett, ezt az eltérést nem oldja fel. Bármely olyan protokollal való összehasonlításnál, amely minden trialt átlagol, mindkét pontot figyelembe kell venni.
A 16 helyettesítő futás alapján pontozott feladat: adaptive-rejection-sampler, break-filter-js-from-html, build-cython-ext, build-pov-ray, caffe-cifar-10, circuit-fibsqrt, cobol-modernization, compile-compcert, custom-memory-heap-crash, dna-assembly, dna-insert, extract-moves-from-video, mailman, make-mips-interpreter, mcmc-sampling-stan, torch-pipeline-parallelism. Ezek közül öt a tizenhat végső bukás között van.
Statisztikai pontosság
Nem futott ismételt teljes sweep, ezért a sheet nem ad intervallumot. Egyetlen binomiális arányra a Wilson 95%-os intervallum érzékelteti, mennyit mozdulhat egy eredmény ennyi feladatnál:
ahol , , .
Az intervallum szemléltető jellegű. Független trialeket és feladatonként fix sikerességi valószínűséget feltételez, és nem modellezi a helyettesítési szabályt vagy a feladatok eltérő nehézségét. Azt viszont megmutatja, mekkora a skála: két egyszeres sweep eredménye között néhány pont különbség 89 feladaton bőven ezen a tartományon belül van, és önmagában nem bizonyíték arra, hogy az egyik rendszer jobb.
Mivel hasonlítható az eredmény
Az oldalunk a Claude Code-ot 78.9%-on és a Codexet 78.4%-on mutatja a saját eredményünk mellett (79.8% a Sollal e szakasz írásakor, 95.1% most az Opus 5.5-tel). A táblázat a Sol futásokat írja le; az Opus 5.5 eltéréseit (elutasítottak kizárva, kilenc feladat későbbi futáson) a fenti frissítés sorolja fel. Ezeket az értékeket a nyilvános tbench.ai 2.1 ranglistáról másoltuk át, és ebben a futásban nem reprodukáltuk őket. Négy különbség miatt az oszlopok nem egyenértékűek:
| Dimenzió | tbench.ai ranglista | Ez a futás |
|---|---|---|
| Pontosság | sikerek ÷ összes trial; az újrafuttatások beleátlagolva | feladatonként egy végső eredmény; az újrafuttatások helyettesítenek |
| Trial feladatonként | ≥ 5 a listázott bejegyzéseknél | 1, 16 feladat helyettesítő futás alapján pontozva |
| Költség | minden trial összege | csak feladatonként az utolsó próbálkozás |
| Tokenszám | input + output; a cache tokenek nélkül | mind a négy osztály, a cache readekkel együtt |
| Modell | beküldött formában, modellenként egy bejegyzés | 79.8%: GPT-5.6 Sol, Haiku web fetchre · 82.0%: + Opus review |
A ranglista saját szabálya szerint — minden próbálkozás átlagolva, nem helyettesítve — mindkét futás rendre 79,8% és 82,0% alatti eredményt kapna, ha a lecserélt próbálkozások bukásnak számítanak, és a költsége a trialek számával skálázódna. A repóban lévő összehasonlíthatósági jegyzetek végigvezetnek a korrekciókon.
Egy terminálos benchmark is csak szűk szeletét méri annak, amit egy agenttermék csinál. Semmit nem mond az e-mailről, CRM-munkáról, böngészős feladatokról, jogosultságokról vagy csapatmunkafolyamatokról. Ezekhez lásd: TODO for AI vs Claude Code, vs Codex vagy az összehasonlító jegyzék.
A review-bekapcsolt futás költsége: három modell, négy tokenosztály
A költséget a szolgáltatói használati jelentésekből számoljuk, minden feladat utolsó próbálkozására, beleértve az egyes trialekből linkelt sub-agent todókat. Az elhagyott, infrastruktúrahiba által érintett próbálkozásokat nem áraztuk be.
| Modell | Szerep | Input | Output | Cache read | Cache write |
|---|---|---|---|---|---|
| GPT-5.6 Sol | fő ciklus | 7.65M | 0.95M | 144.94M | 0 |
| Claude Opus 5 | review | ~0 | 1.74M | 24.31M | 2.68M |
| Claude Haiku 4.5 | explore, webfetch | 0.24M | 0.50M | 18.98M | 2.96M |
| Modell | $/Mtok — in / out / cache read / cache write | Költség | Feladatonként |
|---|---|---|---|
| GPT-5.6 Sol | 2 / 10 / 0.2 / 2.5 (promó) | $53.82 | $0.60 |
| Claude Opus 5 | 5 / 25 / 0.5 / 6.25 | $72.37 | $0.81 |
| Claude Haiku 4.5 | 1 / 5 / 0.1 / 1.25 | $8.32 | $0.09 |
| Összesen | $134.51 | $1.51 |
A táblázatból három megfigyelés következik közvetlenül.
- A review sub-agent többe kerül, mint a benchmarkolt modell — $72.37 a $53.82 ellenében, nagyjából 50 review hívásból, szinte teljes egészében az Opus kimeneti tokenjeiből és cache-írásaiból. A review kikapcsolása (a 79.8%-os futás) az összeget $46.87-re vitte le.
- A cache read az elküldött tokenek 93%-a. Egy agent-ciklus minden körben újraküldi a kontextusát. Az a tokenszám, amely csak
input + output-ot jelent — mint a ranglista token oszlopa —, a szolgáltatók által számlázott forgalom kis töredékét írja le. - Az ár paraméter, a tokenmennyiség pedig a mért érték. A GPT-5.6 Sol teljes listaárán (4 / 20 / 0.4 / 5) az összeg $188.33, azaz $2.12 feladatonként $1.51 helyett. A saját számlázási főkönyvünk szándékosan nem a fő szám: promóciós kedvezményeket tartalmaz, amelyeket kívülről senki nem tud reprodukálni.
A tizenhat bukás
adaptive-rejection-sampler, circuit-fibsqrt, dna-assembly, extract-moves-from-video, filter-js-from-html, gpt2-codegolf, make-doom-for-mips, pytorch-model-recovery, qemu-startup, query-optimize, regex-chess, reshard-c4-data, sam-cell-seg, torch-pipeline-parallelism, train-fasttext, video-processing.
Tizenegy az eredeti sweepen bukott meg, öt egy helyettesítő futáson. A sheet az eredményeket rögzíti, nem a kiváltó okokat, és ez a poszt egyiket sem minősíti át infrastruktúra-problémának.
A konfiguráció reprodukálása
Nyilvános bemenetek:
- Results sheet — mind a 89 eredmény, token- és árazási táblák
- Feladatlista
- Harbor adapter
- Token-elszámoló script
Az adapter egy hosztolt backendet hív, és egy app nevű, fiókban beállított agentet használ. A modellhozzáférés, a reasoning beállítás, a sub-agent modellek és az eszközjogosultságok a fiókban vannak, nem a repóban, ezért egy klón kiindulópont, nem hermetikus visszajátszás. Használj dedikált benchmark fiókot és Docker hosztot, amelyen nincsenek a benchmarkhoz nem kapcsolódó hitelesítő adatok. Egyetlen feladat futtatása:
git clone https://github.com/todoforai/benchmarks.git
cd benchmarks && git checkout 4d37742c540801d0b2e10305446b02555a9fd2f1
cd terminal-bench
python3 -m venv .venv && . .venv/bin/activate && pip install -e .
: "${TODOFORAI_API_KEY:?Set a dedicated benchmark API key first}"
export TODOFORAI_API_KEY
harbor run \
-d "terminal-bench/terminal-bench-2-1" \
--agent-import-path "todoforai_tbench:TODOforAIHarborAgent" \
-m "openai:openai/gpt-5.6-sol" \
-i "terminal-bench/openssl-selfsigned-cert" \
--job-name "tb21-single-task" \
--max-retries 0 \
--yes -n 1
A -m kapcsoló a fő modellt választja; nem állítja be az xhigh-t, és nem konfigurálja a sub-agenteket. Mindkettőt ellenőrizd a visszakapott üzenet-metaadatokból, mielőtt megbíznál egy sweep eredményében.
Ha a futást a ranglistával akarod összehasonlítani: rögzítsd a függőségek verzióit és az agent beállításait az indulás előtt, tarts meg minden próbálkozást, előre deklaráld az újrapróbálási szabályt, és az összes próbálkozásra számított pontosságot a helyettesítő futásokon alapuló diagnosztikai eredményektől elkülönítve közöld.