95.1%
Opus 5.5, az elutasított feladatok nélkül
81 feladatból 77
86.5%
Opus 5.5, mind a 89 feladat
az elutasítások bukásnak számítanak
8
a modell által elutasított feladat
bio- és kiberbiztonsági jelzések
79.8%
korábban: GPT-5.6 Sol, review kikapcsolva
89 feladatból 71

Frissítés, szeptember 30.: Opus 5.5

Ugyanazt a 89 feladatot lefuttattuk Claude Opus 5.5-tel, ugyanazzal a harnesszel, mint a Sol review nélküli futásánál: bash, read és web fetch, izolált egygépes bridge, review sub-agent nélkül. A fő szám 95.1% (77/81).

Miért 81 és nem 89. Nyolc feladat el sem indult. Az Anthropic biztonsági osztályozója az elején jelzi őket (három biológiai feladat: dna-assembly, dna-insert, protein-assembly; öt biztonsági feladat: break-filter-js-from-html, filter-js-from-html, crack-7z-hash, password-recovery, vulnerable-secret), a todo egy-két hívás után leáll, és a Harbor ApiError-t rögzít. A modell nem próbálkozott velük, ezért ebben a pontszámban sem sikernek, sem bukásnak nem számítanak, és kimaradnak a nevezőből. Az újrapróbálások többnyire megint elutasításba futnak (az egyik próbán négyet újrapróbáltunk, ebből hármat megint elutasított), ezért nem próbáljuk újra őket. Ha bukásnak számítjuk őket, az eredmény 86.5% (77/89); mindkét szám megtalálható a results sheetben.

Opus 5.5GPT-5.6 Sol, review kikapcsolva
Ugyanaz a 81 feladat (elutasítottak nélkül)95.1% (77/81)82.7% (67/81)
Wilson 95%-os intervallum, 81 feladat[88.0%, 98.1%][73.1%, 89.4%]
Mind a 89 feladat86.5% (77/89)82.0% (73/89)
Reasoningxhigh sweep; high 6 újrafuttatásnálxhigh
Dátumok2026. szeptember 26–30.2026. szeptember 2–4.

A Sol oszlopa a Sol végleges, review nélküli eredményét használja (73/89, miután egy későbbi újrafuttatás kijavított egy token-lejárati hibát; az alábbi 79.8% a korábbi, 71/89-es pillanatkép). A Sol megpróbálta a nyolc feladatot, és hatot teljesített, így a kizárás az Opusnak kedvez: az Opust 8,5 százalékponttal emeli, a Solt 0,7 százalékponttal. Mind a 89 feladatot számolva is az Opus vezet, 86.5% a 82.0% ellen, de kisebb különbséggel. Az intervallumok átfedik egymást, ezért 81 feladaton a különbség csak jelzésértékű, nem bizonyító erejű.

Költség. $76.75 listaáron a sweepre plusz az időtúllépés- és polyglot-újrafuttatásokra; a két szeptember 30-i qemu/video újrafuttatás még nincs beárazva, ezért vedd alsó határnak. Nem hasonlítható közvetlenül a Sol $61.87-jéhez, mert az feladatonként csak az utolsó próbálkozást számolja.

Újrafuttatások, és egy, amely nekünk kedvez. Kilenc feladatot egy későbbi futás alapján pontozunk, és az utolsó futás számít, akár sikerült, akár nem:

  • Harness- vagy verifier-javítások, 4 feladat. A polyglot-c-py próbálkozásonként ~300 s-ig állt egy interaktív tzdata-promptnál, amíg a harness be nem állította a DEBIAN_FRONTEND=noninteractive-ot. A qemu-startup és a qemu-alpine-ssh feladatot az agent megoldotta, de a feladat saját verifierje (debian:bullseye-on) nem tudta telepíteni a curl-t és az sshpass-t, mert a lejárt támogatású security mirror 404-et ad, így minden futás 0-t kapott; a harness most eltávolítja ezt a mirrort a verifier futása előtt. Az extract-moves-from-video egy CPU-limit javítás után lett újrafuttatva, és még mindig megbukott.
  • Időtúllépések, 6 feladat, high reasoninggel újrafuttatva: adaptive-rejection-sampler, cobol-modernization, extract-moves-from-video, make-doom-for-mips, query-optimize, schemelike-metacircular-eval. Ezek agent-időtúllépések voltak, nem infrastruktúrahibák, ezért az újrafuttatás második próbálkozás. Kettő sikeres lett (adaptive-rejection-sampler, cobol-modernization), négy továbbra is megbukott. E kettő nélkül a pontszám 92.6% (75/81).
Opus 5.5: mind a 81 megkísérelt feladat
Passed, first attempt · 72 Passed, replacement run · 5 Failed, first attempt · 0 Failed, replacement run · 4

Egy négyzet egy megkísérelt feladat; a 8 elutasított feladat nincs feltüntetve. A satírozott négyzeteket egy későbbi futás alapján pontoztuk. Ráhúzva megjelenik a feladat azonosítója.

All task IDs and outcomes
  • bn-fit-modify — passed
  • build-cython-ext — passed
  • build-pmars — passed
  • build-pov-ray — passed
  • caffe-cifar-10 — passed
  • cancel-async-tasks — passed
  • chess-best-move — passed
  • circuit-fibsqrt — passed
  • code-from-image — passed
  • compile-compcert — passed
  • configure-git-webserver — passed
  • constraints-scheduling — passed
  • count-dataset-tokens — passed
  • custom-memory-heap-crash — passed
  • db-wal-recovery — passed
  • distribution-search — passed
  • extract-elf — passed
  • feal-differential-cryptanalysis — passed
  • feal-linear-cryptanalysis — passed
  • financial-document-processor — passed
  • fix-code-vulnerability — passed
  • fix-git — passed
  • fix-ocaml-gc — passed
  • gcode-to-text — passed
  • git-leak-recovery — passed
  • git-multibranch — passed
  • gpt2-codegolf — passed
  • headless-terminal — passed
  • hf-model-inference — passed
  • install-windows-3.11 — passed
  • kv-store-grpc — passed
  • large-scale-text-editing — passed
  • largest-eigenval — passed
  • llm-inference-batching-scheduler — passed
  • log-summary-date-ranges — passed
  • mailman — passed
  • make-mips-interpreter — passed
  • mcmc-sampling-stan — passed
  • merge-diff-arc-agi-task — passed
  • model-extraction-relu-logits — passed
  • modernize-scientific-stack — passed
  • mteb-leaderboard — passed
  • mteb-retrieve — passed
  • multi-source-data-merger — passed
  • nginx-request-logging — passed
  • openssl-selfsigned-cert — passed
  • overfull-hbox — passed
  • path-tracing — passed
  • path-tracing-reverse — passed
  • polyglot-rust-c — passed
  • portfolio-optimization — passed
  • prove-plus-comm — passed
  • pypi-server — passed
  • pytorch-model-cli — passed
  • pytorch-model-recovery — passed
  • raman-fitting — passed
  • regex-chess — passed
  • regex-log — passed
  • reshard-c4-data — passed
  • rstan-to-pystan — passed
  • sam-cell-seg — passed
  • sanitize-git-repo — passed
  • sparql-university — passed
  • sqlite-db-truncate — passed
  • sqlite-with-gcov — passed
  • torch-pipeline-parallelism — passed
  • torch-tensor-parallelism — passed
  • train-fasttext — passed
  • tune-mjcf — passed
  • video-processing — passed
  • winning-avg-corewars — passed
  • write-compressor — passed
  • adaptive-rejection-sampler — passed, replacement run
  • cobol-modernization — passed, replacement run
  • polyglot-c-py — passed, replacement run
  • qemu-alpine-ssh — passed, replacement run
  • qemu-startup — passed, replacement run
  • extract-moves-from-video — failed, replacement run
  • make-doom-for-mips — failed, replacement run
  • query-optimize — failed, replacement run
  • schemelike-metacircular-eval — failed, replacement run

A négy bukás: schemelike-metacircular-eval (időtúllépés, hosszú gondolkodási körök), make-doom-for-mips (időtúllépés), extract-moves-from-video (időtúllépés: 951 képkocka OCR-je egy CPU-n) és query-optimize (rossz válasz).

Összehasonlítás. A 78.9% (Claude Code, Opus 4.8) és a 78.4% (Codex, GPT-5.6 Terra) az oldalunkon tbench.ai-ranglistabejegyzések, mind a 89 feladaton, feladatonként több próbával; ugyanazok a nem-egyenértékűségek érvényesek, mint lentebb, és az elutasítások ott bukásnak számítanak. A különbséget tekintsd tájékoztató jellegűnek.

A poszt további része a korábbi GPT-5.6 Sol futásokat dokumentálja.

Korábbi futások: GPT-5.6 Sol

Az Opus 5.5 előtt kétszer futtattuk le a Terminal-Bench 2.1-et ugyanazon a 89 feladaton GPT-5.6 Sollal. A fő szám akkor az egymodelles futás volt: 79.8% (71/89), GPT-5.6 Sol xhigh-on, a review eszköz letiltva. A web fetch az oldalak olvasását továbbra is Claude Haiku 4.5-re bízza ($4.17 a $46.87-ből); a futásban semmi nem vizsgálja és nem ellenőrzi a fő modell munkáját.

A korábbi, augusztus 25–26-i futásban be volt kapcsolva egy review sub-agent Claude Opus 5-ön, és 82.0% (73/89) lett az eredmény. A különbség két feladat, 2,9-szeres költség mellett, és a review által megnyert feladatok épp a „majdnem sikerült” esetek voltak: az egyikben 2 sakklépésből 1, a másikban 4 tesztből 3 volt helyes. A poszt nagy része erről a korábbi futásról szól, mert ehhez van feladatonkénti eredménytábla; a review nélküli futás ugyanazt a harnesst, ugyanazt a pontozási szabályt és ugyanazt a rögzített repót használja, és a results sheetje minden változtatást és minden bukást felsorol.

Review kikapcsolva (fő szám)Review bekapcsolva
Sikerességi arány79.8% (71/89)82.0% (73/89)
Wilson 95%-os intervallum[70.3%, 86.8%][72.8%, 88.6%]
ModellekGPT-5.6 Sol; Haiku 4.5 web fetchre+ Claude Opus 5 review
Költség, promó / listaár$46.87 / ~$89.6$134.51 / $188.33
Dátumok2026. szeptember 2–3.2026. augusztus 25–26.

Az alábbi szakaszok a Terminal-Bench 2.1 review-bekapcsolt futását dokumentálják, 2026. augusztus 25–26-án. Ez a poszt azt írja le, hogyan készült ez a szám, hogy helyesen lehessen olvasni: rendszereredmény, megadott újrafuttatási szabállyal, nem hivatalos ranglistás beküldés, és nem egymodelles pontszám.

Minden alábbi adat a nyilvános benchmark repó rögzített results sheetjéből származik. A linkek egy commitra mutatnak, így későbbi szerkesztések nem változtathatják meg csendben, amit a cikk leír.

A tesztelt rendszer

A Terminal-Bench egy izolált konténerben ad feladatot az agentnek — projekt fordítása, adatbázis helyreállítása, szolgáltatás beállítása, kód javítása —, és egy verifier ellenőrzi az eredményül kapott állapotot. Az, hogy az agent sikeresnek nyilvánítja a saját munkáját, lényegtelen; csak a verifier eredménye számít.

Egy feladat az elejétől a végéig
Harbor
feladat-konténer + verifier
  • 89 feladatazonosító
  • izolált Docker környezet
TODO for AI adapter
harbor_agent.py
  • elküldi az utasítást
  • az edge a konténerben hajtja végre
Fő ciklus
GPT-5.6 Sol · xhigh
  • a kiszolgált modell az üzenet-metaadatban ellenőrizve
Sub-agentek
eszközhívásonként indítva
  • review → Claude Opus 5
  • explore, webfetch → Haiku 4.5
Verifier
sikeres / sikertelen
  • feladatonként egy végső eredmény

Ennek a konfigurációnak két részlete számít az értelmezésnél.

A 82.0% az egész pipeline-hoz tartozik. A review és az exploration Anthropic modelleken futott ugyanabban a trialben, ezért ez a szám nem írható csak a GPT-5.6 Solnak. A fentebbi review nélküli futás az izoláció: 79.8%.

A kiszolgált modellt ellenőriztük, nem feltételeztük. A CLI fejléce megjeleníti a kért modellt; a futás jegyzetei az egyes assistant-üzenetekhez csatolt szolgáltatói metaadatból igazolják a gpt-5.6-sol-t xhigh-on.

Pontozási szabály és a helyettesítő futások

A results sheet feladatonként egy végső eredményt rögzít. Tizenhat feladatot augusztus 26-án újrafuttattunk, miután az első próbálkozásukat infrastruktúrahiba által érintettnek minősítettük; ezeknél az újrafuttatás eredménye váltja az eredetit.

finali={reruniha van helyettesıˊto˝ futaˊssweepiegyeˊbkeˊnt\text{final}_i = \begin{cases} \text{rerun}_i & \text{ha van helyettesítő futás}\\ \text{sweep}_i & \text{egyébként} \end{cases} score=189∑i=1891 ⁣[ finali=pass ]=7389=0.820\text{score} = \frac{1}{89}\sum_{i=1}^{89} \mathbb{1}\!\left[\,\text{final}_i = \text{pass}\,\right] = \frac{73}{89} = 0.820
Mind a 89 végső eredmény
Passed, first attempt · 62 Passed, replacement run · 11 Failed, first attempt · 11 Failed, replacement run · 5

Egy négyzet egy feladat. A satírozott négyzeteket a helyettesítő futásuk alapján pontoztuk. Ráhúzva megjelenik a feladat azonosítója.

All task IDs and outcomes
  • bn-fit-modify — passed
  • build-pmars — passed
  • cancel-async-tasks — passed
  • chess-best-move — passed
  • code-from-image — passed
  • configure-git-webserver — passed
  • constraints-scheduling — passed
  • count-dataset-tokens — passed
  • crack-7z-hash — passed
  • db-wal-recovery — passed
  • distribution-search — passed
  • extract-elf — passed
  • feal-differential-cryptanalysis — passed
  • feal-linear-cryptanalysis — passed
  • financial-document-processor — passed
  • fix-code-vulnerability — passed
  • fix-git — passed
  • fix-ocaml-gc — passed
  • gcode-to-text — passed
  • git-leak-recovery — passed
  • git-multibranch — passed
  • headless-terminal — passed
  • hf-model-inference — passed
  • install-windows-3.11 — passed
  • kv-store-grpc — passed
  • large-scale-text-editing — passed
  • largest-eigenval — passed
  • llm-inference-batching-scheduler — passed
  • log-summary-date-ranges — passed
  • merge-diff-arc-agi-task — passed
  • model-extraction-relu-logits — passed
  • modernize-scientific-stack — passed
  • mteb-leaderboard — passed
  • mteb-retrieve — passed
  • multi-source-data-merger — passed
  • nginx-request-logging — passed
  • openssl-selfsigned-cert — passed
  • overfull-hbox — passed
  • password-recovery — passed
  • path-tracing — passed
  • path-tracing-reverse — passed
  • polyglot-c-py — passed
  • polyglot-rust-c — passed
  • portfolio-optimization — passed
  • protein-assembly — passed
  • prove-plus-comm — passed
  • pypi-server — passed
  • pytorch-model-cli — passed
  • qemu-alpine-ssh — passed
  • raman-fitting — passed
  • regex-log — passed
  • rstan-to-pystan — passed
  • sanitize-git-repo — passed
  • schemelike-metacircular-eval — passed
  • sparql-university — passed
  • sqlite-db-truncate — passed
  • sqlite-with-gcov — passed
  • torch-tensor-parallelism — passed
  • tune-mjcf — passed
  • vulnerable-secret — passed
  • winning-avg-corewars — passed
  • write-compressor — passed
  • break-filter-js-from-html — passed, replacement run
  • build-cython-ext — passed, replacement run
  • build-pov-ray — passed, replacement run
  • caffe-cifar-10 — passed, replacement run
  • cobol-modernization — passed, replacement run
  • compile-compcert — passed, replacement run
  • custom-memory-heap-crash — passed, replacement run
  • dna-insert — passed, replacement run
  • mailman — passed, replacement run
  • make-mips-interpreter — passed, replacement run
  • mcmc-sampling-stan — passed, replacement run
  • filter-js-from-html — failed
  • gpt2-codegolf — failed
  • make-doom-for-mips — failed
  • pytorch-model-recovery — failed
  • qemu-startup — failed
  • query-optimize — failed
  • regex-chess — failed
  • reshard-c4-data — failed
  • sam-cell-seg — failed
  • train-fasttext — failed
  • video-processing — failed
  • adaptive-rejection-sampler — failed, replacement run
  • circuit-fibsqrt — failed, replacement run
  • dna-assembly — failed, replacement run
  • extract-moves-from-video — failed, replacement run
  • torch-pipeline-parallelism — failed, replacement run

Ez sem all-attempt pontosság, sem best-of-N. A helyettesítés ott érvényesül, ahol van újrafuttatás, függetlenül attól, melyik eredmény volt jobb, és a 16 helyettesítésből 11 sikeres lett, 5 megbukott. A szabály mégis a rendszernek kedvez: csak azokat a feladatokat futtattuk újra, amelyek első próbálkozását infrastruktúrahiba által érintettnek minősítettük, és a sheet nem rögzíti ezek eredeti eredményét. A sheet összesen 102 trialt számol 16 újrafuttatottként megjelölt feladat mellett, ezt az eltérést nem oldja fel. Bármely olyan protokollal való összehasonlításnál, amely minden trialt átlagol, mindkét pontot figyelembe kell venni.

A 16 helyettesítő futás alapján pontozott feladat: adaptive-rejection-sampler, break-filter-js-from-html, build-cython-ext, build-pov-ray, caffe-cifar-10, circuit-fibsqrt, cobol-modernization, compile-compcert, custom-memory-heap-crash, dna-assembly, dna-insert, extract-moves-from-video, mailman, make-mips-interpreter, mcmc-sampling-stan, torch-pipeline-parallelism. Ezek közül öt a tizenhat végső bukás között van.

Statisztikai pontosság

Nem futott ismételt teljes sweep, ezért a sheet nem ad intervallumot. Egyetlen binomiális arányra a Wilson 95%-os intervallum érzékelteti, mennyit mozdulhat egy eredmény ennyi feladatnál:

11+z2/n(p^+z22n  ±  zp^(1−p^)n+z24n2)=[ 72.8%,  88.6% ]\frac{1}{1 + z^2/n}\left(\hat{p} + \frac{z^2}{2n} \;\pm\; z\sqrt{\frac{\hat{p}(1-\hat{p})}{n} + \frac{z^2}{4n^2}}\right) = [\,72.8\%,\; 88.6\%\,]

ahol n=89n=89, p^=0.820\hat{p}=0.820, z=1.96z=1.96.

Az intervallum szemléltető jellegű. Független trialeket és feladatonként fix sikerességi valószínűséget feltételez, és nem modellezi a helyettesítési szabályt vagy a feladatok eltérő nehézségét. Azt viszont megmutatja, mekkora a skála: két egyszeres sweep eredménye között néhány pont különbség 89 feladaton bőven ezen a tartományon belül van, és önmagában nem bizonyíték arra, hogy az egyik rendszer jobb.

Mivel hasonlítható az eredmény

Az oldalunk a Claude Code-ot 78.9%-on és a Codexet 78.4%-on mutatja a saját eredményünk mellett (79.8% a Sollal e szakasz írásakor, 95.1% most az Opus 5.5-tel). A táblázat a Sol futásokat írja le; az Opus 5.5 eltéréseit (elutasítottak kizárva, kilenc feladat későbbi futáson) a fenti frissítés sorolja fel. Ezeket az értékeket a nyilvános tbench.ai 2.1 ranglistáról másoltuk át, és ebben a futásban nem reprodukáltuk őket. Négy különbség miatt az oszlopok nem egyenértékűek:

Dimenziótbench.ai ranglistaEz a futás
Pontosságsikerek ÷ összes trial; az újrafuttatások beleátlagolvafeladatonként egy végső eredmény; az újrafuttatások helyettesítenek
Trial feladatonként≥ 5 a listázott bejegyzéseknél1, 16 feladat helyettesítő futás alapján pontozva
Költségminden trial összegecsak feladatonként az utolsó próbálkozás
Tokenszáminput + output; a cache tokenek nélkülmind a négy osztály, a cache readekkel együtt
Modellbeküldött formában, modellenként egy bejegyzés79.8%: GPT-5.6 Sol, Haiku web fetchre · 82.0%: + Opus review

A ranglista saját szabálya szerint — minden próbálkozás átlagolva, nem helyettesítve — mindkét futás rendre 79,8% és 82,0% alatti eredményt kapna, ha a lecserélt próbálkozások bukásnak számítanak, és a költsége a trialek számával skálázódna. A repóban lévő összehasonlíthatósági jegyzetek végigvezetnek a korrekciókon.

Egy terminálos benchmark is csak szűk szeletét méri annak, amit egy agenttermék csinál. Semmit nem mond az e-mailről, CRM-munkáról, böngészős feladatokról, jogosultságokról vagy csapatmunkafolyamatokról. Ezekhez lásd: TODO for AI vs Claude Code, vs Codex vagy az összehasonlító jegyzék.

A review-bekapcsolt futás költsége: három modell, négy tokenosztály

A költséget a szolgáltatói használati jelentésekből számoljuk, minden feladat utolsó próbálkozására, beleértve az egyes trialekből linkelt sub-agent todókat. Az elhagyott, infrastruktúrahiba által érintett próbálkozásokat nem áraztuk be.

C=∑m  ∑ktokensm,k⋅pricem,k106,k∈{in, out, cache read, cache write}C = \sum_{m}\;\sum_{k} \frac{\text{tokens}_{m,k}\cdot\text{price}_{m,k}}{10^{6}}, \quad k \in \{\text{in},\,\text{out},\,\text{cache read},\,\text{cache write}\}
ModellSzerepInputOutputCache readCache write
GPT-5.6 Solfő ciklus7.65M0.95M144.94M0
Claude Opus 5review~01.74M24.31M2.68M
Claude Haiku 4.5explore, webfetch0.24M0.50M18.98M2.96M
Modell$/Mtok — in / out / cache read / cache writeKöltségFeladatonként
GPT-5.6 Sol2 / 10 / 0.2 / 2.5 (promó)$53.82$0.60
Claude Opus 55 / 25 / 0.5 / 6.25$72.37$0.81
Claude Haiku 4.51 / 5 / 0.1 / 1.25$8.32$0.09
Összesen$134.51$1.51
A költség megoszlása modellenként, a kiválasztott próbálkozások
Claude Opus 5 · review $72.37
GPT-5.6 Sol · fő ciklus $53.82
Claude Haiku 4.5 · explore $8.32

A táblázatból három megfigyelés következik közvetlenül.

  1. A review sub-agent többe kerül, mint a benchmarkolt modell — $72.37 a $53.82 ellenében, nagyjából 50 review hívásból, szinte teljes egészében az Opus kimeneti tokenjeiből és cache-írásaiból. A review kikapcsolása (a 79.8%-os futás) az összeget $46.87-re vitte le.
  2. A cache read az elküldött tokenek 93%-a. Egy agent-ciklus minden körben újraküldi a kontextusát. Az a tokenszám, amely csak input + output-ot jelent — mint a ranglista token oszlopa —, a szolgáltatók által számlázott forgalom kis töredékét írja le.
  3. Az ár paraméter, a tokenmennyiség pedig a mért érték. A GPT-5.6 Sol teljes listaárán (4 / 20 / 0.4 / 5) az összeg $188.33, azaz $2.12 feladatonként $1.51 helyett. A saját számlázási főkönyvünk szándékosan nem a fő szám: promóciós kedvezményeket tartalmaz, amelyeket kívülről senki nem tud reprodukálni.

A tizenhat bukás

adaptive-rejection-sampler, circuit-fibsqrt, dna-assembly, extract-moves-from-video, filter-js-from-html, gpt2-codegolf, make-doom-for-mips, pytorch-model-recovery, qemu-startup, query-optimize, regex-chess, reshard-c4-data, sam-cell-seg, torch-pipeline-parallelism, train-fasttext, video-processing.

Tizenegy az eredeti sweepen bukott meg, öt egy helyettesítő futáson. A sheet az eredményeket rögzíti, nem a kiváltó okokat, és ez a poszt egyiket sem minősíti át infrastruktúra-problémának.

A konfiguráció reprodukálása

Nyilvános bemenetek:

Az adapter egy hosztolt backendet hív, és egy app nevű, fiókban beállított agentet használ. A modellhozzáférés, a reasoning beállítás, a sub-agent modellek és az eszközjogosultságok a fiókban vannak, nem a repóban, ezért egy klón kiindulópont, nem hermetikus visszajátszás. Használj dedikált benchmark fiókot és Docker hosztot, amelyen nincsenek a benchmarkhoz nem kapcsolódó hitelesítő adatok. Egyetlen feladat futtatása:

git clone https://github.com/todoforai/benchmarks.git
cd benchmarks && git checkout 4d37742c540801d0b2e10305446b02555a9fd2f1
cd terminal-bench
python3 -m venv .venv && . .venv/bin/activate && pip install -e .

: "${TODOFORAI_API_KEY:?Set a dedicated benchmark API key first}"
export TODOFORAI_API_KEY

harbor run \
  -d "terminal-bench/terminal-bench-2-1" \
  --agent-import-path "todoforai_tbench:TODOforAIHarborAgent" \
  -m "openai:openai/gpt-5.6-sol" \
  -i "terminal-bench/openssl-selfsigned-cert" \
  --job-name "tb21-single-task" \
  --max-retries 0 \
  --yes -n 1

A -m kapcsoló a fő modellt választja; nem állítja be az xhigh-t, és nem konfigurálja a sub-agenteket. Mindkettőt ellenőrizd a visszakapott üzenet-metaadatokból, mielőtt megbíznál egy sweep eredményében.

Ha a futást a ranglistával akarod összehasonlítani: rögzítsd a függőségek verzióit és az agent beállításait az indulás előtt, tarts meg minden próbálkozást, előre deklaráld az újrapróbálási szabályt, és az összes próbálkozásra számított pontosságot a helyettesítő futásokon alapuló diagnosztikai eredményektől elkülönítve közöld.