A „mindenre emlékező AI asszisztens” keresés mögött egy egyszerű kívánság áll: ne kelljen újra és újra elmagyaráznod magad. Ki vagy, hogyan szereted, ha elvégzik a dolgokat, mit döntöttetek a múlt hónapban, mi a deploy menete.

A termékek, amelyek ezt ígérik, nagyon különböző dolgokat tárolnak. Ez a poszt azt mondja el, hogy mindegyik mit tárol valójában, hol nézheted meg, és mire jó. Az agent memory szócikk a szójegyzékben megadja a fogalmakat; ez itt a terepi útmutató.

Átláthatóság: a TODO for AI a miénk. Memóriarendszert építünk, és nyilvánosan mérjük; abban a posztban ott vannak a számok, valamint a korlátok és fenntartások.

Az „emlékezés” négy fajtája

Preferenciák. Rövid lista rólad, a beszélgetésekből kinyert tényekkel: név, munka, kedvelt hangnem, megemlített projektek. Kicsi, szerkeszthető, a rendszer minden beszélgetésbe beilleszti. Olcsó és hasznos. Mindent elfelejt, ami nem hasonlított egy rólad szóló tényhez.

Projektkontextus. Fájlok és utasítások, amiket egy munkaterülethez csatolsz, plusz az, ami azon a munkaterületen történt. A projektre emlékszik, nem pedig rád a különböző projektekben.

Megtanult eljárások. Az ágens leírja, hogyan csinált meg egy feladatot, és legközelebb újra felhasználja a jegyzetet. A hogyanra emlékszik, használat közben javul, és csak annyira jó, amennyire jó az, amit leírt.

Minden, visszakereshetően. Minden korábbi feladat és üzenet indexelve van, és egy visszakereső lépés egy új feladat indulásakor a tokenkeret korlátain belül előhozza a releváns részt. Arra emlékszik, mit döntöttetek, mikor, és mi váltotta fel. Jól megépíteni drága; csak ez a fajta tud válaszolni arra, hogy „mit döntöttünk X-ről augusztusban”.

A legtöbb termék az első kettőt csinálja. A listán két termék csinálja az utolsó kettőt.

A termékek

ChatGPT

Preferenciák plusz a csevegéstörténet felhasználása. A „Memory” egy lista, amit a beállításokban elolvashatsz és törölhetsz; a mentett emlékek rólad és a preferenciáidról szóló tények. A csevegési előzmények felhasználása lehetővé teszi, hogy korábbi beszélgetésekből is merítsen. Jó hangnemhez és személyes tényekhez. Nem az elvégzett munka nyilvántartása, és a csevegésen kívül semmire nem emlékszik.

Claude

Preferenciák, projektkontextus és a Cowork munkamenet-állapota. A Projects fájlokat és utasításokat tart munkaterületenként; a memória a fizetős csomagokban több csevegésen átívelően készít összegzést. A Claude Code CLAUDE.md fájlokat ad hozzá a repóhoz: ez projektkontextus, amit te írsz, és ezen a listán a legmegbízhatóbb memóriafajta pontosan azért, mert egy fájl, amelyet te kezelsz.

Hermes Agent

Megtanult eljárások, komolyan véve. A Hermes skilleket ír az elvégzett feladatokból, a következő futásnál finomítja őket, és rétegzett memóriát tart munkamenet-kereséssel és felhasználómodellezéssel. Self-hosted, így a memória a te lemezeden van, és te vizsgálhatod meg. Itt ez példázza a legjobban, hogyan javulhat egy rendszer a használattal. Csevegésszál-alapú ágens, tehát arra emlékszik, ami a szálakban történt. Összehasonlítás.

TODO for AI

Minden, visszakereshetően. Minden korábbi feladat és üzenet indexelve van, és az ágens kombinált lexikális és szemantikus visszakereséssel kereshet bennük. Emellett a privát beszélgetésekben egy tokenkeretes live-memory blokk egy sűrített válogatást hoz be a promptba a feladat elején. És van egy jegyzet- és eljárásréteg is, amelybe az ágens írhat, source és ref szerint címezve, így a „deploy eljárás” és a „döntés: nincs gondolatjel a nyilvános szövegekben” tartós tények, nem szerencsés találatok.

A visszakereső motor nyílt forráskódú: livemem, 94,7% a LoCoMo-n, kérdésenként 5,0K kontextus-tokennel; a válaszadót, a bírót és a kontextuskeretet közzétettük, mert ezek nagyobb hatással vannak a pontszámra, mint maga a memória. A multi-hop a gyenge kategória, 81,2%.

Ahol gyengébb: a jegyzetek és a live memory felhasználónként külön vannak, nem a csapat által közösen használt készlet; a feladattörténet-keresés azokra a projektekre terjed ki, amikhez hozzáférsz, a privát feladatok kizárásával. A visszakeresés csak annyira jó, amilyen jó az, amit leírtak; egy hanghívásban hozott döntés, amelyen az ágens nem volt jelen, nincs benne. És egy telített benchmark nem garancia a te adataidra.

Egymás mellett

PreferenciákProjektkontextusMegtanult eljárásokMinden korábbi feladat, visszakereshetőenHol van
ChatGPTIgen, szerkeszthető listaProjectsNemCsevegési előzmények felhasználásaOpenAI
ClaudeIgenProjects, CLAUDE.mdNemNemAnthropic, a te repód
Hermes AgentIgenSzálankéntIgen, saját írású skillekMunkamenet-keresésA te lemezed
TODO for AIIgen, jegyzetrétegProjektenkéntJegyzetek és eljárásokIgen, kereshető előzményekA fiókodban; a motor nyílt forráskódú

Hogyan ellenőrizd, mire emlékszik egy asszisztens

Három teszt, egyenként egy perc.

  1. Mondj el egy preferenciát, indíts új sessiont, és nézd meg, megmarad-e. A listán minden termék megfelel.
  2. Hozz meg egy döntést az egyik feladatban, és kérdezz rá három feladattal később. A csak preferenciákat tároló termékek elbuknak; itt kezd számítani a visszakeresés.
  3. Változtasd meg a döntést, aztán kérdezd meg, melyik az érvényes. Ez a nehéz. Az egymásnak ellentmondó frissítéseket a benchmarkok nem tesztelik kellően, a valódi munka viszont ilyenekből áll. Ha a régi döntéssel válaszol, a memória halom, nem nyilvántartás.

Futtasd le a harmadik tesztet, mielőtt bármelyikükre rábízol egy hosszú távú projektet, a miénkre is.