{"id":5566,"date":"2026-07-28T08:00:00","date_gmt":"2026-07-28T15:00:00","guid":{"rendered":"https:\/\/www.couchbase.com\/blog\/?p=5566"},"modified":"2026-07-30T15:22:40","modified_gmt":"2026-07-30T22:22:40","slug":"what-we-learned-evaluating-agent-memorythe-setup-part-1","status":"publish","type":"post","link":"https:\/\/www.couchbase.com\/blog\/pt\/what-we-learned-evaluating-agent-memorythe-setup-part-1\/","title":{"rendered":"O que Aprendemos Avaliando Mem\u00f3ria de Agentes: A Configura\u00e7\u00e3o (Parte 1)\u00a0"},"content":{"rendered":"<p class=\"wp-block-paragraph\">A mem\u00f3ria de agentes \u00e9 um dos problemas de infraestrutura mais dif\u00edceis na IA aplicada no momento, e o ecossistema de benchmarks em torno dela ainda est\u00e1 tomando forma. Este \u00e9 um artigo em duas partes. A Parte 1 aborda o que est\u00e1bamos usando como par\u00e2metro, como o medimos e como o pipeline \u00e9 constru\u00eddo. <a href=\"https:\/\/www.couchbase.com\/blog\/pt\/what-we-learned-evaluating-agent-memorythe-results-part-2\/\">A Parte 2 aborda<\/a> o que os experimentos realmente mostraram. Estamos publicado ambos porque as decis\u00f5es envolvidas na avalia\u00e7\u00e3o s\u00e3o t\u00e3o consequentes quanto as decis\u00f5es do sistema, e essa parte raramente \u00e9 posta no papel.<\/p>\n\n\n\n<h2 id=\"h-what-is-agent-memory-and-why-is-it-not-just-rag\" class=\"wp-block-heading\">O que \u00e9 a mem\u00f3ria de agentes e por que ela n\u00e3o \u00e9 apenas RAG?<\/h2>\n\n\n\n<p class=\"wp-block-paragraph\">A mem\u00f3ria do agente \u00e9 o que faz com que um agente de IA n\u00e3o pare\u00e7a ter amn\u00e9sia.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Os agentes de IA tradicionais n\u00e3o t\u00eam estado. Cada conversa come\u00e7a do zero. Por exemplo, um bot de atendimento ao cliente resolve um chamado, o usu\u00e1rio liga novamente dois dias depois, e o bot n\u00e3o tem registro da intera\u00e7\u00e3o anterior. Um assistente de programa\u00e7\u00e3o explica o mesmo conceito duas vezes na mesma semana porque n\u00e3o tem mem\u00f3ria da primeira conversa. Um assistente de compras recomenda algo que o usu\u00e1rio j\u00e1 comprou.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">A mem\u00f3ria do agente resolve isso mantendo uma camada persistente que armazena o que um agente aprende sobre um usu\u00e1rio entre sess\u00f5es e torna isso recuper\u00e1vel em intera\u00e7\u00f5es futuras. O agente aprende hoje que um usu\u00e1rio \u00e9 vegetariano e al\u00e9rgico a crust\u00e1ceos, e recorre a esse contexto em outubro, quando o usu\u00e1rio pede recomenda\u00e7\u00f5es de jantar.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Se voc\u00ea j\u00e1 trabalhou com gera\u00e7\u00e3o aumentada por recupera\u00e7\u00e3o (RAG) antes, isso pode parecer familiar. Os mecanismos superficiais s\u00e3o semelhantes: armazenar coisas em um banco de dados vetorial, recuperar trechos relevantes no momento da consulta e pass\u00e1-los para um LLM. Mas a mem\u00f3ria de agentes \u00e9 um problema fundamentalmente diferente de tr\u00eas maneiras.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Primeiro, o corpus \u00e9 pessoal e din\u00e2mico. No RAG de documentos, o corpus \u00e9 geralmente uma cole\u00e7\u00e3o est\u00e1tica, uma base de conhecimento, um conjunto de PDFs e uma base de c\u00f3digo. Na mem\u00f3ria do agente, o corpus \u00e9 todo o hist\u00f3rico de conversas de um usu\u00e1rio. Ele cresce a cada sess\u00e3o e \u00e9 diferente para cada usu\u00e1rio.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Segundo, as consultas s\u00e3o autobiogr\u00e1ficas em vez de informacionais. Uma pesquisa em base de conhecimento \u00e9 uma consulta sobre o mundo. Uma consulta de mem\u00f3ria \u00e9 uma consulta sobre o usu\u00e1rio, coisas que ele disse, prefer\u00eancias que expressou e experi\u00eancias que mencionou. \u201cQual \u00e9 a capital da Fran\u00e7a?\u201d e \u201cO que eu disse sobre minhas restri\u00e7\u00f5es alimentares?\u201d n\u00e3o s\u00e3o o mesmo problema de recupera\u00e7\u00e3o.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Em terceiro lugar, o tempo \u00e9 uma dimens\u00e3o de primeira classe. O mesmo fato pode aparecer de forma contradit\u00f3ria entre sess\u00f5es, e a rec\u00eancia determina qual vers\u00e3o est\u00e1 correta. Se um usu\u00e1rio mencionou dois gatos em mar\u00e7o e tr\u00eas gatos em junho, a resposta correta para \u201cQuantos gatos eu tenho?\u201d depende inteiramente de quando a pergunta est\u00e1 sendo feita. Um sistema de recupera\u00e7\u00e3o de documentos n\u00e3o precisa raciocinar sobre isso. Um sistema de mem\u00f3ria de agente, sim, e constantemente.<\/p>\n\n\n\n<figure class=\"wp-block-image size-large\"><img loading=\"lazy\" decoding=\"async\" width=\"1024\" height=\"499\" src=\"https:\/\/www.couchbase.com\/blog\/wp-content\/uploads\/sites\/5\/2026\/07\/Screenshot-2026-07-23-at-3.29.23-PM-1024x499.png\" alt=\"\" class=\"wp-image-5567\" srcset=\"https:\/\/www.couchbase.com\/blog\/wp-content\/uploads\/sites\/5\/2026\/07\/Screenshot-2026-07-23-at-3.29.23-PM-1024x499.png 1024w, https:\/\/www.couchbase.com\/blog\/wp-content\/uploads\/sites\/5\/2026\/07\/Screenshot-2026-07-23-at-3.29.23-PM-300x146.png 300w, https:\/\/www.couchbase.com\/blog\/wp-content\/uploads\/sites\/5\/2026\/07\/Screenshot-2026-07-23-at-3.29.23-PM-768x374.png 768w, https:\/\/www.couchbase.com\/blog\/wp-content\/uploads\/sites\/5\/2026\/07\/Screenshot-2026-07-23-at-3.29.23-PM-18x9.png 18w, https:\/\/www.couchbase.com\/blog\/wp-content\/uploads\/sites\/5\/2026\/07\/Screenshot-2026-07-23-at-3.29.23-PM.png 1216w\" sizes=\"auto, (max-width: 1024px) 100vw, 1024px\" \/><\/figure>\n\n\n\n<p class=\"wp-block-paragraph\">\u00c9 por isso que um sistema RAG n\u00e3o pode simplesmente ser rebatizado como \u201cmem\u00f3ria de agente\u201d. As decis\u00f5es de projeto s\u00e3o diferentes, os modos de falha s\u00e3o diferentes e, como descobrimos, os benchmarks tamb\u00e9m s\u00e3o diferentes. Os sistemas de recupera\u00e7\u00e3o de documentos s\u00e3o avaliados com base na capacidade de encontrar o trecho correto em um corpus fixo. Os sistemas de mem\u00f3ria de agente precisam lidar com um corpus que \u00e9 pessoal, est\u00e1 em constante crescimento e repleto de contradi\u00e7\u00f5es. Os benchmarks existentes para o RAG n\u00e3o revelam os modos de falha que s\u00e3o relevantes para a mem\u00f3ria de agente. Tivemos que encontrar aqueles que o fazem.<\/p>\n\n\n\n<h2 id=\"h-the-benchmarks-what-exists-and-why-it-matters\" class=\"wp-block-heading\">Os benchmarks: o que existe e por que importa<\/h2>\n\n\n\n<p class=\"wp-block-paragraph\">Antes de medir qualquer coisa, tivemos que decidir sobre o que medir.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">O cen\u00e1rio de benchmarks de mem\u00f3ria de agentes ainda \u00e9 relativamente jovem. N\u00f3s trabalhamos com dois deles: LoCoMo e LongMemEval.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">O LoCoMo (Long-term Conversation Memory) \u00e9 baseado em 10 registros de conversas longas \u2013 conversas naturalistas entre duas pessoas que divagam, fazem refer\u00eancia a eventos passados e cont\u00eam contexto impl\u00edcito. A partir desses 10 registros, o benchmark gera 1.540 perguntas distribu\u00eddas em quatro categorias:<\/p>\n\n\n\n<ul class=\"wp-block-list\">\n<li>Salto \u00danico: Uma \u00fanica informa\u00e7\u00e3o, declarada diretamente em algum lugar. \u201cO que a Caroline pesquisou?\u201d -&gt; \u201cag\u00eancias de ado\u00e7\u00e3o.\u201d<\/li>\n\n\n\n<li>Multi-salto: A resposta exige conectar informa\u00e7\u00f5es de dois ou mais lugares. \u201cPara que a corrida beneficente conscientizou?\u201d -&gt; voc\u00ea precisa descobrir tanto que houve uma corrida beneficente quanto que era para a sa\u00fade mental.<\/li>\n\n\n\n<li>Temporal: Perguntas sobre quando as coisas acontecem. \u201cQuando a Melanie pintou um nascer do sol?\u201d -&gt; \u201c2022.\u201d<\/li>\n\n\n\n<li>Dom\u00ednio Aberto: Quest\u00f5es que exigem racioc\u00ednio em vez de recupera\u00e7\u00e3o. \u201cCaroline ainda gostaria de buscar aconselhamento se n\u00e3o tivesse recebido apoio enquanto crescia?\u201d -&gt; a resposta n\u00e3o est\u00e1 declarada em lugar nenhum, ela precisa ser inferida.<\/li>\n<\/ul>\n\n\n\n<p class=\"wp-block-paragraph\">O LoCoMo testa a mem\u00f3ria naturalista de longo prazo. As conversas s\u00e3o confusas, da mesma forma que as conversas reais s\u00e3o confusas. As respostas est\u00e3o inseridas no contexto, em vez de serem claramente rotuladas.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">O LongMemEval \u00e9 constru\u00eddo de forma diferente. Ele consiste em 500 perguntas, cada uma inserida em um palheiro de sess\u00f5es de conversa\u00e7\u00e3o. Os tipos de perguntas s\u00e3o mais granulares e, sob a perspectiva de design de sistemas, mais reveladores:<\/p>\n\n\n\n<ul class=\"wp-block-list\">\n<li>Usu\u00e1rio de Sess\u00e3o \u00danica (SSU): Algo que o usu\u00e1rio disse em uma sess\u00e3o. \u201cQuanto tempo dura o meu trajeto para o trabalho?\u201d -&gt; \u201c45 minutos.\u201d<\/li>\n\n\n\n<li>Assistente de Sess\u00e3o \u00danica (SSA): Algo que o assistente disse em uma sess\u00e3o. \u201cVoc\u00ea pode me lembrar o nome do restaurante em Roma que eu gostei?\u201d -&gt; \u201cRoscioli.\u201d Essa categoria \u00e9 importante porque a resposta est\u00e1 nos pr\u00f3prios registros anteriores do assistente, e n\u00e3o nos do usu\u00e1rio.<\/li>\n\n\n\n<li>Prefer\u00eancia de Sess\u00e3o \u00danica (SSP): Uma prefer\u00eancia que o usu\u00e1rio expressou. \u201cVoc\u00ea pode sugerir acess\u00f3rios que complementem meu equipamento de fotografia?\u201d -&gt; o sistema precisa ter retido a prefer\u00eancia do usu\u00e1rio por equipamentos compat\u00edveis com Sony.<\/li>\n\n\n\n<li>Multissess\u00e3o (MS): A resposta exige a s\u00edntese de informa\u00e7\u00f5es provenientes de v\u00e1rias sess\u00f5es diferentes.<\/li>\n\n\n\n<li>Atualiza\u00e7\u00e3o de Conhecimento (KU): A informa\u00e7\u00e3o foi alterada. \u201cQuantas bicicletas eu tenho atualmente?\u201d -&gt; \u201c4.\u201d Mas, anteriormente no hist\u00f3rico, a resposta era 3. O sistema precisa reconhecer que a informa\u00e7\u00e3o foi sobrescrita.<\/li>\n\n\n\n<li>Racioc\u00ednio Temporal (TR): Perguntas que exigem aritm\u00e9tica temporal. \u201cQuantos meses se passaram desde a minha \u00faltima visita ao museu?\u201d -&gt; o sistema deve identificar quando a visita ocorreu, quando a pergunta est\u00e1 sendo feita e calcular a diferen\u00e7a.<\/li>\n<\/ul>\n\n\n\n<p class=\"wp-block-paragraph\">A categoria Knowledge Update \u00e9 particularmente bem projetada porque a maioria dos *benchmarks* n\u00e3o testa se um sistema lida com contradi\u00e7\u00f5es no hist\u00f3rico de conversas. Um sistema de mem\u00f3ria de agente que n\u00e3o consegue lidar com KU retornar\u00e1 com confian\u00e7a informa\u00e7\u00f5es desatualizadas, o que \u00e9 um dos modos de falha mais graves em produ\u00e7\u00e3o.<\/p>\n\n\n\n<h2 id=\"h-locomo-vs-longmemeval-what-makes-them-genuinely-different\" class=\"wp-block-heading\">LoCoMo vs. LongMemEval: o que os torna genuinamente diferentes<\/h2>\n\n\n\n<p class=\"wp-block-paragraph\">Estes dois benchmarks testam coisas diferentes, e entender a diferen\u00e7a importa antes de olhar para os resultados.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">O LoCoMo usa conversas reais e n\u00e3o roteirizadas entre duas pessoas. O sistema de mem\u00f3ria precisa lidar com ambos os lados, o que Caroline disse e o que Melanie disse. O pipeline de ingest\u00e3o reflete isso com uma extra\u00e7\u00e3o de ponto de vista duplo: cada troca cria dois blocos de mem\u00f3ria, cada um associado a um locutor. Isso n\u00e3o \u00e9 apenas uma conven\u00e7\u00e3o de formata\u00e7\u00e3o. As perguntas do LoCoMo podem ser feitas a partir de qualquer perspectiva, e o sistema precisa da vers\u00e3o dos fatos de cada locutor dispon\u00edvel no momento da recupera\u00e7\u00e3o.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">O LongMemEval utiliza conversas entre um usu\u00e1rio e um assistente de IA, com perguntas feitas pelo usu\u00e1rio sobre seu pr\u00f3prio hist\u00f3rico. Na configura\u00e7\u00e3o LME-M, tamb\u00e9m usamos o ponto de vista dual (um bloco da perspectiva do usu\u00e1rio e um bloco da perspectiva do assistente por troca), porque o tipo de pergunta SSA pergunta especificamente o que o assistente disse. No LME-S, simplificamos para um \u00fanico ponto de vista sequencial e alcan\u00e7amos pontua\u00e7\u00f5es id\u00eanticas com metade da lat\u00eancia. Essa troca \u00e9 abordada em <a href=\"https:\/\/www.couchbase.com\/blog\/pt\/what-we-learned-evaluating-agent-memorythe-results-part-2\/\">Parte 2.<\/a><\/p>\n\n\n\n<p class=\"wp-block-paragraph\">A outra diferen\u00e7a estrutural \u00e9 a escala. O LoCoMo tem 10 conversas. O LongMemEval tem 500 perguntas, cada uma com seu pr\u00f3prio palheiro. O LoCoMo testa a profundidade de recupera\u00e7\u00e3o ao longo de um \u00fanico relacionamento estendido. O LongMemEval testa se o sistema de recupera\u00e7\u00e3o consegue trazer \u00e0 tona a mem\u00f3ria correta em uma cole\u00e7\u00e3o grande e crescente de sess\u00f5es.<\/p>\n\n\n\n<h2 id=\"h-the-two-scales-of-longmemeval-and-why-this-matters\" class=\"wp-block-heading\">As duas escalas do LongMemEval, e por que isso importa<\/h2>\n\n\n\n<p class=\"wp-block-paragraph\">O LongMemEval vem em duas variantes: LME-S e LME-M. Mesmas 500 perguntas, mesma distribui\u00e7\u00e3o de tipos de perguntas. A diferen\u00e7a \u00e9 o qu\u00e3o dif\u00edcil o sistema precisa pesquisar.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">O LME-S coloca cada resposta em um \"palheiro\" de aproximadamente 46 sess\u00f5es (cerca de 115.000 tokens por problema). O LME-M coloca a mesma resposta em cerca de 500 sess\u00f5es, aproximadamente 1,5 milh\u00e3o de tokens por problema. Isso representa uma expans\u00e3o de 20 vezes no espa\u00e7o de busca com a mesma \"agulha\" a ser encontrada.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Isso acabou se revelando uma das descobertas mais importantes do projeto. A configura\u00e7\u00e3o que funciona bem no LME-S n\u00e3o \u00e9 transferida para o LME-M. Se um sistema for otimizado no LME-S e implantado em escala de produ\u00e7\u00e3o, \u00e9 prov\u00e1vel que esteja mal configurado de maneiras que s\u00e3o dif\u00edceis de detectar sem avaliar em ambas as escalas.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">O exemplo mais claro \u00e9 a profundidade de recupera\u00e7\u00e3o. O k ideal no LME-S \u00e9 10. Na escala LME-M, k=20 \u00e9 necess\u00e1rio. Com mais sess\u00f5es no palheiro, a mem\u00f3ria relevante fica mais dilu\u00edda, e um conjunto de recupera\u00e7\u00e3o mais profundo \u00e9 necess\u00e1rio para traz\u00ea-la \u00e0 tona de forma confi\u00e1vel. O Racioc\u00ednio Temporal, que n\u00e3o mostra praticamente nenhuma sensibilidade a k no LME-S, beneficia-se significativamente de um k mais alto no LME-M, porque o contexto de data relevante est\u00e1 espalhado por mais sess\u00f5es.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">As variantes de prompt tamb\u00e9m apresentam diverg\u00eancias. O prompt de resposta que apresenta melhor desempenho no LME-S tem um desempenho visivelmente pior no LME-M. Observamos uma diferen\u00e7a de 11,8 pontos entre as variantes de prompt no LME-M (72,41 TP3T contra 60,61 TP3T).<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">O LME-S \u00e9 um benchmark de desenvolvimento \u00fatil. O LME-M est\u00e1 mais pr\u00f3ximo de como a produ\u00e7\u00e3o realmente se parece. Avaliar em ambos, e prestar aten\u00e7\u00e3o quando os resultados divergem, vale o esfor\u00e7o.<\/p>\n\n\n\n<h2 id=\"h-how-we-measured-performance\" class=\"wp-block-heading\">Como medimos o desempenho<\/h2>\n\n\n\n<p class=\"wp-block-paragraph\">Monitoramos tr\u00eas m\u00e9tricas em todos os experimentos.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">A pontua\u00e7\u00e3o BLEU conta sobreposi\u00e7\u00f5es de n-gramas entre a resposta gerada e a resposta de refer\u00eancia. Para um exemplo simples: Se a resposta esperada for \u201cbob likes pancakes\u201d e o sistema retornar \u201cbob likes pancakes, cakes, and mustard,\u201d a pontua\u00e7\u00e3o BLEU ser\u00e1 0,4 porque apenas dois dos cinco pares de palavras na sa\u00edda correspondem \u00e0 resposta esperada. O BLEU \u00e9 uma verifica\u00e7\u00e3o de sanidade \u00fatil, mas penaliza par\u00e1frases e premia correspond\u00eancias textuais de uma maneira que nem sempre reflete se uma resposta est\u00e1 substantivamente correta.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">O escore F1 mede a sobreposi\u00e7\u00e3o em n\u00edvel de palavra sem exigir ordem das palavras, calculando a precis\u00e3o (qual fra\u00e7\u00e3o das palavras geradas aparece na refer\u00eancia) e a revoca\u00e7\u00e3o (qual fra\u00e7\u00e3o das palavras de refer\u00eancia aparece na sa\u00edda). Para o mesmo exemplo, o escore F1 \u00e9 0,67. Melhor, mas ainda puramente lexical.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">O Juiz LLM (pontua\u00e7\u00e3o J) \u00e9 a m\u00e9trica principal. Um LLM l\u00ea a resposta esperada e a resposta gerada e julga se a resposta gerada est\u00e1 semanticamente correta. Para \u201cbob gosta de panquecas\u201d versus \u201cbob gosta de panquecas, bolos e mostarda\u201d, o juiz atribui a nota 1; a resposta gerada cont\u00e9m as informa\u00e7\u00f5es corretas, mesmo com conte\u00fado adicional. Esta \u00e9 a m\u00e9trica em que mais confiamos para avaliar se o sistema est\u00e1 realmente funcionando.<\/p>\n\n\n\n<figure class=\"wp-block-image size-large\"><img loading=\"lazy\" decoding=\"async\" width=\"1024\" height=\"494\" src=\"https:\/\/www.couchbase.com\/blog\/wp-content\/uploads\/sites\/5\/2026\/07\/Screenshot-2026-07-23-at-3.29.50-PM-1024x494.png\" alt=\"\" class=\"wp-image-5568\" srcset=\"https:\/\/www.couchbase.com\/blog\/wp-content\/uploads\/sites\/5\/2026\/07\/Screenshot-2026-07-23-at-3.29.50-PM-1024x494.png 1024w, https:\/\/www.couchbase.com\/blog\/wp-content\/uploads\/sites\/5\/2026\/07\/Screenshot-2026-07-23-at-3.29.50-PM-300x145.png 300w, https:\/\/www.couchbase.com\/blog\/wp-content\/uploads\/sites\/5\/2026\/07\/Screenshot-2026-07-23-at-3.29.50-PM-768x371.png 768w, https:\/\/www.couchbase.com\/blog\/wp-content\/uploads\/sites\/5\/2026\/07\/Screenshot-2026-07-23-at-3.29.50-PM-18x9.png 18w, https:\/\/www.couchbase.com\/blog\/wp-content\/uploads\/sites\/5\/2026\/07\/Screenshot-2026-07-23-at-3.29.50-PM.png 1160w\" sizes=\"auto, (max-width: 1024px) 100vw, 1024px\" \/><\/figure>\n\n\n\n<p class=\"wp-block-paragraph\">Uma observa\u00e7\u00e3o importante sobre o J-score: as instru\u00e7\u00f5es dadas ao avaliador s\u00e3o t\u00e3o importantes quanto o pr\u00f3prio sistema que est\u00e1 sendo avaliado. O avaliador do LoCoMo est\u00e1 configurado para ser generoso \u2013 \u201cdesde que a resposta aborde o mesmo tema, considere-a correta\u201d. O LongMemEval utiliza variantes espec\u00edficas para cada categoria: uma para racioc\u00ednio temporal (permite erros de \u201coff-by-one\u201d na contagem de dias), uma para atualiza\u00e7\u00e3o de conhecimento (considera correta a resposta atualizada, mesmo que informa\u00e7\u00f5es antigas tamb\u00e9m sejam mencionadas), uma para prefer\u00eancias (baseada em crit\u00e9rios de avalia\u00e7\u00e3o) e uma para precis\u00e3o direta. Executar nosso sistema com um avaliador muito mais rigoroso reduz as pontua\u00e7\u00f5es em v\u00e1rios pontos, independentemente de qualquer altera\u00e7\u00e3o no sistema. Compara\u00e7\u00f5es entre avaliadores alteram as pontua\u00e7\u00f5es em 5 a 10 pontos e n\u00e3o s\u00e3o interpret\u00e1veis. Quando executamos o LoCoMo com instru\u00e7\u00f5es de avalia\u00e7\u00e3o usadas por outras solu\u00e7\u00f5es de mem\u00f3ria, obtivemos uma pontua\u00e7\u00e3o 100% teoricamente imposs\u00edvel, o que indicou imediatamente que a compara\u00e7\u00e3o foi inflacionada pela instru\u00e7\u00e3o, em vez de refletir a qualidade da recupera\u00e7\u00e3o. Relatar uma pontua\u00e7\u00e3o J sem especificar a instru\u00e7\u00e3o do avaliador \u00e9 como relatar uma nota de prova sem especificar qual prova foi aplicada.<\/p>\n\n\n\n<h2 id=\"h-how-the-pipeline-works\" class=\"wp-block-heading\">Como o pipeline funciona<\/h2>\n\n\n\n<p class=\"wp-block-paragraph\">Quando um turno de conversa entra no sistema, ele passa por uma extra\u00e7\u00e3o de ponto de vista duplo antes que qualquer coisa seja gravada no banco de dados. O c\u00f3digo de ingest\u00e3o emparelha cada mensagem do usu\u00e1rio com a resposta seguinte do assistente e cria dois blocos de mem\u00f3ria, um indexado para o usu\u00e1rio, outro indexado para o assistente. \u201cUsu\u00e1rio disse X, Assistente disse Y\u201d produz um bloco a partir da perspectiva do usu\u00e1rio e um bloco separado a partir da perspectiva do assistente.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Com context_required=True configurado em cada pipeline, o sistema dispara uma chamada de LLM durante a ingest\u00e3o para extrair um resumo em prosa e uma lista de fatos discretos de cada troca. O que \u00e9 gravado no Couchbase s\u00e3o tr\u00eas coisas: o texto bruto da mensagem, o resumo e uma lista de contextos de strings de fatos. Os carimbos de data\/hora s\u00e3o anexados como anota\u00e7\u00f5es em formato leg\u00edvel por humanos (\u201c1:10 pm on 27 March, 2023\u201d) para que o modelo possa raciocinar sobre eles naturalmente no momento da recupera\u00e7\u00e3o.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Um bloco de mem\u00f3ria se parece mais ou menos com isto:<\/p>\n\n\n\n<pre class=\"wp-block-code\"><code>{\n  \"message\": \"User: When did I start the job? Assistant: You mentioned starting in March 2023.\",\n  \"summary\": \"O usu\u00e1rio est\u00e1 perguntando sobre a data de in\u00edcio do seu trabalho; o assistente confirmou mar\u00e7o de 2023.\",\n  \"contexts\": [\n    \"O usu\u00e1rio come\u00e7ou seu trabalho em mar\u00e7o de 2023\",\n    \"O usu\u00e1rio expressou incerteza sobre a data exata de in\u00edcio\"\n  ],\n  \"annotations\": {\n    \"time\": \"1:10 pm on 27 March, 2023\",\n    \"conversation_id\": \"abc123\"\n  }\n}<\/code><\/pre>\n\n\n\n<p class=\"wp-block-paragraph\">A chamada de ingest\u00e3o retorna em aproximadamente 251ms no p50, cobrindo valida\u00e7\u00e3o, gera\u00e7\u00e3o de embeddings e a grava\u00e7\u00e3o no Couchbase. A extra\u00e7\u00e3o de contexto do LLM (resumo e lista de contextos) ocorre de forma ass\u00edncrona em segundo plano e leva aproximadamente 3,6 segundos em m\u00e9dia. O chamador n\u00e3o espera por isso. Esse desacoplamento, por meio de uma fila de despacho que separa a lat\u00eancia de ingest\u00e3o da lat\u00eancia de extra\u00e7\u00e3o, \u00e9 o que torna o sistema pr\u00e1tico em escala. Um modo s\u00edncrono est\u00e1 dispon\u00edvel quando a pesquisabilidade imediata \u00e9 necess\u00e1ria, ao custo da espera de 3,6 segundos.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">A pesquisa funciona de maneira diferente. A chamada get_memory() incorpora a consulta (aproximadamente 305ms no p50) e executa uma busca de similaridade vetorial contra os blocos armazenados no Couchbase (aproximadamente 5ms no p50). A lat\u00eancia total voltada para o cliente \u00e9 de cerca de 298ms no p50. O gargalo \u00e9 a etapa de incorpora\u00e7\u00e3o, n\u00e3o a recupera\u00e7\u00e3o em si. A busca de texto completo (FTS) do Couchbase \u00e9 r\u00e1pida.<\/p>\n\n\n\n<figure class=\"wp-block-image size-large\"><img loading=\"lazy\" decoding=\"async\" width=\"1024\" height=\"427\" src=\"https:\/\/www.couchbase.com\/blog\/wp-content\/uploads\/sites\/5\/2026\/07\/Screenshot-2026-07-23-at-3.30.55-PM-1024x427.png\" alt=\"\" class=\"wp-image-5569\" srcset=\"https:\/\/www.couchbase.com\/blog\/wp-content\/uploads\/sites\/5\/2026\/07\/Screenshot-2026-07-23-at-3.30.55-PM-1024x427.png 1024w, https:\/\/www.couchbase.com\/blog\/wp-content\/uploads\/sites\/5\/2026\/07\/Screenshot-2026-07-23-at-3.30.55-PM-300x125.png 300w, https:\/\/www.couchbase.com\/blog\/wp-content\/uploads\/sites\/5\/2026\/07\/Screenshot-2026-07-23-at-3.30.55-PM-768x320.png 768w, https:\/\/www.couchbase.com\/blog\/wp-content\/uploads\/sites\/5\/2026\/07\/Screenshot-2026-07-23-at-3.30.55-PM-18x8.png 18w, https:\/\/www.couchbase.com\/blog\/wp-content\/uploads\/sites\/5\/2026\/07\/Screenshot-2026-07-23-at-3.30.55-PM.png 1228w\" sizes=\"auto, (max-width: 1024px) 100vw, 1024px\" \/><\/figure>\n\n\n\n<p class=\"wp-block-paragraph\">Especificamente para o pipeline de avalia\u00e7\u00e3o: as mem\u00f3rias s\u00e3o ingeridas uma vez e persistem no Couchbase. As etapas de busca e avalia\u00e7\u00e3o s\u00e3o executadas no banco de dados ativo com diferentes par\u00e2metros de configura\u00e7\u00e3o, sem necessidade de nova ingest\u00e3o entre as varreduras de par\u00e2metros.&nbsp;<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">O pipeline est\u00e1 constru\u00eddo. Os benchmarks est\u00e3o selecionados. As m\u00e9tricas est\u00e3o definidas. Tudo isso \u00e9 trabalho de base. A verdadeira pergunta \u00e9 o que realmente acontece quando voc\u00ea executa o sistema contra benchmarks reais em grande escala, em v\u00e1rias configura\u00e7\u00f5es experimentais diferentes. \u00c9 isso que <a href=\"https:\/\/www.couchbase.com\/blog\/pt\/what-we-learned-evaluating-agent-memorythe-results-part-2\/\">Parte<\/a><a href=\"https:\/\/www.couchbase.com\/blog\/pt\/what-we-learned-evaluating-agent-memorythe-setup-part-1\/\"> 2 <\/a>\u00e9 sobre.<\/p>","protected":false},"excerpt":{"rendered":"<p>Agent memory is one of the harder infrastructure problems in applied AI right now, and the benchmark ecosystem around it is still taking shape. This is a two-part write-up. Part 1 covers what we were measuring against, how we measured it, and how the pipeline is built. Part 2 covers what the experiments actually showed. [&hellip;]<\/p>\n","protected":false},"author":85725,"featured_media":5571,"comment_status":"open","ping_status":"open","sticky":false,"template":"","format":"standard","meta":{"_acf_changed":false,"inline_featured_image":false,"_acf":"","footnotes":""},"categories":[920],"tags":[],"ppma_author":[1046],"class_list":["post-5566","post","type-post","status-publish","format-standard","has-post-thumbnail","hentry","category-agentic-ai-apps"],"yoast_head":"<!-- This site is optimized with the Yoast SEO Premium plugin v28.3 (Yoast SEO v28.3) - https:\/\/yoast.com\/product\/yoast-seo-premium-wordpress\/ -->\n<title>What We Learned Evaluating Agent Memory:The Setup (Part 1)\u00a0 - The Couchbase Blog<\/title>\n<meta name=\"robots\" content=\"index, follow, max-snippet:-1, max-image-preview:large, max-video-preview:-1\" \/>\n<link rel=\"canonical\" href=\"https:\/\/www.couchbase.com\/blog\/pt\/what-we-learned-evaluating-agent-memorythe-setup-part-1\/\" \/>\n<meta property=\"og:locale\" content=\"pt_BR\" \/>\n<meta property=\"og:type\" content=\"article\" \/>\n<meta property=\"og:title\" content=\"What We Learned Evaluating Agent Memory:The Setup (Part 1)\u00a0\" \/>\n<meta property=\"og:description\" content=\"Agent memory is one of the harder infrastructure problems in applied AI right now, and the benchmark ecosystem around it is still taking shape. This is a two-part write-up. Part 1 covers what we were measuring against, how we measured it, and how the pipeline is built. Part 2 covers what the experiments actually showed. [&hellip;]\" \/>\n<meta property=\"og:url\" content=\"https:\/\/www.couchbase.com\/blog\/pt\/what-we-learned-evaluating-agent-memorythe-setup-part-1\/\" \/>\n<meta property=\"og:site_name\" content=\"The Couchbase Blog\" \/>\n<meta property=\"article:published_time\" content=\"2026-07-28T15:00:00+00:00\" \/>\n<meta property=\"article:modified_time\" content=\"2026-07-30T22:22:40+00:00\" \/>\n<meta property=\"og:image\" content=\"https:\/\/www.couchbase.com\/blog\/wp-content\/uploads\/sites\/5\/2026\/07\/What-We-Learned-Evaluating-Agent-Memory-P1.png\" \/>\n\t<meta property=\"og:image:width\" content=\"2400\" \/>\n\t<meta property=\"og:image:height\" content=\"1256\" \/>\n\t<meta property=\"og:image:type\" content=\"image\/png\" \/>\n<meta name=\"author\" content=\"Namita Achyuthan, Software Engineer\" \/>\n<meta name=\"twitter:card\" content=\"summary_large_image\" \/>\n<meta name=\"twitter:label1\" content=\"Written by\" \/>\n\t<meta name=\"twitter:data1\" content=\"Namita Achyuthan, Software Engineer\" \/>\n\t<meta name=\"twitter:label2\" content=\"Est. reading time\" \/>\n\t<meta name=\"twitter:data2\" content=\"11 minutos\" \/>\n<script type=\"application\/ld+json\" class=\"yoast-schema-graph\">{\"@context\":\"https:\\\/\\\/schema.org\",\"@graph\":[{\"@type\":\"Article\",\"@id\":\"https:\\\/\\\/www.couchbase.com\\\/blog\\\/what-we-learned-evaluating-agent-memorythe-setup-part-1\\\/#article\",\"isPartOf\":{\"@id\":\"https:\\\/\\\/www.couchbase.com\\\/blog\\\/what-we-learned-evaluating-agent-memorythe-setup-part-1\\\/\"},\"author\":{\"name\":\"Namita Achyuthan, Software Engineer\",\"@id\":\"https:\\\/\\\/www.couchbase.com\\\/blog\\\/#\\\/schema\\\/person\\\/b745ecfa382414e44c76586ae27401f0\"},\"headline\":\"What We Learned Evaluating Agent Memory:The Setup (Part 1)\u00a0\",\"datePublished\":\"2026-07-28T15:00:00+00:00\",\"dateModified\":\"2026-07-30T22:22:40+00:00\",\"mainEntityOfPage\":{\"@id\":\"https:\\\/\\\/www.couchbase.com\\\/blog\\\/what-we-learned-evaluating-agent-memorythe-setup-part-1\\\/\"},\"wordCount\":2197,\"commentCount\":0,\"publisher\":{\"@id\":\"https:\\\/\\\/www.couchbase.com\\\/blog\\\/#organization\"},\"image\":{\"@id\":\"https:\\\/\\\/www.couchbase.com\\\/blog\\\/what-we-learned-evaluating-agent-memorythe-setup-part-1\\\/#primaryimage\"},\"thumbnailUrl\":\"https:\\\/\\\/www.couchbase.com\\\/blog\\\/wp-content\\\/uploads\\\/sites\\\/5\\\/2026\\\/07\\\/What-We-Learned-Evaluating-Agent-Memory-P1.png\",\"articleSection\":[\"Agentic AI Applications\"],\"inLanguage\":\"pt-BR\",\"potentialAction\":[{\"@type\":\"CommentAction\",\"name\":\"Comment\",\"target\":[\"https:\\\/\\\/www.couchbase.com\\\/blog\\\/what-we-learned-evaluating-agent-memorythe-setup-part-1\\\/#respond\"]}]},{\"@type\":\"WebPage\",\"@id\":\"https:\\\/\\\/www.couchbase.com\\\/blog\\\/what-we-learned-evaluating-agent-memorythe-setup-part-1\\\/\",\"url\":\"https:\\\/\\\/www.couchbase.com\\\/blog\\\/what-we-learned-evaluating-agent-memorythe-setup-part-1\\\/\",\"name\":\"What We Learned Evaluating Agent Memory:The Setup (Part 1)\u00a0 - The Couchbase Blog\",\"isPartOf\":{\"@id\":\"https:\\\/\\\/www.couchbase.com\\\/blog\\\/#website\"},\"primaryImageOfPage\":{\"@id\":\"https:\\\/\\\/www.couchbase.com\\\/blog\\\/what-we-learned-evaluating-agent-memorythe-setup-part-1\\\/#primaryimage\"},\"image\":{\"@id\":\"https:\\\/\\\/www.couchbase.com\\\/blog\\\/what-we-learned-evaluating-agent-memorythe-setup-part-1\\\/#primaryimage\"},\"thumbnailUrl\":\"https:\\\/\\\/www.couchbase.com\\\/blog\\\/wp-content\\\/uploads\\\/sites\\\/5\\\/2026\\\/07\\\/What-We-Learned-Evaluating-Agent-Memory-P1.png\",\"datePublished\":\"2026-07-28T15:00:00+00:00\",\"dateModified\":\"2026-07-30T22:22:40+00:00\",\"breadcrumb\":{\"@id\":\"https:\\\/\\\/www.couchbase.com\\\/blog\\\/what-we-learned-evaluating-agent-memorythe-setup-part-1\\\/#breadcrumb\"},\"inLanguage\":\"pt-BR\",\"potentialAction\":[{\"@type\":\"ReadAction\",\"target\":[\"https:\\\/\\\/www.couchbase.com\\\/blog\\\/what-we-learned-evaluating-agent-memorythe-setup-part-1\\\/\"]}]},{\"@type\":\"ImageObject\",\"inLanguage\":\"pt-BR\",\"@id\":\"https:\\\/\\\/www.couchbase.com\\\/blog\\\/what-we-learned-evaluating-agent-memorythe-setup-part-1\\\/#primaryimage\",\"url\":\"https:\\\/\\\/www.couchbase.com\\\/blog\\\/wp-content\\\/uploads\\\/sites\\\/5\\\/2026\\\/07\\\/What-We-Learned-Evaluating-Agent-Memory-P1.png\",\"contentUrl\":\"https:\\\/\\\/www.couchbase.com\\\/blog\\\/wp-content\\\/uploads\\\/sites\\\/5\\\/2026\\\/07\\\/What-We-Learned-Evaluating-Agent-Memory-P1.png\",\"width\":2400,\"height\":1256},{\"@type\":\"BreadcrumbList\",\"@id\":\"https:\\\/\\\/www.couchbase.com\\\/blog\\\/what-we-learned-evaluating-agent-memorythe-setup-part-1\\\/#breadcrumb\",\"itemListElement\":[{\"@type\":\"ListItem\",\"position\":1,\"name\":\"Home\",\"item\":\"https:\\\/\\\/www.couchbase.com\\\/blog\\\/\"},{\"@type\":\"ListItem\",\"position\":2,\"name\":\"What We Learned Evaluating Agent Memory:The Setup (Part 1)\u00a0\"}]},{\"@type\":\"WebSite\",\"@id\":\"https:\\\/\\\/www.couchbase.com\\\/blog\\\/#website\",\"url\":\"https:\\\/\\\/www.couchbase.com\\\/blog\\\/\",\"name\":\"The Couchbase Blog\",\"description\":\"Couchbase, the NoSQL Database\",\"publisher\":{\"@id\":\"https:\\\/\\\/www.couchbase.com\\\/blog\\\/#organization\"},\"potentialAction\":[{\"@type\":\"SearchAction\",\"target\":{\"@type\":\"EntryPoint\",\"urlTemplate\":\"https:\\\/\\\/www.couchbase.com\\\/blog\\\/?s={search_term_string}\"},\"query-input\":{\"@type\":\"PropertyValueSpecification\",\"valueRequired\":true,\"valueName\":\"search_term_string\"}}],\"inLanguage\":\"pt-BR\"},{\"@type\":\"Organization\",\"@id\":\"https:\\\/\\\/www.couchbase.com\\\/blog\\\/#organization\",\"name\":\"The Couchbase Blog\",\"url\":\"https:\\\/\\\/www.couchbase.com\\\/blog\\\/\",\"logo\":{\"@type\":\"ImageObject\",\"inLanguage\":\"pt-BR\",\"@id\":\"https:\\\/\\\/www.couchbase.com\\\/blog\\\/#\\\/schema\\\/logo\\\/image\\\/\",\"url\":\"https:\\\/\\\/www.couchbase.com\\\/blog\\\/wp-content\\\/uploads\\\/sites\\\/5\\\/2026\\\/06\\\/logo.svg\",\"contentUrl\":\"https:\\\/\\\/www.couchbase.com\\\/blog\\\/wp-content\\\/uploads\\\/sites\\\/5\\\/2026\\\/06\\\/logo.svg\",\"width\":\"1024\",\"height\":\"1024\",\"caption\":\"The Couchbase Blog\"},\"image\":{\"@id\":\"https:\\\/\\\/www.couchbase.com\\\/blog\\\/#\\\/schema\\\/logo\\\/image\\\/\"}},{\"@type\":\"Person\",\"@id\":\"https:\\\/\\\/www.couchbase.com\\\/blog\\\/#\\\/schema\\\/person\\\/b745ecfa382414e44c76586ae27401f0\",\"name\":\"Namita Achyuthan, Software Engineer\",\"image\":{\"@type\":\"ImageObject\",\"inLanguage\":\"pt-BR\",\"@id\":\"https:\\\/\\\/www.couchbase.com\\\/blog\\\/wp-content\\\/uploads\\\/sites\\\/5\\\/2026\\\/07\\\/Namita-Achyuthan.jpg14f8bb4bd3ae507d5e9374e1855de7a6\",\"url\":\"https:\\\/\\\/www.couchbase.com\\\/blog\\\/wp-content\\\/uploads\\\/sites\\\/5\\\/2026\\\/07\\\/Namita-Achyuthan.jpg\",\"contentUrl\":\"https:\\\/\\\/www.couchbase.com\\\/blog\\\/wp-content\\\/uploads\\\/sites\\\/5\\\/2026\\\/07\\\/Namita-Achyuthan.jpg\",\"caption\":\"Namita Achyuthan, Software Engineer\"},\"url\":\"https:\\\/\\\/www.couchbase.com\\\/blog\\\/pt\\\/author\\\/namitaachyuthan\\\/\"}]}<\/script>\n<!-- \/ Yoast SEO Premium plugin. -->","yoast_head_json":{"title":"What We Learned Evaluating Agent Memory:The Setup (Part 1)\u00a0 - The Couchbase Blog","robots":{"index":"index","follow":"follow","max-snippet":"max-snippet:-1","max-image-preview":"max-image-preview:large","max-video-preview":"max-video-preview:-1"},"canonical":"https:\/\/www.couchbase.com\/blog\/pt\/what-we-learned-evaluating-agent-memorythe-setup-part-1\/","og_locale":"pt_BR","og_type":"article","og_title":"What We Learned Evaluating Agent Memory:The Setup (Part 1)\u00a0","og_description":"Agent memory is one of the harder infrastructure problems in applied AI right now, and the benchmark ecosystem around it is still taking shape. This is a two-part write-up. Part 1 covers what we were measuring against, how we measured it, and how the pipeline is built. Part 2 covers what the experiments actually showed. [&hellip;]","og_url":"https:\/\/www.couchbase.com\/blog\/pt\/what-we-learned-evaluating-agent-memorythe-setup-part-1\/","og_site_name":"The Couchbase Blog","article_published_time":"2026-07-28T15:00:00+00:00","article_modified_time":"2026-07-30T22:22:40+00:00","og_image":[{"width":2400,"height":1256,"url":"https:\/\/www.couchbase.com\/blog\/wp-content\/uploads\/sites\/5\/2026\/07\/What-We-Learned-Evaluating-Agent-Memory-P1.png","type":"image\/png"}],"author":"Namita Achyuthan, Software Engineer","twitter_card":"summary_large_image","twitter_misc":{"Written by":"Namita Achyuthan, Software Engineer","Est. reading time":"11 minutos"},"schema":{"@context":"https:\/\/schema.org","@graph":[{"@type":"Article","@id":"https:\/\/www.couchbase.com\/blog\/what-we-learned-evaluating-agent-memorythe-setup-part-1\/#article","isPartOf":{"@id":"https:\/\/www.couchbase.com\/blog\/what-we-learned-evaluating-agent-memorythe-setup-part-1\/"},"author":{"name":"Namita Achyuthan, Software Engineer","@id":"https:\/\/www.couchbase.com\/blog\/#\/schema\/person\/b745ecfa382414e44c76586ae27401f0"},"headline":"What We Learned Evaluating Agent Memory:The Setup (Part 1)\u00a0","datePublished":"2026-07-28T15:00:00+00:00","dateModified":"2026-07-30T22:22:40+00:00","mainEntityOfPage":{"@id":"https:\/\/www.couchbase.com\/blog\/what-we-learned-evaluating-agent-memorythe-setup-part-1\/"},"wordCount":2197,"commentCount":0,"publisher":{"@id":"https:\/\/www.couchbase.com\/blog\/#organization"},"image":{"@id":"https:\/\/www.couchbase.com\/blog\/what-we-learned-evaluating-agent-memorythe-setup-part-1\/#primaryimage"},"thumbnailUrl":"https:\/\/www.couchbase.com\/blog\/wp-content\/uploads\/sites\/5\/2026\/07\/What-We-Learned-Evaluating-Agent-Memory-P1.png","articleSection":["Agentic AI Applications"],"inLanguage":"pt-BR","potentialAction":[{"@type":"CommentAction","name":"Comment","target":["https:\/\/www.couchbase.com\/blog\/what-we-learned-evaluating-agent-memorythe-setup-part-1\/#respond"]}]},{"@type":"WebPage","@id":"https:\/\/www.couchbase.com\/blog\/what-we-learned-evaluating-agent-memorythe-setup-part-1\/","url":"https:\/\/www.couchbase.com\/blog\/what-we-learned-evaluating-agent-memorythe-setup-part-1\/","name":"What We Learned Evaluating Agent Memory:The Setup (Part 1)\u00a0 - The Couchbase Blog","isPartOf":{"@id":"https:\/\/www.couchbase.com\/blog\/#website"},"primaryImageOfPage":{"@id":"https:\/\/www.couchbase.com\/blog\/what-we-learned-evaluating-agent-memorythe-setup-part-1\/#primaryimage"},"image":{"@id":"https:\/\/www.couchbase.com\/blog\/what-we-learned-evaluating-agent-memorythe-setup-part-1\/#primaryimage"},"thumbnailUrl":"https:\/\/www.couchbase.com\/blog\/wp-content\/uploads\/sites\/5\/2026\/07\/What-We-Learned-Evaluating-Agent-Memory-P1.png","datePublished":"2026-07-28T15:00:00+00:00","dateModified":"2026-07-30T22:22:40+00:00","breadcrumb":{"@id":"https:\/\/www.couchbase.com\/blog\/what-we-learned-evaluating-agent-memorythe-setup-part-1\/#breadcrumb"},"inLanguage":"pt-BR","potentialAction":[{"@type":"ReadAction","target":["https:\/\/www.couchbase.com\/blog\/what-we-learned-evaluating-agent-memorythe-setup-part-1\/"]}]},{"@type":"ImageObject","inLanguage":"pt-BR","@id":"https:\/\/www.couchbase.com\/blog\/what-we-learned-evaluating-agent-memorythe-setup-part-1\/#primaryimage","url":"https:\/\/www.couchbase.com\/blog\/wp-content\/uploads\/sites\/5\/2026\/07\/What-We-Learned-Evaluating-Agent-Memory-P1.png","contentUrl":"https:\/\/www.couchbase.com\/blog\/wp-content\/uploads\/sites\/5\/2026\/07\/What-We-Learned-Evaluating-Agent-Memory-P1.png","width":2400,"height":1256},{"@type":"BreadcrumbList","@id":"https:\/\/www.couchbase.com\/blog\/what-we-learned-evaluating-agent-memorythe-setup-part-1\/#breadcrumb","itemListElement":[{"@type":"ListItem","position":1,"name":"Home","item":"https:\/\/www.couchbase.com\/blog\/"},{"@type":"ListItem","position":2,"name":"What We Learned Evaluating Agent Memory:The Setup (Part 1)\u00a0"}]},{"@type":"WebSite","@id":"https:\/\/www.couchbase.com\/blog\/#website","url":"https:\/\/www.couchbase.com\/blog\/","name":"O Blog da Couchbase","description":"Couchbase, o Banco de Dados NoSQL","publisher":{"@id":"https:\/\/www.couchbase.com\/blog\/#organization"},"potentialAction":[{"@type":"SearchAction","target":{"@type":"EntryPoint","urlTemplate":"https:\/\/www.couchbase.com\/blog\/?s={search_term_string}"},"query-input":{"@type":"PropertyValueSpecification","valueRequired":true,"valueName":"search_term_string"}}],"inLanguage":"pt-BR"},{"@type":"Organization","@id":"https:\/\/www.couchbase.com\/blog\/#organization","name":"O Blog da Couchbase","url":"https:\/\/www.couchbase.com\/blog\/","logo":{"@type":"ImageObject","inLanguage":"pt-BR","@id":"https:\/\/www.couchbase.com\/blog\/#\/schema\/logo\/image\/","url":"https:\/\/www.couchbase.com\/blog\/wp-content\/uploads\/sites\/5\/2026\/06\/logo.svg","contentUrl":"https:\/\/www.couchbase.com\/blog\/wp-content\/uploads\/sites\/5\/2026\/06\/logo.svg","width":"1024","height":"1024","caption":"The Couchbase Blog"},"image":{"@id":"https:\/\/www.couchbase.com\/blog\/#\/schema\/logo\/image\/"}},{"@type":"Person","@id":"https:\/\/www.couchbase.com\/blog\/#\/schema\/person\/b745ecfa382414e44c76586ae27401f0","name":"Namita Achyuthan, Engenheira de Software","image":{"@type":"ImageObject","inLanguage":"pt-BR","@id":"https:\/\/www.couchbase.com\/blog\/wp-content\/uploads\/sites\/5\/2026\/07\/Namita-Achyuthan.jpg14f8bb4bd3ae507d5e9374e1855de7a6","url":"https:\/\/www.couchbase.com\/blog\/wp-content\/uploads\/sites\/5\/2026\/07\/Namita-Achyuthan.jpg","contentUrl":"https:\/\/www.couchbase.com\/blog\/wp-content\/uploads\/sites\/5\/2026\/07\/Namita-Achyuthan.jpg","caption":"Namita Achyuthan, Software Engineer"},"url":"https:\/\/www.couchbase.com\/blog\/pt\/author\/namitaachyuthan\/"}]}},"acf":[],"authors":[{"term_id":1046,"user_id":85725,"is_guest":0,"slug":"namitaachyuthan","display_name":"Namita Achyuthan, Software Engineer","avatar_url":{"url":"https:\/\/www.couchbase.com\/blog\/wp-content\/uploads\/sites\/5\/2026\/07\/Namita-Achyuthan.jpg","url2x":"https:\/\/www.couchbase.com\/blog\/wp-content\/uploads\/sites\/5\/2026\/07\/Namita-Achyuthan.jpg"},"author_category":"1","first_name":"Namita","last_name":"Achyuthan","user_url":"","job_title":"Software Engineer","description":""}],"_links":{"self":[{"href":"https:\/\/www.couchbase.com\/blog\/pt\/wp-json\/wp\/v2\/posts\/5566","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/www.couchbase.com\/blog\/pt\/wp-json\/wp\/v2\/posts"}],"about":[{"href":"https:\/\/www.couchbase.com\/blog\/pt\/wp-json\/wp\/v2\/types\/post"}],"author":[{"embeddable":true,"href":"https:\/\/www.couchbase.com\/blog\/pt\/wp-json\/wp\/v2\/users\/85725"}],"replies":[{"embeddable":true,"href":"https:\/\/www.couchbase.com\/blog\/pt\/wp-json\/wp\/v2\/comments?post=5566"}],"version-history":[{"count":3,"href":"https:\/\/www.couchbase.com\/blog\/pt\/wp-json\/wp\/v2\/posts\/5566\/revisions"}],"predecessor-version":[{"id":5583,"href":"https:\/\/www.couchbase.com\/blog\/pt\/wp-json\/wp\/v2\/posts\/5566\/revisions\/5583"}],"wp:featuredmedia":[{"embeddable":true,"href":"https:\/\/www.couchbase.com\/blog\/pt\/wp-json\/wp\/v2\/media\/5571"}],"wp:attachment":[{"href":"https:\/\/www.couchbase.com\/blog\/pt\/wp-json\/wp\/v2\/media?parent=5566"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/www.couchbase.com\/blog\/pt\/wp-json\/wp\/v2\/categories?post=5566"},{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/www.couchbase.com\/blog\/pt\/wp-json\/wp\/v2\/tags?post=5566"},{"taxonomy":"author","embeddable":true,"href":"https:\/\/www.couchbase.com\/blog\/pt\/wp-json\/wp\/v2\/ppma_author?post=5566"}],"curies":[{"name":"bem-jogado","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}