{"id":5572,"date":"2026-07-29T09:00:00","date_gmt":"2026-07-29T16:00:00","guid":{"rendered":"https:\/\/www.couchbase.com\/blog\/?p=5572"},"modified":"2026-07-30T15:23:25","modified_gmt":"2026-07-30T22:23:25","slug":"what-we-learned-evaluating-agent-memorythe-results-part-2","status":"publish","type":"post","link":"https:\/\/www.couchbase.com\/blog\/es\/what-we-learned-evaluating-agent-memorythe-results-part-2\/","title":{"rendered":"Lo que aprendimos al evaluar la memoria de los agentes: los resultados (Parte 2)"},"content":{"rendered":"<p class=\"wp-block-paragraph\">Esta es la segunda parte de una evaluaci\u00f3n de dos partes sobre la Memoria de Agentes de Couchbase. Si no ha le\u00eddo la Parte 1, los puntos de referencia, las m\u00e9tricas y la arquitectura del canal est\u00e1n explicados <a href=\"https:\/\/www.couchbase.com\/blog\/es\/what-we-learned-evaluating-agent-memorythe-setup-part-1\/\">all\u00ed<\/a>. Esta parte describe lo que sucedi\u00f3 cuando realmente realizamos los experimentos. Nota: No todo sali\u00f3 como esper\u00e1bamos.<\/p>\n\n\n\n<h2 id=\"h-what-we-tried-and-what-happened\" class=\"wp-block-heading\"><strong>Lo que intentamos y lo que sucedi\u00f3<\/strong><\/h2>\n\n\n\n<h3 id=\"h-memory-format-raw-messages-vs-summaries\" class=\"wp-block-heading\">Formato de memoria: mensajes sin procesar frente a res\u00famenes<\/h3>\n\n\n\n<p class=\"wp-block-paragraph\">La primera variable que probamos fue si almacenar los turnos de conversaci\u00f3n sin procesar o los res\u00famenes generados por LLM.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">La intuici\u00f3n detr\u00e1s de los res\u00famenes es razonable: las conversaciones son ruidosas, y un resumen limpio podr\u00eda darle al recuperador una mejor se\u00f1al. Los res\u00famenes tambi\u00e9n reducen significativamente el costo de tokens, pasando de aproximadamente 13,000 tokens a 6,200 para el mismo k en LME-S.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">El resultado: los mensajes sin procesar superan en general a los res\u00famenes en los tres conjuntos de datos. En LME-S, los mensajes sin procesar obtienen una puntuaci\u00f3n de 0.637 frente a 0.614 de los res\u00famenes. En LME-M, la brecha es mayor: 0.724 frente a 0.574. En LoCoMo, 0.826 frente a 0.675.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">La explicaci\u00f3n es la categor\u00eda SSA. Las preguntas del Asistente de Sesi\u00f3n \u00danica (SSA) preguntan sobre algo que el asistente dijo en una sesi\u00f3n anterior y, a menudo, requieren una redacci\u00f3n exacta. La sumarizaci\u00f3n descarta los nombres propios, las recomendaciones espec\u00edficas y las frases precisas. El SSA cae de 0,982 a 0,768 en LME-S al cambiar de mensajes sin procesar a res\u00famenes. En LME-M, cae de 0,946 a 0,714. En LoCoMo, algo espec\u00edfico como \u201cuna convenci\u00f3n de tecnolog\u00eda para el bien\u201d se convierte en \u201cuna convenci\u00f3n\u201d despu\u00e9s de la sumarizaci\u00f3n, lo que rompe cualquier cadena de razonamiento que dependa de hacer coincidir esa entidad.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Los res\u00famenes no carecen de m\u00e9rito. Mejoran las puntuaciones de SSP y MS porque comprimir informaci\u00f3n entre turnos reduce el ruido y facilita las conexiones entre sesiones. En cuanto a las preguntas de preferencia, la compresi\u00f3n tiende a revelar las se\u00f1ales de preferencia con mayor claridad. Y la reducci\u00f3n de tokens es real. Para implementaciones donde las preguntas de SSA est\u00e1n fuera del alcance, los res\u00famenes son una configuraci\u00f3n viable. Para implementaciones donde los usuarios pueden preguntar sobre cosas que el asistente dijo anteriormente, o donde la coincidencia exacta de entidades importa, los mensajes sin procesar son necesarios.<\/p>\n\n\n\n<h3 id=\"h-retrieval-depth-k-and-context-tokens\" class=\"wp-block-heading\">Profundidad de recuperaci\u00f3n (k) y tokens de contexto<\/h3>\n\n\n\n<p class=\"wp-block-paragraph\">En LME-S con la mejor configuraci\u00f3n (Experimento 25), k=10 es \u00f3ptimo; la puntuaci\u00f3n J alcanza un m\u00e1ximo de 0,701 con una ventana de contexto promedio de 3 352 tokens. Con k=5, el modelo multisesi\u00f3n cae 31% porque es posible que la memoria relevante no se encuentre entre los cinco primeros resultados. Con k = 15, el recuento de tokens aumenta en 481 TP3T, mientras que la puntuaci\u00f3n J disminuye en 31 TP3T; los recuerdos adicionales a\u00f1aden ruido sin aportar se\u00f1al. Con k = 30, la puntuaci\u00f3n J cae a 0,653 y la latencia aumenta en aproximadamente dos segundos.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">En LME-M, se necesita k=20. En LoCoMo, la recuperaci\u00f3n de mensajes sin procesar se estanca alrededor de k=15 sin ninguna ganancia significativa a partir de k=20 o m\u00e1s.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Vale la pena examinar directamente los n\u00fameros de tokens de contexto. En k=5, el contexto promedio es de 1,688 tokens. En k=10, es de 3,352. En k=30, alcanza los 9,726. El salto de k=10 a k=30 triplica el costo del contexto y degrada el rendimiento. En el Experimento 7, k=10 con 6,782 tokens obtuvo una puntuaci\u00f3n m\u00e1s alta que k=20 de la l\u00ednea base con 13,087 tokens utilizando el mismo aviso. M\u00e1s contexto no produce mejores respuestas. M\u00e1s all\u00e1 del punto \u00f3ptimo, introduce ruido que al modelo le cuesta filtrar.<\/p>\n\n\n\n<h3 id=\"h-temporal-grounding\" class=\"wp-block-heading\">Anclaje temporal<\/h3>\n\n\n\n<p class=\"wp-block-paragraph\">El razonamiento temporal es la categor\u00eda m\u00e1s d\u00e9bil en todas las l\u00edneas base. En LoCoMo sin ninguna informaci\u00f3n de marca de tiempo, las puntuaciones temporales son de 0.103 en la l\u00ednea base. El modo de falla es consistente: las conversaciones contienen expresiones de tiempo relativo (\u201cayer\u201d, \u201cla semana pasada\u201d, \u201chace unos tres meses\u201d), que se almacenan en la base de datos en alg\u00fan momento y se recuperan semanas o meses despu\u00e9s. Cuando el modelo lee \u201cFui al museo ayer\u201d, resuelve \u201cayer\u201d con respecto al reloj de inferencia (la fecha actual) en lugar de la fecha de la conversaci\u00f3n original. El recuerdo se almacen\u00f3 en febrero de 2026. La visita al museo fue \u201cayer\u201d. El modelo concluye que la visita al museo fue en febrero de 2026.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Tres intervenciones produjeron tres resultados muy diferentes:<\/p>\n\n\n\n<ol class=\"wp-block-list\">\n<li><strong>Anteponga la fecha de la sesi\u00f3n original a cada recuerdo almacenado.<\/strong> Cuando se almacena un bloque de memoria, adjunte la fecha de la conversaci\u00f3n de la que proviene. Al recuperarlo, el modelo puede leer \u201cSesi\u00f3n del 7 de mayo de 2023: Ayer fui al grupo de apoyo LGBTQ\u201d e interpretar correctamente \u201cayer\u201d como el 6 de mayo de 2023. En LoCoMo, este \u00fanico cambio eleva el razonamiento temporal de 0.103 a 0.738, lo que representa aproximadamente una mejora de 7 veces en un experimento.<\/li>\n\n\n\n<li><strong>Agrega \u201cHoy es {question_date}\u201d al aviso de respuesta.<\/strong> Proporcionar al modelo un anclaje expl\u00edcito de cu\u00e1ndo se est\u00e1 haciendo la pregunta es el cambio de mayor impacto en LME-S: la puntuaci\u00f3n J general aumenta de 0.571 a 0.637 sin ninguna otra modificaci\u00f3n. Las puntuaciones temporales saltan de aproximadamente 0.18 a 0.263, la mayor ganancia en una sola categor\u00eda de cualquier intervenci\u00f3n en ese punto de referencia.<\/li>\n\n\n\n<li><strong>Filtrar r\u00edgidamente los recuerdos futuros.<\/strong> Este enfoque parece l\u00f3gico: si una pregunta se hizo en octubre, los recuerdos de noviembre deber\u00edan ser irrelevantes. En la pr\u00e1ctica, degrada el rendimiento. La ca\u00edda temporal de LME-S es de 0.538 a 0.398. Los recuerdos futuros frecuentemente contienen res\u00famenes de sesiones y se\u00f1ales contextuales que ayudan al modelo a comprender el arco de los eventos que condujeron a la fecha de la pregunta. Eliminarlos elimina el fundamento en lugar del ruido.<\/li>\n<\/ol>\n\n\n\n<p class=\"wp-block-paragraph\">Reemplazar la clasificaci\u00f3n por relevancia con un ordenamiento basado en la actualidad produce una degradaci\u00f3n similar. En general, la J cae a 0.554, el TR a 0.346 y el MS a 0.361. Las puntuaciones de relevancia ya codifican informaci\u00f3n temporal; un recuerdo de la semana pasada que es topicalmente relevante para la consulta se posiciona m\u00e1s alto que un recuerdo de ayer que no lo es. Anular la relevancia con la actualidad pura descarta el componente sem\u00e1ntico.<\/p>\n\n\n\n<h3 id=\"h-bm25-reranking\" class=\"wp-block-heading\">reordenamiento BM25<\/h3>\n\n\n\n<p class=\"wp-block-paragraph\">Realizamos tres experimentos de reordenamiento *post-hoc* con BM25 utilizando diferentes tama\u00f1os de conjunto inicial: recuperar 10 y luego reordenar a 10, recuperar 50 y luego reordenar a 10, y recuperar 100 y luego reordenar a 10. Los resultados fueron inequ\u00edvocos: conjunto=10 obtuvo 0,635, conjunto=50 obtuvo 0,615 y conjunto=100 obtuvo 0,589.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Cuando el grupo inicial es peque\u00f1o, la b\u00fasqueda vectorial ya ha realizado el filtrado sem\u00e1ntico y BM25 agudiza la precisi\u00f3n de las palabras clave dentro de ese conjunto filtrado. Cuando el grupo se expande a 100, la relevancia promedio de los resultados vectoriales iniciales disminuye, y BM25 termina sustituyendo buenos recuerdos recuperados sem\u00e1nticamente por otros que coinciden con las palabras clave de la pregunta pero que en realidad no son relevantes. El grupo de 100 tiene un rendimiento peor que no usar reordenamiento en absoluto.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">La b\u00fasqueda h\u00edbrida en el momento de la consulta, que combina similitud de vectores, BM25 y extracci\u00f3n de entidades en una sola llamada de b\u00fasqueda de texto completo (FTS) de Couchbase, es un enfoque diferente con contraprestaciones distintas. La ganancia m\u00e1s clara se dio en el razonamiento temporal: la b\u00fasqueda puramente vectorial fallaba frecuentemente en nombres de eventos espec\u00edficos o fechas cuando la redacci\u00f3n de la pregunta difer\u00eda del texto de la memoria almacenada. \u201c\u00bfHace cu\u00e1ntas semanas asist\u00ed a la venta de amigos y familiares de Nordstrom?\u201d puede hacer surgir un recuerdo sobre \u201cRecientemente compr\u00e9 botas en el Viernes Negro de Macy's\u201d porque son tem\u00e1ticamente adyacentes y el embebido vectorial promedia todo el turno de la conversaci\u00f3n. La b\u00fasqueda h\u00edbrida con extracci\u00f3n de entidades hace coincidir \u201cventa de amigos y familiares de Nordstrom\u201d como una entidad nombrada directamente, sin importar la redacci\u00f3n circundante. La contraprestaci\u00f3n es la precisi\u00f3n multisesi\u00f3n: la coincidencia de palabras clave hace surgir recuerdos del tema correcto pero potencialmente de la sesi\u00f3n equivocada, y al modelo le puede costar determinar la versi\u00f3n de qu\u00e9 sesi\u00f3n es la autorizada.<\/p>\n\n\n\n<h3 id=\"h-the-interaction-matrix\" class=\"wp-block-heading\">La matriz de interacci\u00f3n<\/h3>\n\n\n\n<p class=\"wp-block-paragraph\">Ninguna de estas decisiones es independiente.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Los res\u00famenes mejoran el SSP y el MS, a la vez que degradan el SSA. La ordenaci\u00f3n por recencia ayuda al SSP y al mismo tiempo colapsa el TR y el MS. La reordenaci\u00f3n BM25 con grupos grandes ayuda al SSP y perjudica al MS. La b\u00fasqueda h\u00edbrida mejora el SSU y el TR a la vez que aumenta la confusi\u00f3n entre sesiones del MS. Agregar una marca de tiempo al prompt mejora significativamente el TR con un efecto m\u00ednimo en el resto.<\/p>\n\n\n\n<figure class=\"wp-block-image size-large\"><img loading=\"lazy\" decoding=\"async\" width=\"1024\" height=\"327\" src=\"https:\/\/www.couchbase.com\/blog\/wp-content\/uploads\/sites\/5\/2026\/07\/Screenshot-2026-07-23-at-3.33.34-PM-1024x327.png\" alt=\"\" class=\"wp-image-5573\" srcset=\"https:\/\/www.couchbase.com\/blog\/wp-content\/uploads\/sites\/5\/2026\/07\/Screenshot-2026-07-23-at-3.33.34-PM-1024x327.png 1024w, https:\/\/www.couchbase.com\/blog\/wp-content\/uploads\/sites\/5\/2026\/07\/Screenshot-2026-07-23-at-3.33.34-PM-300x96.png 300w, https:\/\/www.couchbase.com\/blog\/wp-content\/uploads\/sites\/5\/2026\/07\/Screenshot-2026-07-23-at-3.33.34-PM-768x245.png 768w, https:\/\/www.couchbase.com\/blog\/wp-content\/uploads\/sites\/5\/2026\/07\/Screenshot-2026-07-23-at-3.33.34-PM-18x6.png 18w, https:\/\/www.couchbase.com\/blog\/wp-content\/uploads\/sites\/5\/2026\/07\/Screenshot-2026-07-23-at-3.33.34-PM.png 1140w\" sizes=\"auto, (max-width: 1024px) 100vw, 1024px\" \/><\/figure>\n\n\n\n<p class=\"wp-block-paragraph\">Cada decisi\u00f3n de dise\u00f1o tiene efectos asim\u00e9tricos entre los tipos de preguntas, y no existe una configuraci\u00f3n universalmente \u00f3ptima. Una puntuaci\u00f3n general \u00fanica oscurece esta estructura por completo. La matriz de interacci\u00f3n es el resultado m\u00e1s \u00fatil para tomar decisiones de dise\u00f1o informadas. La configuraci\u00f3n correcta depende de qu\u00e9 tipos de preguntas importan m\u00e1s para una aplicaci\u00f3n determinada.<\/p>\n\n\n\n<h2 id=\"h-results\" class=\"wp-block-heading\"><strong>Resultados<\/strong><\/h2>\n\n\n\n<p class=\"wp-block-paragraph\"><strong>En LoCoMo,<\/strong> Couchbase Agent Memory alcanza una puntuaci\u00f3n LLM de 82,31 TP3T. La mayor mejora se observa en la categor\u00eda Temporal (72,31 TP3T frente a 48,31 TP3T), lo que refleja directamente el trabajo de anclaje de marcas de tiempo. La categor\u00eda \u00abMulti Hop\u00bb es la m\u00e1s s\u00f3lida en t\u00e9rminos absolutos, con 90,21 TP3T.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\"><strong>En LME-S con gpt-4o-mini,<\/strong> Logramos un 69,41 TP3T en total. Las diferencias entre las distintas categor\u00edas concuerdan con la matriz de interacci\u00f3n; existen configuraciones que mejorar\u00edan el SSP y el TR, pero a costa de sacrificar las ventajas en SSA y MS. <strong>En LME-S con gpt-4o,<\/strong> alcanzamos un total de 75,91 TP3T.&nbsp;<\/p>\n\n\n\n<p class=\"wp-block-paragraph\"><strong>En LME-M,<\/strong> alcanzamos un total de 65,31 TP3T con 1,5 millones de tokens por problema. No existe ninguna comparaci\u00f3n publicada conocida a esta escala; estos son los primeros resultados reportados en LME-M. La recuperaci\u00f3n en una sola sesi\u00f3n es casi perfecta (SSA con 94,61 TP3T, SSU con 92,91 TP3T), lo que confirma que la recuperaci\u00f3n funciona bien cuando la respuesta se encuentra dentro de una sola sesi\u00f3n. Las categor\u00edas m\u00e1s dif\u00edciles (MS con 48,91 TP3T, TR con 45,11 TP3T, SSP con 40,01 TP3T) reflejan el costo de la expansi\u00f3n del espacio de b\u00fasqueda por 20.<\/p>\n\n\n\n<h2 id=\"h-what-we-learned\" class=\"wp-block-heading\"><strong>Lo que aprendimos<\/strong><\/h2>\n\n\n\n<p class=\"wp-block-paragraph\">El hallazgo principal es que la recuperaci\u00f3n de memoria de los agentes tiene un espacio de dise\u00f1o distinto al RAG de documentos, y la configuraci\u00f3n adecuada depende de la distribuci\u00f3n de los tipos de preguntas y la escala del pajar. Vale la pena se\u00f1alar esto claramente porque el campo tiende a evaluar bajo los supuestos del RAG.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Del proceso experimental surgieron varias observaciones m\u00e1s amplias.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\"><strong>La metodolog\u00eda de evaluaci\u00f3n da forma a los resultados tanto como lo hace el dise\u00f1o del sistema.<\/strong> El prompt del juez no es un instrumento de medici\u00f3n neutral. Tiene sesgos hacia respuestas m\u00e1s largas, la verbosidad sobre la precisi\u00f3n y la cercan\u00eda de temas sobre la exactitud factual. Cambiar de juez altera las puntuaciones entre 5 y 10 puntos. Usar el mismo juez en todos los experimentos dentro de un estudio es un requisito m\u00ednimo para obtener resultados interpretables. Comparar puntuaciones entre estudios que utilizaron diferentes jueces no es v\u00e1lido.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\"><strong>La optimizaci\u00f3n para peque\u00f1os pajares no se transfiere a escala de producci\u00f3n.<\/strong> El valor \u00f3ptimo de k a escala LME-S es 10. A escala LME-M, es 20. Las variantes de instrucciones que encabezan la evaluaci\u00f3n comparativa peque\u00f1a rinden por debajo de lo esperado en la grande. Los sistemas ajustados exclusivamente en evaluaciones de pajar peque\u00f1o pueden estar mal configurados para la escala en la que se despliegan realmente.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\"><strong>El anclaje temporal es un problema concreto y solucionable.<\/strong> La mejora de aproximadamente 7 veces en la recuperaci\u00f3n temporal de LoCoMo a partir de un solo cambio en el momento de la ingesta, al anteponer las fechas de las sesiones a los recuerdos almacenados, es el hallazgo m\u00e1s procesable del estudio. Este modo de fallo es invisible en pruebas comparativas sin preguntas temporales y consecuente en producci\u00f3n cuando los usuarios hacen preguntas relativas al tiempo. La soluci\u00f3n tiene un costo insignificante y debe aplicarse por defecto.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\"><strong>La suficiencia del contexto separa los problemas de recuperaci\u00f3n de los problemas de razonamiento.<\/strong> Sin ella, una puntuaci\u00f3n J deficiente podr\u00eda indicar que se recuperaron los recuerdos incorrectos, que no se recuper\u00f3 ning\u00fan recuerdo o que se recuperaron los recuerdos correctos pero el modelo no los us\u00f3. Estas situaciones requieren diferentes intervenciones. La suficiencia del contexto hace que esta distinci\u00f3n sea expl\u00edcita.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\"><strong>El modo de falla temporal dominante es estructural.<\/strong> En el caso de los fallos temporales 55%, el problema radica en la recuperaci\u00f3n: la formulaci\u00f3n de la pregunta difiere de la forma en que se almacen\u00f3 el evento, la representaci\u00f3n promedia demasiado ruido en un turno de conversaci\u00f3n extenso y el recuerdo correcto queda oculto en los resultados de la clasificaci\u00f3n. La vinculaci\u00f3n a marcas de tiempo y la b\u00fasqueda h\u00edbrida reducen la frecuencia de este fallo, pero no lo eliminan. Los enfoques que extraen representaciones estructuradas de los eventos en el momento de su ingesta abordan la causa ra\u00edz de manera m\u00e1s directa. Vale la pena explorar esto m\u00e1s a fondo.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">La mayor\u00eda de los equipos que construyen sistemas de memoria para agentes realizan evaluaciones en pajares peque\u00f1os, conf\u00edan en una \u00fanica puntuaci\u00f3n general y tratan el problema como una versi\u00f3n m\u00e1s dif\u00edcil de RAG. Esta evaluaci\u00f3n argumenta que las tres suposiciones son incorrectas. Los modos de fallo son espec\u00edficos. El espacio de dise\u00f1o es real. Y la configuraci\u00f3n correcta solo se revela a la escala donde las cosas realmente se rompen. La pregunta que vale la pena hacer es: si nunca probaste tu sistema a escala de producci\u00f3n, \u00bfsabes realmente si funciona?<\/p>","protected":false},"excerpt":{"rendered":"<p>This is the second part of a two-part evaluation of Couchbase Agent Memory. If you haven&#8217;t read Part 1, the benchmarks, metrics, and pipeline architecture are all explained there. This part describes what happened when we actually ran the experiments. Note: Not all of it went the way we expected. What we tried and what [&hellip;]<\/p>\n","protected":false},"author":85725,"featured_media":5574,"comment_status":"open","ping_status":"open","sticky":false,"template":"","format":"standard","meta":{"_acf_changed":false,"inline_featured_image":false,"_acf":"","footnotes":""},"categories":[920],"tags":[],"ppma_author":[1046],"class_list":["post-5572","post","type-post","status-publish","format-standard","has-post-thumbnail","hentry","category-agentic-ai-apps"],"yoast_head":"<!-- This site is optimized with the Yoast SEO Premium plugin v27.6 (Yoast SEO v27.6) - https:\/\/yoast.com\/product\/yoast-seo-premium-wordpress\/ -->\n<title>What We Learned Evaluating Agent Memory:The Results (Part 2) - The Couchbase Blog<\/title>\n<meta name=\"robots\" content=\"index, follow, max-snippet:-1, max-image-preview:large, max-video-preview:-1\" \/>\n<link rel=\"canonical\" href=\"https:\/\/www.couchbase.com\/blog\/es\/what-we-learned-evaluating-agent-memorythe-results-part-2\/\" \/>\n<meta property=\"og:locale\" content=\"es_MX\" \/>\n<meta property=\"og:type\" content=\"article\" \/>\n<meta property=\"og:title\" content=\"What We Learned Evaluating Agent Memory:The Results (Part 2)\" \/>\n<meta property=\"og:description\" content=\"This is the second part of a two-part evaluation of Couchbase Agent Memory. If you haven&#8217;t read Part 1, the benchmarks, metrics, and pipeline architecture are all explained there. This part describes what happened when we actually ran the experiments. Note: Not all of it went the way we expected. What we tried and what [&hellip;]\" \/>\n<meta property=\"og:url\" content=\"https:\/\/www.couchbase.com\/blog\/es\/what-we-learned-evaluating-agent-memorythe-results-part-2\/\" \/>\n<meta property=\"og:site_name\" content=\"The Couchbase Blog\" \/>\n<meta property=\"article:published_time\" content=\"2026-07-29T16:00:00+00:00\" \/>\n<meta property=\"article:modified_time\" content=\"2026-07-30T22:23:25+00:00\" \/>\n<meta property=\"og:image\" content=\"https:\/\/www.couchbase.com\/blog\/wp-content\/uploads\/sites\/5\/2026\/07\/What-We-Learned-Evaluating-Agent-Memory-P2.png\" \/>\n\t<meta property=\"og:image:width\" content=\"2400\" \/>\n\t<meta property=\"og:image:height\" content=\"1256\" \/>\n\t<meta property=\"og:image:type\" content=\"image\/png\" \/>\n<meta name=\"author\" content=\"Namita Achyuthan, Software Engineer\" \/>\n<meta name=\"twitter:card\" content=\"summary_large_image\" \/>\n<meta name=\"twitter:label1\" content=\"Written by\" \/>\n\t<meta name=\"twitter:data1\" content=\"Namita Achyuthan, Software Engineer\" \/>\n\t<meta name=\"twitter:label2\" content=\"Est. reading time\" \/>\n\t<meta name=\"twitter:data2\" content=\"9 minutos\" \/>\n<script type=\"application\/ld+json\" class=\"yoast-schema-graph\">{\"@context\":\"https:\\\/\\\/schema.org\",\"@graph\":[{\"@type\":\"Article\",\"@id\":\"https:\\\/\\\/www.couchbase.com\\\/blog\\\/what-we-learned-evaluating-agent-memorythe-results-part-2\\\/#article\",\"isPartOf\":{\"@id\":\"https:\\\/\\\/www.couchbase.com\\\/blog\\\/what-we-learned-evaluating-agent-memorythe-results-part-2\\\/\"},\"author\":{\"name\":\"Namita Achyuthan, Software Engineer\",\"@id\":\"https:\\\/\\\/www.couchbase.com\\\/blog\\\/#\\\/schema\\\/person\\\/b745ecfa382414e44c76586ae27401f0\"},\"headline\":\"What We Learned Evaluating Agent Memory:The Results (Part 2)\",\"datePublished\":\"2026-07-29T16:00:00+00:00\",\"dateModified\":\"2026-07-30T22:23:25+00:00\",\"mainEntityOfPage\":{\"@id\":\"https:\\\/\\\/www.couchbase.com\\\/blog\\\/what-we-learned-evaluating-agent-memorythe-results-part-2\\\/\"},\"wordCount\":1768,\"commentCount\":0,\"publisher\":{\"@id\":\"https:\\\/\\\/www.couchbase.com\\\/blog\\\/#organization\"},\"image\":{\"@id\":\"https:\\\/\\\/www.couchbase.com\\\/blog\\\/what-we-learned-evaluating-agent-memorythe-results-part-2\\\/#primaryimage\"},\"thumbnailUrl\":\"https:\\\/\\\/www.couchbase.com\\\/blog\\\/wp-content\\\/uploads\\\/sites\\\/5\\\/2026\\\/07\\\/What-We-Learned-Evaluating-Agent-Memory-P2.png\",\"articleSection\":[\"Agentic AI Applications\"],\"inLanguage\":\"es\",\"potentialAction\":[{\"@type\":\"CommentAction\",\"name\":\"Comment\",\"target\":[\"https:\\\/\\\/www.couchbase.com\\\/blog\\\/what-we-learned-evaluating-agent-memorythe-results-part-2\\\/#respond\"]}]},{\"@type\":\"WebPage\",\"@id\":\"https:\\\/\\\/www.couchbase.com\\\/blog\\\/what-we-learned-evaluating-agent-memorythe-results-part-2\\\/\",\"url\":\"https:\\\/\\\/www.couchbase.com\\\/blog\\\/what-we-learned-evaluating-agent-memorythe-results-part-2\\\/\",\"name\":\"What We Learned Evaluating Agent Memory:The Results (Part 2) - The Couchbase Blog\",\"isPartOf\":{\"@id\":\"https:\\\/\\\/www.couchbase.com\\\/blog\\\/#website\"},\"primaryImageOfPage\":{\"@id\":\"https:\\\/\\\/www.couchbase.com\\\/blog\\\/what-we-learned-evaluating-agent-memorythe-results-part-2\\\/#primaryimage\"},\"image\":{\"@id\":\"https:\\\/\\\/www.couchbase.com\\\/blog\\\/what-we-learned-evaluating-agent-memorythe-results-part-2\\\/#primaryimage\"},\"thumbnailUrl\":\"https:\\\/\\\/www.couchbase.com\\\/blog\\\/wp-content\\\/uploads\\\/sites\\\/5\\\/2026\\\/07\\\/What-We-Learned-Evaluating-Agent-Memory-P2.png\",\"datePublished\":\"2026-07-29T16:00:00+00:00\",\"dateModified\":\"2026-07-30T22:23:25+00:00\",\"breadcrumb\":{\"@id\":\"https:\\\/\\\/www.couchbase.com\\\/blog\\\/what-we-learned-evaluating-agent-memorythe-results-part-2\\\/#breadcrumb\"},\"inLanguage\":\"es\",\"potentialAction\":[{\"@type\":\"ReadAction\",\"target\":[\"https:\\\/\\\/www.couchbase.com\\\/blog\\\/what-we-learned-evaluating-agent-memorythe-results-part-2\\\/\"]}]},{\"@type\":\"ImageObject\",\"inLanguage\":\"es\",\"@id\":\"https:\\\/\\\/www.couchbase.com\\\/blog\\\/what-we-learned-evaluating-agent-memorythe-results-part-2\\\/#primaryimage\",\"url\":\"https:\\\/\\\/www.couchbase.com\\\/blog\\\/wp-content\\\/uploads\\\/sites\\\/5\\\/2026\\\/07\\\/What-We-Learned-Evaluating-Agent-Memory-P2.png\",\"contentUrl\":\"https:\\\/\\\/www.couchbase.com\\\/blog\\\/wp-content\\\/uploads\\\/sites\\\/5\\\/2026\\\/07\\\/What-We-Learned-Evaluating-Agent-Memory-P2.png\",\"width\":2400,\"height\":1256},{\"@type\":\"BreadcrumbList\",\"@id\":\"https:\\\/\\\/www.couchbase.com\\\/blog\\\/what-we-learned-evaluating-agent-memorythe-results-part-2\\\/#breadcrumb\",\"itemListElement\":[{\"@type\":\"ListItem\",\"position\":1,\"name\":\"Home\",\"item\":\"https:\\\/\\\/www.couchbase.com\\\/blog\\\/\"},{\"@type\":\"ListItem\",\"position\":2,\"name\":\"What We Learned Evaluating Agent Memory:The Results (Part 2)\"}]},{\"@type\":\"WebSite\",\"@id\":\"https:\\\/\\\/www.couchbase.com\\\/blog\\\/#website\",\"url\":\"https:\\\/\\\/www.couchbase.com\\\/blog\\\/\",\"name\":\"The Couchbase Blog\",\"description\":\"Couchbase, the NoSQL Database\",\"publisher\":{\"@id\":\"https:\\\/\\\/www.couchbase.com\\\/blog\\\/#organization\"},\"potentialAction\":[{\"@type\":\"SearchAction\",\"target\":{\"@type\":\"EntryPoint\",\"urlTemplate\":\"https:\\\/\\\/www.couchbase.com\\\/blog\\\/?s={search_term_string}\"},\"query-input\":{\"@type\":\"PropertyValueSpecification\",\"valueRequired\":true,\"valueName\":\"search_term_string\"}}],\"inLanguage\":\"es\"},{\"@type\":\"Organization\",\"@id\":\"https:\\\/\\\/www.couchbase.com\\\/blog\\\/#organization\",\"name\":\"The Couchbase Blog\",\"url\":\"https:\\\/\\\/www.couchbase.com\\\/blog\\\/\",\"logo\":{\"@type\":\"ImageObject\",\"inLanguage\":\"es\",\"@id\":\"https:\\\/\\\/www.couchbase.com\\\/blog\\\/#\\\/schema\\\/logo\\\/image\\\/\",\"url\":\"https:\\\/\\\/www.couchbase.com\\\/blog\\\/wp-content\\\/uploads\\\/sites\\\/5\\\/2026\\\/06\\\/logo.svg\",\"contentUrl\":\"https:\\\/\\\/www.couchbase.com\\\/blog\\\/wp-content\\\/uploads\\\/sites\\\/5\\\/2026\\\/06\\\/logo.svg\",\"width\":\"1024\",\"height\":\"1024\",\"caption\":\"The Couchbase Blog\"},\"image\":{\"@id\":\"https:\\\/\\\/www.couchbase.com\\\/blog\\\/#\\\/schema\\\/logo\\\/image\\\/\"}},{\"@type\":\"Person\",\"@id\":\"https:\\\/\\\/www.couchbase.com\\\/blog\\\/#\\\/schema\\\/person\\\/b745ecfa382414e44c76586ae27401f0\",\"name\":\"Namita Achyuthan, Software Engineer\",\"image\":{\"@type\":\"ImageObject\",\"inLanguage\":\"es\",\"@id\":\"https:\\\/\\\/www.couchbase.com\\\/blog\\\/wp-content\\\/uploads\\\/sites\\\/5\\\/2026\\\/07\\\/Namita-Achyuthan.jpg14f8bb4bd3ae507d5e9374e1855de7a6\",\"url\":\"https:\\\/\\\/www.couchbase.com\\\/blog\\\/wp-content\\\/uploads\\\/sites\\\/5\\\/2026\\\/07\\\/Namita-Achyuthan.jpg\",\"contentUrl\":\"https:\\\/\\\/www.couchbase.com\\\/blog\\\/wp-content\\\/uploads\\\/sites\\\/5\\\/2026\\\/07\\\/Namita-Achyuthan.jpg\",\"caption\":\"Namita Achyuthan, Software Engineer\"},\"url\":\"https:\\\/\\\/www.couchbase.com\\\/blog\\\/es\\\/author\\\/namitaachyuthan\\\/\"}]}<\/script>\n<!-- \/ Yoast SEO Premium plugin. -->","yoast_head_json":{"title":"What We Learned Evaluating Agent Memory:The Results (Part 2) - The Couchbase Blog","robots":{"index":"index","follow":"follow","max-snippet":"max-snippet:-1","max-image-preview":"max-image-preview:large","max-video-preview":"max-video-preview:-1"},"canonical":"https:\/\/www.couchbase.com\/blog\/es\/what-we-learned-evaluating-agent-memorythe-results-part-2\/","og_locale":"es_MX","og_type":"article","og_title":"What We Learned Evaluating Agent Memory:The Results (Part 2)","og_description":"This is the second part of a two-part evaluation of Couchbase Agent Memory. If you haven&#8217;t read Part 1, the benchmarks, metrics, and pipeline architecture are all explained there. This part describes what happened when we actually ran the experiments. Note: Not all of it went the way we expected. What we tried and what [&hellip;]","og_url":"https:\/\/www.couchbase.com\/blog\/es\/what-we-learned-evaluating-agent-memorythe-results-part-2\/","og_site_name":"The Couchbase Blog","article_published_time":"2026-07-29T16:00:00+00:00","article_modified_time":"2026-07-30T22:23:25+00:00","og_image":[{"width":2400,"height":1256,"url":"https:\/\/www.couchbase.com\/blog\/wp-content\/uploads\/sites\/5\/2026\/07\/What-We-Learned-Evaluating-Agent-Memory-P2.png","type":"image\/png"}],"author":"Namita Achyuthan, Software Engineer","twitter_card":"summary_large_image","twitter_misc":{"Written by":"Namita Achyuthan, Software Engineer","Est. reading time":"9 minutos"},"schema":{"@context":"https:\/\/schema.org","@graph":[{"@type":"Article","@id":"https:\/\/www.couchbase.com\/blog\/what-we-learned-evaluating-agent-memorythe-results-part-2\/#article","isPartOf":{"@id":"https:\/\/www.couchbase.com\/blog\/what-we-learned-evaluating-agent-memorythe-results-part-2\/"},"author":{"name":"Namita Achyuthan, Software Engineer","@id":"https:\/\/www.couchbase.com\/blog\/#\/schema\/person\/b745ecfa382414e44c76586ae27401f0"},"headline":"What We Learned Evaluating Agent Memory:The Results (Part 2)","datePublished":"2026-07-29T16:00:00+00:00","dateModified":"2026-07-30T22:23:25+00:00","mainEntityOfPage":{"@id":"https:\/\/www.couchbase.com\/blog\/what-we-learned-evaluating-agent-memorythe-results-part-2\/"},"wordCount":1768,"commentCount":0,"publisher":{"@id":"https:\/\/www.couchbase.com\/blog\/#organization"},"image":{"@id":"https:\/\/www.couchbase.com\/blog\/what-we-learned-evaluating-agent-memorythe-results-part-2\/#primaryimage"},"thumbnailUrl":"https:\/\/www.couchbase.com\/blog\/wp-content\/uploads\/sites\/5\/2026\/07\/What-We-Learned-Evaluating-Agent-Memory-P2.png","articleSection":["Agentic AI Applications"],"inLanguage":"es","potentialAction":[{"@type":"CommentAction","name":"Comment","target":["https:\/\/www.couchbase.com\/blog\/what-we-learned-evaluating-agent-memorythe-results-part-2\/#respond"]}]},{"@type":"WebPage","@id":"https:\/\/www.couchbase.com\/blog\/what-we-learned-evaluating-agent-memorythe-results-part-2\/","url":"https:\/\/www.couchbase.com\/blog\/what-we-learned-evaluating-agent-memorythe-results-part-2\/","name":"What We Learned Evaluating Agent Memory:The Results (Part 2) - The Couchbase Blog","isPartOf":{"@id":"https:\/\/www.couchbase.com\/blog\/#website"},"primaryImageOfPage":{"@id":"https:\/\/www.couchbase.com\/blog\/what-we-learned-evaluating-agent-memorythe-results-part-2\/#primaryimage"},"image":{"@id":"https:\/\/www.couchbase.com\/blog\/what-we-learned-evaluating-agent-memorythe-results-part-2\/#primaryimage"},"thumbnailUrl":"https:\/\/www.couchbase.com\/blog\/wp-content\/uploads\/sites\/5\/2026\/07\/What-We-Learned-Evaluating-Agent-Memory-P2.png","datePublished":"2026-07-29T16:00:00+00:00","dateModified":"2026-07-30T22:23:25+00:00","breadcrumb":{"@id":"https:\/\/www.couchbase.com\/blog\/what-we-learned-evaluating-agent-memorythe-results-part-2\/#breadcrumb"},"inLanguage":"es","potentialAction":[{"@type":"ReadAction","target":["https:\/\/www.couchbase.com\/blog\/what-we-learned-evaluating-agent-memorythe-results-part-2\/"]}]},{"@type":"ImageObject","inLanguage":"es","@id":"https:\/\/www.couchbase.com\/blog\/what-we-learned-evaluating-agent-memorythe-results-part-2\/#primaryimage","url":"https:\/\/www.couchbase.com\/blog\/wp-content\/uploads\/sites\/5\/2026\/07\/What-We-Learned-Evaluating-Agent-Memory-P2.png","contentUrl":"https:\/\/www.couchbase.com\/blog\/wp-content\/uploads\/sites\/5\/2026\/07\/What-We-Learned-Evaluating-Agent-Memory-P2.png","width":2400,"height":1256},{"@type":"BreadcrumbList","@id":"https:\/\/www.couchbase.com\/blog\/what-we-learned-evaluating-agent-memorythe-results-part-2\/#breadcrumb","itemListElement":[{"@type":"ListItem","position":1,"name":"Home","item":"https:\/\/www.couchbase.com\/blog\/"},{"@type":"ListItem","position":2,"name":"What We Learned Evaluating Agent Memory:The Results (Part 2)"}]},{"@type":"WebSite","@id":"https:\/\/www.couchbase.com\/blog\/#website","url":"https:\/\/www.couchbase.com\/blog\/","name":"El blog de Couchbase","description":"Couchbase, la base de datos NoSQL","publisher":{"@id":"https:\/\/www.couchbase.com\/blog\/#organization"},"potentialAction":[{"@type":"SearchAction","target":{"@type":"EntryPoint","urlTemplate":"https:\/\/www.couchbase.com\/blog\/?s={search_term_string}"},"query-input":{"@type":"PropertyValueSpecification","valueRequired":true,"valueName":"search_term_string"}}],"inLanguage":"es"},{"@type":"Organization","@id":"https:\/\/www.couchbase.com\/blog\/#organization","name":"El blog de Couchbase","url":"https:\/\/www.couchbase.com\/blog\/","logo":{"@type":"ImageObject","inLanguage":"es","@id":"https:\/\/www.couchbase.com\/blog\/#\/schema\/logo\/image\/","url":"https:\/\/www.couchbase.com\/blog\/wp-content\/uploads\/sites\/5\/2026\/06\/logo.svg","contentUrl":"https:\/\/www.couchbase.com\/blog\/wp-content\/uploads\/sites\/5\/2026\/06\/logo.svg","width":"1024","height":"1024","caption":"The Couchbase Blog"},"image":{"@id":"https:\/\/www.couchbase.com\/blog\/#\/schema\/logo\/image\/"}},{"@type":"Person","@id":"https:\/\/www.couchbase.com\/blog\/#\/schema\/person\/b745ecfa382414e44c76586ae27401f0","name":"Namita Achyuthan, Ingeniera de Software","image":{"@type":"ImageObject","inLanguage":"es","@id":"https:\/\/www.couchbase.com\/blog\/wp-content\/uploads\/sites\/5\/2026\/07\/Namita-Achyuthan.jpg14f8bb4bd3ae507d5e9374e1855de7a6","url":"https:\/\/www.couchbase.com\/blog\/wp-content\/uploads\/sites\/5\/2026\/07\/Namita-Achyuthan.jpg","contentUrl":"https:\/\/www.couchbase.com\/blog\/wp-content\/uploads\/sites\/5\/2026\/07\/Namita-Achyuthan.jpg","caption":"Namita Achyuthan, Software Engineer"},"url":"https:\/\/www.couchbase.com\/blog\/es\/author\/namitaachyuthan\/"}]}},"acf":[],"authors":[{"term_id":1046,"user_id":85725,"is_guest":0,"slug":"namitaachyuthan","display_name":"Namita Achyuthan, Software Engineer","avatar_url":{"url":"https:\/\/www.couchbase.com\/blog\/wp-content\/uploads\/sites\/5\/2026\/07\/Namita-Achyuthan.jpg","url2x":"https:\/\/www.couchbase.com\/blog\/wp-content\/uploads\/sites\/5\/2026\/07\/Namita-Achyuthan.jpg"},"author_category":"1","first_name":"Namita","last_name":"Achyuthan","user_url":"","job_title":"Software Engineer","description":""}],"_links":{"self":[{"href":"https:\/\/www.couchbase.com\/blog\/es\/wp-json\/wp\/v2\/posts\/5572","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/www.couchbase.com\/blog\/es\/wp-json\/wp\/v2\/posts"}],"about":[{"href":"https:\/\/www.couchbase.com\/blog\/es\/wp-json\/wp\/v2\/types\/post"}],"author":[{"embeddable":true,"href":"https:\/\/www.couchbase.com\/blog\/es\/wp-json\/wp\/v2\/users\/85725"}],"replies":[{"embeddable":true,"href":"https:\/\/www.couchbase.com\/blog\/es\/wp-json\/wp\/v2\/comments?post=5572"}],"version-history":[{"count":2,"href":"https:\/\/www.couchbase.com\/blog\/es\/wp-json\/wp\/v2\/posts\/5572\/revisions"}],"predecessor-version":[{"id":5584,"href":"https:\/\/www.couchbase.com\/blog\/es\/wp-json\/wp\/v2\/posts\/5572\/revisions\/5584"}],"wp:featuredmedia":[{"embeddable":true,"href":"https:\/\/www.couchbase.com\/blog\/es\/wp-json\/wp\/v2\/media\/5574"}],"wp:attachment":[{"href":"https:\/\/www.couchbase.com\/blog\/es\/wp-json\/wp\/v2\/media?parent=5572"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/www.couchbase.com\/blog\/es\/wp-json\/wp\/v2\/categories?post=5572"},{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/www.couchbase.com\/blog\/es\/wp-json\/wp\/v2\/tags?post=5572"},{"taxonomy":"author","embeddable":true,"href":"https:\/\/www.couchbase.com\/blog\/es\/wp-json\/wp\/v2\/ppma_author?post=5572"}],"curies":[{"name":"\u00a1Bien jugado!","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}