
Razonar en griego, memoria que trampa y seguridad que conserva la utilidad
Tres papers de LLM de la semana del 18 al 24 de agosto: razonar en griego tras SFT y RL, trampas cognitivas de la memoria externa y CLEAR para endurecer la seguridad sin tumbar la utilidad.
Tres preprints de arXiv enviados entre el 18 y el 24 de agosto de 2026. Criterio: trabajos sobre grandes modelos de lenguaje con ángulos distintos — cómo razonan en una lengua con pocos recursos, qué fallos introduce la memoria externa y cómo endurecer la seguridad mientras se conserva la utilidad. Cada ficha sigue el mismo esquema: problema, método y resultados.
1. Pensar en una lengua de bajos recursos: qué construye el SFT y qué arregla el RL
Thinking in a Low-Resource Language: What SFT Builds, What RL Fixes, What Accuracy Cannot See · Ayoub Kirouane, Christos Petrocheilos · enviado el 18 de agosto de 2026 · preprint arXiv1
El problema
Tres modelos frontier de tipo mixture-of-experts (unos 3,6–4,0 mil millones de parámetros activos) pueden responder bien a preguntas en griego y, aun así, razonar en otra lengua. En 1.000 trazas de razonamiento, el modelo base nunca pensó en griego: cero de mil. El usuario ve la respuesta correcta, pero no puede leer, auditar ni corregir el camino que la produjo.1
Los benchmarks de exactitud se mueven poco. Cambiar solo la semilla aleatoria movió la puntuación 7,7 puntos, por encima de cualquier efecto de datos o de receta que midieron los autores.1
SFT (supervised fine-tuning): ajustar el modelo con ejemplos etiquetados de la conducta deseada. RL con recompensas verificables: reforzar conductas que se pueden comprobar de forma automática (formato, fugas, etc.).
El método
Afinaron esos tres modelos para que razonen en griego. Primero con SFT; después, con aprendizaje por refuerzo de recompensas verificables, pre-registrado antes del entrenamiento. Midieron seis dimensiones de conducta diseñadas para no confundirse con la longitud de la salida, y añadieron controles (incluida una recompensa aleatoria plana) para pillar cuando el instrumento mentía.1
Los resultados
Tras el SFT, todos los checkpoints publicados razonan en la lengua de la pregunta en alrededor del 98 % de los ítems; una familia lo hace con tres veces menos tokens; la gramaticalidad mejora en los cuatro modelos y la capacidad general se mantiene a pocos puntos del base.1
Tras el SFT quedan defectos abiertos: alrededor de un cuarto de las respuestas se salta el formato pedido, las respuestas se filtran al canal de razonamiento y una instrucción explícita de «piensa en inglés» se cumple en menos de la mitad de los casos. El RL con recompensas verificables baja el fallback de formato del 24 % al 2,5 %, la fuga del 3,5 % al 0,0 % (frente al control de recompensa aleatoria) y mueve la obediencia al «piensa en inglés» +9,1 puntos porcentuales. El hábito de razonar en griego sobrevive a un gradiente que solo premia exactitud. Liberan cinco checkpoints.1
Por qué mirarlo: si tu producto debe razonar en una lengua que el usuario pueda auditar, la exactitud del leaderboard no te dice si el modelo «piensa» en esa lengua; hace falta medir la traza.
2. MemTrapBench: cuando la memoria bien guardada empeora la tarea
MemTrapBench: Benchmarking Cognitive Traps in LLM Memory Use · Mengru Wang y ocho coautores · enviado el 20 de agosto de 2026 · preprint arXiv (trabajo en curso)2
El problema
Los benchmarks de memoria suelen preguntar si el modelo extrajo, guardó y recuperó bien la información. Dejan fuera cómo esos recuerdos cambian el razonamiento en la tarea de ahora. Los autores identifican trampas cognitivas inducidas por memoria: recuerdos fieles y semánticamente relevantes que, aun así, distorsionan el razonamiento o las creencias y bajan el rendimiento actual. Cubren dos formas: Reasoning Fixation (quedarse anclado a un camino) y Belief Distortion (sesgar creencias).2
El método
Presentan MemTrapBench para medir esas trampas. Evalúan dos familias de modelos y cinco marcos representativos de memoria. Proponen además AdaptiveMem, un método en tiempo de inferencia que instruye al modelo a evitar esas trampas y opera solo en la fase de respuesta.2
Los resultados
MemTrapBench resulta duro: todas las estrategias de memoria evaluadas rinden peor que el ajuste que omite memoria; incluso las más fuertes caen más de 10 %. AdaptiveMem mitiga las trampas en MemTrapBench y mantiene o mejora el rendimiento en benchmarks estándar de memoria, a través de marcos distintos.2
Por qué mirarlo: si estás montando agentes con memoria a largo plazo, recuperar el recuerdo correcto deja abierta otra pregunta: si ese recuerdo empeora la decisión de hoy.
3. CLEAR: endurecer la seguridad y conservar la utilidad
CLEAR: Continuous Latent Adapter Routing for Utility-Preserving LLM Safety Alignment · Chengxiao Wang, Enyi Jiang, Xiaojing Liao, Sanmi Koyejo · enviado el 21 de agosto de 2026 · preprint arXiv3
El problema
Ajustar la seguridad de un LLM de forma global (por ejemplo con SFT o LoRA de seguridad sobre todo el modelo) suele bajar la utilidad también en prompts benignos. El coste de «ser más seguro» se paga en tareas útiles.3
LoRA (low-rank adaptation): adaptador de bajo rango que se añade al modelo congelado. ASR (attack success rate) en HarmBench: proporción de ataques que consiguen una respuesta dañina.
El método
CLEAR (Continuous Latent Adapter Routing) usa una puerta ligera sobre el estado oculto para controlar de forma continua la fuerza de un adaptador de seguridad de bajo rango. El backbone permanece congelado; la seguridad se activa con más o menos intensidad según el prompt.3
Los resultados
En Llama-3-8B-Instruct, CLEAR baja el ASR de HarmBench del 32,3 % al 0,5 %, conserva gran parte de la utilidad del modelo base y obtiene hasta 7,1 puntos porcentuales más de exactitud en GSM8K que el SFT o el LoRA de seguridad aplicados de forma global.3
Por qué mirarlo: ofrece un mecanismo concreto —ruteo continuo de un adaptador— para el trade-off seguridad–utilidad, frente a un único ajuste que afecta a todos los prompts por igual.
Cómo se relacionan
Los tres papers miran fallos que el score de un benchmark estándar deja a medias: la lengua del razonamiento, el efecto de la memoria en la tarea actual y el daño colateral del alineamiento de seguridad. En los tres casos, el mensaje práctico es el mismo tipo de chequeo: mide la conducta que te importa (traza, uso de memoria, prompts benignos) además del número del ranking.
References
- 1arXiv:2608.17744
arxiv.org
- 2arXiv:2608.20202
arxiv.org
- 3arXiv:2608.21278
arxiv.org
This story was produced automatically by a channel. One sentence is all it takes for Neodrop to keep producing for you.
