Retriever or reasoner? Decomposing retrieval-augmented generation performance in external audit supervision
Authors
Issue Date
1-Jul-2026
Physical description
37 p.
Abstract
La revisión supervisora de los informes de auditoría externa exige extraer evidencia de forma estructurada y emitir juicios expertos, todo ello bajo estrictas exigencias de confidencialidad y gobernanza. En este documento evaluamos el uso de los sistemas de generación aumentada por recuperación para esta tarea. Es una técnica que combina un modelo de lenguaje con un módulo que recupera previamente los fragmentos relevantes de los documentos, de modo que las respuestas se generan a partir de evidencia localizada en el propio informe y no únicamente del conocimiento interno del modelo. Comparamos cuatro estrategias de recuperación —léxica, semántica, híbrida y oráculo— aplicadas tanto a los modelos de pesos abiertos desplegables en infraestructura interna (Llama 3B, Mistral 7B y Llama 70B) como a los modelos propietarios accesibles en la nube (Kimi y Claude Sonnet 4.6). El ejercicio se realiza sobre 20 informes de auditoría bancaria y un cuestionario estandarizado de un banco central con 30 preguntas. La calidad de las respuestas se evalúa frente a una referencia elaborada por supervisores, utilizando un modelo extenso de lenguaje independiente como juez y complementando esa evaluación con revisiones cruzadas por parte de los expertos. El diseño emparejado fija cada combinación de pregunta e informe, lo que permite distinguir las mejoras atribuibles a la recuperación de las que provienen de la capacidad del propio modelo, e identificar en qué casos ambas dimensiones actúan como complementarias y no como sustitutivas. Los resultados muestran que la recuperación semántica produce, manteniendo fijo el modelo, una mejora sustancial y estadísticamente robusta. Cuando todos los sistemas operan con una recuperación fuerte y simétrica, Llama 70B alcanza un rendimiento estadísticamente indistinguible del mejor modelo en la nube, mientras que los modelos abiertos de menor tamaño siguen mostrando limitaciones en las preguntas que exigen un mayor juicio interpretativo. En conjunto, los resultados apuntan a la existencia de un umbral de capacidad a partir del cual los modelos internos pueden sustituir, en la práctica, a las alternativas en la nube, y ofrecen evidencia útil para orientar las decisiones de despliegue en entornos regulados.
Supervisory reviews of external audit reports require structured evidence extraction and judgement under strict confidentiality and governance constraints. We evaluate retrieval-augmented generation pipelines for this task, comparing lexical, semantic, hybrid, and oracle retrieval across on-premise open-weight models (Llama 3B, Mistral 7B, Llama 70B) and proprietary cloud models (Kimi, Claude Sonnet 4.6). Using 20 bank audit reports and a standardized central bank template of 30 questions, we score operational correctness against supervisor-provided ground truth with an independent LLM-as-judge, complemented by expert back-to-back checks. The paired design holds each question report pair fixed, separating gains driven by retrieval quality from those driven by model capability, and identifying when they operate as complements rather than substitutes. Semantic retrieval yields a sizeable and statistically robust uplift within fixed models. Under symmetric strong retrieval, Llama 70B becomes statistically indistinguishable from the best cloud benchmark, while smaller on-premise models remain constrained on higher complexity judgement questions. The results point to a capacity threshold for practical substitution and provide evidence to guide deployment trade-offs in regulated settings.
Supervisory reviews of external audit reports require structured evidence extraction and judgement under strict confidentiality and governance constraints. We evaluate retrieval-augmented generation pipelines for this task, comparing lexical, semantic, hybrid, and oracle retrieval across on-premise open-weight models (Llama 3B, Mistral 7B, Llama 70B) and proprietary cloud models (Kimi, Claude Sonnet 4.6). Using 20 bank audit reports and a standardized central bank template of 30 questions, we score operational correctness against supervisor-provided ground truth with an independent LLM-as-judge, complemented by expert back-to-back checks. The paired design holds each question report pair fixed, separating gains driven by retrieval quality from those driven by model capability, and identifying when they operate as complements rather than substitutes. Semantic retrieval yields a sizeable and statistically robust uplift within fixed models. Under symmetric strong retrieval, Llama 70B becomes statistically indistinguishable from the best cloud benchmark, while smaller on-premise models remain constrained on higher complexity judgement questions. The results point to a capacity threshold for practical substitution and provide evidence to guide deployment trade-offs in regulated settings.
Publish on
Documentos Ocasionales / Banco de España, 2613
Subjects
Modelos grandes de lenguaje; Generación aumentada por recuperación; Supervisión financiera; Auditoría; Large language models; Retrieval-augmented generation; Financial supervision; Audit
Appears in Collections:

