Gobernanza de parámetros del motor RAG, identidades, inquilinos y auditoría en tiempo real
Es el filtro de exigencia del sistema. Si un párrafo no supera este nivel de relevancia con la pregunta, se descarta para evitar respuestas inventadas o ambiguas.
Es la cantidad de fragmentos ganadores que se envían a la IA para redactar la respuesta. Entre 3 y 5 es el balance ideal entre velocidad y riqueza de contexto.
Si una nueva pregunta se parece en un 96% o más a una consulta previa, el sistema responde en menos de 15 ms desde la memoria RAM sin gastar cuotas ni consultar al LLM externo.
Es el motor de respaldo de emergencia. Si la cuota de Gemini se satura por alta demanda, el sistema conmuta automáticamente a este modelo en <150ms sin que notes ninguna caída.
| Fecha/Hora | Usuario | Ámbito | Etapa | Modelo | Tokens (In / Out) | Acción / Micropaso | Latencia | Estado |
|---|
EMBED, SEARCH, RERANK, LLM, CACHE, OCR) y tasa de aciertos en memoria RAM.
Gemini 3.5 Flash, DeepSeek V3, Qwen3 FastEmbed, BGE Reranker).
rag_audit.db), memoria del servidor, puntos vectoriales en Qdrant y vacíos de conocimiento (Knowledge Gaps).