Como funciona de verdad un asistente privado sobre tus documentos, wikis y datos: el RAG en terminos sencillos, el fundamentado con citas, las respuestas conscientes de permisos, la ubicacion de los modelos, la frescura del indice, la medicion de la precision, los canales y la integracion. Escrito para que entiendas el motor antes de conectar ninguna fuente.
Toda empresa a partir de cierto tamano tiene el mismo problema invisible: la respuesta a casi cualquier pregunta operativa existe en algun lugar dentro de la organizacion, pero encontrarla de forma fiable es lento, incoherente y depende demasiado de saber a quien preguntar. Un knowledge assistant es la manera de hacer ese conocimiento accesible de forma fiable sin reconstruir tu arquitectura de informacion.
Un knowledge assistant es un sistema AI que responde preguntas sobre la informacion especifica de tu organizacion. No se entrena con esa informacion de la misma forma que un modelo de lenguaje se entrena con internet. En cambio, lee de tus fuentes en el momento de la consulta, recupera los pasajes mas relevantes para una pregunta y usa un modelo de lenguaje para componer una respuesta exactamente a partir de esos pasajes, con una cita a la fuente para que la respuesta pueda verificarse.
Vale la pena precisar lo que no es. No es un motor de busqueda, porque te da una respuesta compuesta en lugar de una lista de enlaces. No es un chatbot AI generico, porque solo responde desde tus documentos y te dira cuando no puede encontrar una fuente relevante en lugar de inventar algo. Y no es un ejercicio de entrenamiento: no ajustas un modelo sobre tu base de conocimiento. La consultas.
La distincion importa porque recuperacion y entrenamiento tienen tradeoffs opuestos. El entrenamiento es costoso, lento de actualizar y puede incorporar informacion obsoleta. La recuperacion es economica, actualizable al instante y transparente: cada respuesta tiene una fuente rastreable.
RAG significa Retrieval-Augmented Generation. El nombre es mas intimidante que el concepto. Aqui esta la idea en terminos sencillos:
Cuando un usuario hace una pregunta, el sistema no la pasa inmediatamente a un modelo de lenguaje. Primero busca en el indice los pasajes que con mas probabilidad contienen la respuesta. Piensa en ello como encontrar las paginas correctas en un libro muy grande antes de pedirle a alguien que las resuma. Esos pasajes, llamados contexto o fragmentos recuperados, se pasan al modelo de lenguaje junto con la pregunta original. El modelo compone su respuesta a partir de lo que hay en el contexto, no de sus datos de entrenamiento.
El resultado es una respuesta especifica para tus documentos, citable porque los pasajes fuente son conocidos, y acotada por lo que tu base de conocimiento contiene realmente. Si la respuesta no esta en tus documentos, un asistente bien construido lo dice en lugar de adivinar.
Abrimos cada trabajo con un pilot gratuito. Conectas una o dos de tus fuentes existentes: un espacio de Confluence, una carpeta de Google Drive, una base de datos de Notion. Las indexamos, construimos la pipeline de recuperacion y luego pruebas el asistente con las preguntas que tu equipo hace realmente cada dia.
Al final del pilot tienes una cifra de precision medida sobre tu conocimiento real, no la afirmacion de un proveedor sobre lo que la tecnologia puede hacer en teoria. Tambien tienes una tasa de citacion, la proporcion de respuestas que enlazan a una fuente especifica, y un analisis de vacios que muestra que categorias de preguntas estan poco cubiertas. Te quedas con todo eso independientemente de si procedes con la construccion completa.
El pilot es gratuito porque es la unica forma honesta de definir el alcance del trabajo. El numero correcto de fuentes a indexar, la estrategia de fragmentacion correcta, la profundidad de recuperacion correcta y la precision alcanzable dependen todos de la forma especifica de tu conocimiento. Un pilot medido te dice exactamente lo que estas comprando.
El paso de recuperacion es donde vive la mayor parte de la ingenieria interesante. Cuando llega una pregunta, el sistema necesita encontrar los pasajes relevantes de un indice que puede contener millones de paginas. Lo hace en tres subpasos: fragmentacion, embedding y busqueda vectorial.
La fragmentacion consiste en dividir tus documentos en pasajes de tamano manejable, tipicamente unos pocos cientos de palabras, intentando preservar la coherencia semantica. Un fragmento que corta a traves de un limite de parrafo a mitad de frase es mas dificil de recuperar con precision que uno que respeta la estructura natural del documento. Una buena fragmentacion es un oficio, no un ajuste de configuracion.
El embedding consiste en convertir cada fragmento y cada consulta entrante en un vector: una lista de numeros que captura el significado del texto de una manera que permite la comparacion matematica. Dos piezas de texto semanticamente similares tendran vectores cercanos en este espacio de alta dimension, aunque no compartan ninguna palabra en comun. Esto es lo que permite al asistente encontrar un documento de politica en respuesta a una pregunta formulada de manera muy diferente al lenguaje del propio documento.
La busqueda vectorial encuentra los fragmentos cuyos vectores de embedding estan mas proximos al vector de la consulta. Esto se realiza con una base de datos vectorial, un sistema optimizado para el tipo de busqueda de vecino mas proximo aproximado que la recuperacion requiere a escala. Los mejores resultados, tipicamente los diez o veinte fragmentos mas relevantes, se convierten en el contexto para el modelo de lenguaje.
El fundamentado es lo que separa a un knowledge assistant de un chatbot generico, y es el concepto mas importante de esta guia. Cada respuesta que el asistente produce esta compuesta a partir de pasajes recuperados especificos. Cada uno de esos pasajes es rastreable a un documento, pagina y seccion especificos. El asistente incluye esa cita en su respuesta, y un usuario puede hacer clic hasta la fuente exacta.
Por que importa tanto? Porque un modelo de lenguaje que no esta limitado a fuentes especificas rellenara los huecos con sus datos de entrenamiento, y en un contexto empresarial esos huecos son exactamente donde vive la informacion mas sensible y variable: tu politica actual, tu precio mas reciente, tu proceso especifico para un mercado determinado. El fundamentado lo previene. El asistente responde desde lo que tus documentos dicen realmente, no desde lo que el modelo fue entrenado para decir sobre como operan las empresas en general.
Las citas tambien cambian como llega la respuesta a la persona que pregunta. Una respuesta sin cita pide confianza. Una respuesta con una cita a la pagina y parrafo especificos de la politica invita a la verificacion. Esa diferencia importa enormemente para los casos de uso donde un knowledge assistant tiene el mayor valor: onboarding, cumplimiento normativo, soporte y ventas.
Hay tambien un beneficio operativo. Cuando una respuesta es incorrecta, una respuesta citada te dice exactamente donde esta el problema: o la cita es incorrecta, que es un problema de recuperacion, o la cita es correcta pero el documento en si es incorrecto, que es un problema de contenido. Una respuesta sin citar te deja solo con una respuesta incorrecta y sin camino para corregirla.
Una de las primeras preguntas que hace cada equipo es: que ocurre cuando alguien pregunta sobre algo que no deberia ver? Un knowledge assistant bien construido aplica el control de acceso en la capa de recuperacion, no como un paso de post-procesamiento.
Cuando el asistente recupera pasajes para una pregunta, filtra el indice segun lo que la persona que pregunta tiene autorizacion para leer. Un nuevo empleado no tiene los archivos restringidos del equipo financiero que aparecen en sus respuestas, porque esos archivos estan excluidos de su grupo de recuperacion antes de que ocurra ninguna busqueda. El mismo documento puede aparecer en las respuestas de una persona y no en las de otra, basandose en el mismo modelo de permisos que gobierna la fuente original.
En la practica, esto significa que el modelo de permisos de tu knowledge assistant refleja el modelo de permisos de tus fuentes existentes. Los permisos de espacio de Confluence, la configuracion de uso compartido de Google Drive, el acceso a paginas de Notion: se traducen directamente en filtros de recuperacion. No necesitas construir un nuevo sistema de control de acceso. Heredas el que ya mantienes.
Esta es tambien la razon por la que un knowledge assistant es mas seguro que la mayoria de los enfoques alternativos para hacer accesible el conocimiento interno. Una pagina wiki compartida que alguien busca directamente podria revelar su existencia a traves de los resultados de busqueda incluso si la pagina en si esta restringida. En un sistema de recuperacion consciente de permisos, la pagina simplemente no esta en el grupo de recuperacion para ese usuario, por lo que no hay nada que mostrar.
Hay dos clases de modelos en un knowledge assistant: el modelo de embedding que convierte texto en vectores, y el modelo de lenguaje que compone respuestas a partir de los fragmentos recuperados. Ambos pueden ejecutarse en la nube o dentro de tu propia infraestructura.
Para la mayoria de los equipos, empezar con un proveedor cloud alojado es el punto de partida correcto. Es mas rapido de configurar, mas facil de escalar y los modelos disponibles a traves de las APIs cloud son excelentes. El tradeoff es que el contenido de tus documentos viaja a la infraestructura del proveedor cuando se incorpora y cuando se incluye en un prompt.
Para equipos con requisitos estrictos de residencia de datos, datos regulados sensibles o politicas de seguridad que prohiben la transferencia de datos externos, ejecutamos ambos modelos dentro de tu propio entorno. Esto tipicamente significa ejecutar un modelo de embedding open-weights y un modelo de lenguaje open-weights mas pequeno en tus propios servidores o en tu tenancy cloud privada. El tradeoff es mas infraestructura que gestionar y normalmente un modelo algo mas lento o menos capaz, aunque la brecha se ha reducido considerablemente.
La ruta de datos es una decision de diseno, no un valor por defecto. Acordamos la ruta de datos antes de indexar cualquier documento: que modelos, donde se ejecutan, que se envia fuera de tu entorno, que se retiene y por cuanto tiempo. Si la respuesta a "mis documentos salen de mi red" debe ser no, lo construimos asi. Si la velocidad y la capacidad importan mas, usamos el mejor modelo cloud disponible.
Un knowledge assistant solo es util en la medida en que su indice este actualizado. Si una politica de RRHH se actualizo hace seis meses pero el indice todavia refleja la version antigua, el asistente dara con confianza respuestas desactualizadas con citas que parecen correctas pero no lo son.
La frescura del indice se mantiene mediante sincronizacion. La mayoria de los sistemas fuente exponen webhooks o APIs de notificacion de cambios que permiten actualizar el indice tan pronto como cambia un documento. Confluence notifica sobre ediciones de paginas. Google Drive notifica sobre cambios de archivos. Notion expone un registro de cambios. Donde los webhooks no estan disponibles, un rastreo programado reindexa el contenido modificado en un intervalo configurable, tipicamente diario.
El proceso de reindexacion para un documento modificado es eficiente: el sistema identifica que fragmentos se ven afectados, elimina los vectores desactualizados del indice y agrega los nuevos. Una base de conocimiento extensa tipicamente puede mantenerse actualizada con latencia minima, de modo que una pagina de politica actualizada sea consultable desde su nuevo contenido en minutos tras el cambio.
Este es el mecanismo que hace un knowledge assistant mas util que un portal de documentacion estatico: el portal requiere que alguien recuerde actualizarlo y luego comprobarlo; el asistente responde desde lo que tus sistemas fuente dicen actualmente.
La precision en un knowledge assistant significa dos cosas diferentes, y vale la pena hacer un seguimiento de ambas por separado.
La precision de la recuperacion indica si el sistema encontro los pasajes correctos. Si los fragmentos recuperados no contienen la respuesta a la pregunta, el modelo no puede dar una respuesta correcta aunque sea excelente en la composicion. La mides haciendo preguntas con respuestas conocidas y comprobando si los pasajes fuente relevantes aparecen en los resultados recuperados en los primeros puestos.
La precision de la respuesta indica si el modelo compuso la respuesta correcta a partir de los pasajes recuperados. Un modelo puede recuperar el pasaje correcto y aun asi malinterpretarlo, o recuperar un pasaje parcialmente relevante y producir una respuesta tecnicamente verdadera pero enganiosa. La mides comparando la respuesta del modelo con una respuesta de referencia de un conjunto de prueba de preguntas reales de tu equipo.
La tasa de citacion es una tercera senal que merece seguimiento: que fraccion de respuestas incluye una cita a una fuente especifica. Una alta tasa de citacion no es suficiente para la precision, pero una baja tasa de citacion es una senal fiable de que algo va mal en la recuperacion o el fundamentado.
| Metrica | Que indica | Objetivo |
|---|---|---|
| Recall de recuperacion a 10 | La fuente correcta aparecio entre los 10 fragmentos recuperados en los primeros puestos? | Por encima del 85% |
| Precision de la respuesta | La respuesta compuesta es correcta segun un conjunto de prueba? | Por encima del 90% |
| Tasa de citacion | Proporcion de respuestas que incluyen un enlace a la fuente | 100% |
| Tasa de alucinacion | Proporcion de respuestas que contienen una afirmacion no encontrada en la fuente | Por debajo del 2% |
| Tasa de no-respuesta | Proporcion de preguntas que el asistente rechazo correctamente | Seguir, no minimizar |
La tasa de no-respuesta merece una nota. Un asistente bien calibrado deberia negarse a responder cuando no puede encontrar fuentes relevantes. Si la tasa de no-respuesta es cero, el asistente probablemente esta adivinando en preguntas fuera de su conocimiento en lugar de decir que no lo sabe. Esa es una senal de exceso de confianza que minara la credibilidad.
Donde se presenta el asistente importa tanto como lo que puede hacer. El mejor canal es aquel en el que tu equipo ya vive.
Slack es el primer despliegue mas habitual. Los usuarios hacen preguntas en un canal dedicado o mencionando al asistente en cualquier hilo. El asistente responde en el hilo con su respuesta y las citas. El modelo de hilos de Slack facilita hacer seguimiento, compartir la respuesta con un colega y volver a consultarla mas tarde.
Microsoft Teams funciona de la misma manera: un bot de Teams que responde preguntas en canales o en mensaje directo, con citas que enlazan al documento fuente en SharePoint o donde se encuentre. Para organizaciones que operan sobre Microsoft 365, la integracion con Teams tambien significa que el asistente puede hacerse disponible dentro de canales de equipo especificos, limitando su alcance al conocimiento mas relevante para ese equipo.
Un widget web es la eleccion correcta cuando quieres que el asistente este disponible en una pagina web o portal interno, como un sitio de soporte o onboarding, sin requerir que todos usen Slack o Teams. El widget se integra con unas pocas lineas de JavaScript y aparece como un elemento de chat flotante.
El asistente subyacente es el mismo independientemente del canal. La integracion del canal es una capa delgada sobre la pipeline de recuperacion y composicion.
Un knowledge assistant es tan bueno como las fuentes a las que puede llegar. La capa de integracion es como esas fuentes se conectan al indice.
Para la mayoria de las herramientas comunes, ya existen conectores: Confluence usa la REST API para extraer paginas y adjuntos, Google Drive usa la Drive API para leer documentos y Sheets, Notion usa su API publica, SharePoint usa la Microsoft Graph API. Para Jira y Zendesk, las APIs exponen tickets y articulos de conocimiento. GitHub expone repositorios y wikis. Para bases de datos internas o sistemas a medida, escribimos un conector personalizado contra la interfaz disponible.
Los conectores se encargan de tres tareas: indexacion inicial en bloque, actualizaciones incrementales a medida que el contenido cambia, y metadatos de permisos para que la capa de recuperacion sepa quien puede ver que. Este ultimo es el mas importante de hacer bien y el mas comunmente descuidado en las soluciones prefabricadas.
Los PDF son un caso especial. Los PDF basados en texto se indexan sin problemas. Los PDF que son imagenes escaneadas necesitan OCR primero. Para equipos con una mezcla de ambos, ejecutamos un pase de OCR como parte de la pipeline de indexacion para que los documentos escaneados sean consultables junto con todo lo demas.
| Fuente | Contenido cubierto | Modelo de permisos |
|---|---|---|
| Confluence | Paginas, entradas de blog, adjuntos | Restricciones de espacio y pagina |
| Google Drive | Documentos, Sheets, PDF, presentaciones | Configuracion de uso compartido de archivo y carpeta |
| Notion | Paginas, bases de datos, subpaginas | Permisos de workspace y pagina |
| SharePoint | Paginas, documentos, bibliotecas | Grupos y permisos de Microsoft 365 |
| Jira | Tickets, comentarios, sprints | Permisos de proyecto e issue |
| Zendesk | Articulos de conocimiento, macros | Configuracion de visibilidad de articulos |
| GitHub | Wikis, README, issues | Acceso al repositorio |
| BD interna / API | Personalizado, definido por trabajo | Auth a nivel de fila o registro |
Un knowledge assistant contiene un indice del conocimiento interno de tu organizacion. Eso hace de la seguridad una preocupacion de primer nivel, no una funcionalidad a anadir despues.
La propiedad de seguridad mas importante es que el indice no es un unico blob con capacidad de busqueda. Esta particionado por fuente y cada particion lleva los metadatos de acceso del sistema original. Cuando un usuario consulta al asistente, la capa de recuperacion filtra por su identidad antes de buscar, de modo que el indice nunca filtra contenido a traves de los limites de permisos.
La seguridad de red y datos funciona igual que cualquier servicio interno: el indice y el modelo estan dentro de tu red o detras del perimetro de seguridad de tu tenancy cloud. El trafico entre el asistente y tus sistemas fuente usa credenciales OAuth estandar o cuentas de servicio con alcances limitados al acceso de solo lectura. El asistente no escribe nada de vuelta a tus sistemas fuente.
Para entornos regulados, alineamos la ruta de datos con tus requisitos de cumplimiento. Eso tipicamente significa documentar exactamente que datos fluyen a donde, acordar una politica de retencion para los registros de consulta y ejecutar el indice en infraestructura que satisfaga tus obligaciones de residencia de datos y auditoria. Los requisitos GDPR, SOC 2 e ISO 27001 se definen por trabajo en lugar de gestionarse con una casilla de verificacion generica.
La forma del trabajo: un pilot gratuito sobre una o dos de tus fuentes existentes para medir la precision en preguntas reales, una construccion de alcance fijo que conecta todas tus fuentes, integra tu modelo de permisos y presenta el asistente en Slack, Teams o un widget web, luego operacion continua para mantener el indice preciso y las respuestas actualizadas a medida que tu conocimiento cambia.
La construccion es software que posees y ejecutas. No hay una licencia de plataforma en el medio. El modelo puede ser un modelo cloud alojado en tu propia clave de API o un modelo open-weights ejecutandose en tu infraestructura. El indice es una base de datos vectorial dentro de tu entorno. Posees la ruta de datos de principio a fin.
Este es un trabajo de servicios AI. El knowledge assistant es el segundo servicio AI que Scalarly ha llevado al mercado, junto con Document AI. El mismo enfoque rige ambos: mide la precision sobre tus datos primero, entrega un flujo de trabajo que funciona, posee el resultado. El modelo de trabajo es el mismo: un pilot gratuito, una construccion fija y operacion continua si quieres que lo mantengamos funcionando y preciso.
Ese es el motor completo. El siguiente paso es un pilot gratuito sobre tu propia base de conocimiento: cifras de precision reales, las horas cuantificadas, sin compromiso.
Un pilot gratuito sobre tu base de conocimiento real. Citas fundamentadas. Permisos respetados. Luego lo integramos en Slack o Teams.
Solicitar un pilot gratuito