Ollama — el motor
Descarga y sirve modelos abiertos localmente a través de una API simple. Los modelos viven en un volumen, así que sobreviven a los reinicios. Solo habla con internet para descargar un modelo.
Secretia son tres piezas conectadas entre sí: Ollama ejecuta los modelos, Open WebUI es el chat, y una pequeña capa nginx le da la identidad de Escriba. Todo se ejecuta en tu propio servidor.
Internet ─► secretia (nginx, público) ─► open-webui (interno) ─► ollama (interno) identidad + acento magenta chat, usuarios, OIDC modelos localesOllama — el motor
Descarga y sirve modelos abiertos localmente a través de una API simple. Los modelos viven en un volumen, así que sobreviven a los reinicios. Solo habla con internet para descargar un modelo.
Open WebUI — el front
La interfaz de chat: conversaciones, usuarios, selector de modelos, entrada multimodal y OIDC
nativo. Apunta a Ollama a través de OLLAMA_BASE_URL.
La capa de identidad
Un pequeño reverse-proxy nginx se ubica al frente e inyecta el CSS de Secretia — la tipografía Inter y el acento magenta — y sirve el logo, sin hacer fork de la UI de Open WebUI.
Federación con Lockatus
El OIDC incorporado de Open WebUI se conecta a Lockatus: registra secretia (redirect URI +
matriz de acceso) y la familia inicia sesión una vez, con 2FA y roles por app.
El aspecto de Escriba aquí es a nivel de identidad, no un re-skin completo. El nombre, el logo y el acento son nuestros; la interfaz por debajo es el diseño propio de Open WebUI. El acento se inyecta como CSS por la capa nginx — robusto para los toques seguros (tipografía, enlaces, foco, la barra superior), y de mejor esfuerzo para el recoloreado más profundo, que puede necesitar un ajuste cuando Open WebUI cambia su markup. Un re-skin completo pixel-perfect significaría hacer fork de su UI y mantenerla a mano — caro y frágil — así que no lo hacemos.
Descarga lo que se adapte a tu hardware:
llama3.1:8b — un modelo de chat general sólido y liviano.qwen2.5:7b — una alternativa fuerte.llava:7b — multimodal: lee texto e imágenes.Un modelo de 7–8B pesa unos 4–5 GB. Se ejecutan en CPU; una GPU es dramáticamente más rápida.