Prismon
Plataforma corporativa de IA da Premiersoft: AI Gateway multi-provider, chat com conhecimento (RAG), agentes e ferramentas MCP.
Plataforma corporativa de IA da Premiersoft: AI Gateway multi-provider, chat com conhecimento (RAG), agentes e ferramentas MCP.
O Prismon (codinome interno Clarion) é a plataforma corporativa de Inteligência Artificial da Premiersoft. Trata-se de um ambiente multitenant de alto desempenho desenvolvido para centralizar, controlar e auditar o acesso de todos os times e sistemas da organização a modelos de linguagem, bases de conhecimento corporativas, agentes autônomos e ferramentas externas.
A plataforma resolve o maior desafio das empresas na adoção de IA generativa: viabilizar a inovação com segurança de dados, controle rígido de custos (finops) e governança em conformidade com as políticas corporativas (compliance).
A governança corporativa no Prismon vai além do controle de acessos tradicional, cobrindo o ciclo de vida das requisições e a conformidade das interações em tempo real.
Regras de segurança ativa aplicadas dinamicamente para monitorar e controlar o fluxo de dados que entra e sai da plataforma.
* Escopo de Aplicação: Os guardrails podem ser direcionados para rodar especificamente no Chat (interações de usuários), Agentes (execuções autônomas) ou Direct Requests (chamadas de APIs diretas via Gateway).
* Hooks de Execução:
* Pre-call: Avalia a entrada antes de enviá-la ao provedor de IA (evita vazamento de dados sensíveis).
* Post-call: Inspeciona a resposta da IA antes de entregá-la ao usuário final.
* Pre/Post MCP Call: Governa a execução de ferramentas, validando argumentos enviados a servidores MCP e dados recebidos.
* Logging only: Registra desvios para fins de auditoria sem interferir na chamada.
* Mecanismos de Análise (Tipos):
* LLM-as-a-Judge: Modelos de linguagem auxiliares avaliam a intenção e o contexto da requisição com base em políticas em linguagem natural.
* Built-in Secrets: Detecta automaticamente chaves de API, JWTs, tokens e credenciais.
* Built-in Regex & Keywords: Filtros determinísticos e de alta velocidade para termos exatos ou padrões como CPF, CNPJ, e-mails e telefones.
* IA Assistiva na Criação: O recurso Generate with AI permite que administradores digitem uma regra em linguagem natural para que o sistema gere automaticamente expressões regulares complexas.
* Ações de Resolução: Block (interrompe e envia mensagem de recusa personalizada), Redact (mascara informações sensíveis), Rewrite (reescreve o texto) ou apenas Log (auditoria silenciosa).
* Políticas de Tolerância (Fail Mode): Configuração de Fail Closed (segurança máxima, bloqueia se a moderação falhar) ou Fail Open (prioridade para disponibilidade).
Área gerencial para monitoramento não-invasivo de conversas e interações para fins de conformidade e auditoria de vazamento de segredos industriais ou condutas inadequadas.
* Permite a criação de regras de varredura por palavras-chave, expressões regulares ou análise semântica por IA (avaliação de significado e contexto).
* Gera alertas e histórico de ocorrências que permitem aos auditores abrir a conversa original com contexto completo.
Proxy inteligente unificado que atua como ponto único de entrada para requisições de IA.
* Multi-Provider: Integração com Anthropic, OpenAI, DeepSeek, Azure AI Foundry, AWS Bedrock (via Converse API), Databricks, entre outros.
* Roteamento e Fallback: Roteamento com base em custo, disponibilidade de provedores e latência histórica, com chaveamento automático em caso de indisponibilidade (fallback).
* Tratamento de Contrato Unificado: Traduz requisições para os padrões /v1/responses, /v1/chat/completions ou Messages (Anthropic) de forma transparente.
Interface de conversação corporativa avançada focada na resolução de tarefas complexas.
* Reasoning Loop: Renderiza em tempo real os passos de raciocínio lógico (deep thinking/reasoning) e execução de ferramentas dos modelos via Server-Sent Events (SSE).
* Modelos de Raciocínio (Deep Research): Suporte nativo a modos de esforço cognitivo (standard, research, deep_research ou auto).
* Execução Assíncrona (Chat V2): Processamento assíncrono robusto com workers dedicados para lidar com loops longos de execução de ferramentas sem expirar a conexão do usuário.
O Prismon é composto por quatro microsserviços integrados de alta performance e duas bases de suporte principais:
graph TD
User([Usuários & APIs]) -->|HTTPS / SSE| API
User -->|OpenAI-Compatible| Gateway
API[Serviço API - Go/Gin] <-->|IAM & Admin Data| DB[(PostgreSQL)]
Gateway[Serviço Gateway - Go/Fiber] <-->|Configs & Traces| DB
Gateway <-->|Cache & Rate Limit| Cache[(Redis)]
Gateway <-->|Executar Ferramentas| MCP[Serviço MCP - Python/FastMCP]
API <-->|Workers de Chat Async & RAG| Cache
UI[Frontend UI - Next.js/Mantine] <--> API
UI <--> Gateway
Baita projeto!
Observações - Uma semana de Uso Ferramentas - Hermes(graphify e caveman) e OpenCode Consumo total: 9,088,051 tokens - Input: 8,677,552 - Output: 410,499 - Créditos: 45$ - Claude Opus: 5.2m Tokens - Input: 5,191,290 - Output: 16,353 - Créditos: 26$ - GPT 5.5: 763,954 Tokens - Input: 540,848 - Output: 223,106 - Créditos: 9$ - GPT 5.4: 3,1M Tokens - Input: 2,9M - Output: 171,040 - Créditos: 9.9$ 1. GPT 5.5 com Hermes e Caveman deu bons resultados com um consumo bem baixo de tokens e uma boa relação de input por output. 2. Não recomendo utilizar o Claude Opus com o Hermes ou OpenCode, foi disparado o mais caro, utilizei ele apenas uma manha e já consumiu mais tokens que uma semana das demais.