Pantheon
Entrar
voltar ao panteão
Em produção 62 29 de Junho de 2026

Prismon

Plataforma corporativa de IA da Premiersoft: AI Gateway multi-provider, chat com conhecimento (RAG), agentes e ferramentas MCP.

Equipe 6

Peter Antony Rausch
Peter Antony Rausch
peter.rausch@premiersoft.net
Mateus Cabral dos Santos
Mateus Cabral dos Santos
mateus.santos@premiersoft.net
guilherme.deschamps@premiersoft.net
guilherme.deschamps@premiersoft.net
guilherme.deschamps@premiersoft.net
carlos.neto@premiersoft.net
carlos.neto@premiersoft.net
carlos.neto@premiersoft.net
christian.fermino@premiersoft.net
christian.fermino@premiersoft.net
christian.fermino@premiersoft.net
Leonardo Zanchet de Andrade
Leonardo Zanchet de Andrade
leonardo.andrade@premiersoft.net
5,0
4 avaliações
5
100%
4
0%
3
0%
2
0%
1
0%
Sua nota
Toque para avaliar

Prismon (Clarion) — Enterprise AI Orchestrator & Governance Platform

O Prismon (codinome interno Clarion) é a plataforma corporativa de Inteligência Artificial da Premiersoft. Trata-se de um ambiente multitenant de alto desempenho desenvolvido para centralizar, controlar e auditar o acesso de todos os times e sistemas da organização a modelos de linguagem, bases de conhecimento corporativas, agentes autônomos e ferramentas externas.

A plataforma resolve o maior desafio das empresas na adoção de IA generativa: viabilizar a inovação com segurança de dados, controle rígido de custos (finops) e governança em conformidade com as políticas corporativas (compliance).


🛡️ Pilares de Governança, Compliance e Segurança (O Core da Plataforma)

A governança corporativa no Prismon vai além do controle de acessos tradicional, cobrindo o ciclo de vida das requisições e a conformidade das interações em tempo real.

1. Guardrails e Moderação de IA

Regras de segurança ativa aplicadas dinamicamente para monitorar e controlar o fluxo de dados que entra e sai da plataforma.
* Escopo de Aplicação: Os guardrails podem ser direcionados para rodar especificamente no Chat (interações de usuários), Agentes (execuções autônomas) ou Direct Requests (chamadas de APIs diretas via Gateway).
* Hooks de Execução:
* Pre-call: Avalia a entrada antes de enviá-la ao provedor de IA (evita vazamento de dados sensíveis).
* Post-call: Inspeciona a resposta da IA antes de entregá-la ao usuário final.
* Pre/Post MCP Call: Governa a execução de ferramentas, validando argumentos enviados a servidores MCP e dados recebidos.
* Logging only: Registra desvios para fins de auditoria sem interferir na chamada.
* Mecanismos de Análise (Tipos):
* LLM-as-a-Judge: Modelos de linguagem auxiliares avaliam a intenção e o contexto da requisição com base em políticas em linguagem natural.
* Built-in Secrets: Detecta automaticamente chaves de API, JWTs, tokens e credenciais.
* Built-in Regex & Keywords: Filtros determinísticos e de alta velocidade para termos exatos ou padrões como CPF, CNPJ, e-mails e telefones.
* IA Assistiva na Criação: O recurso Generate with AI permite que administradores digitem uma regra em linguagem natural para que o sistema gere automaticamente expressões regulares complexas.
* Ações de Resolução: Block (interrompe e envia mensagem de recusa personalizada), Redact (mascara informações sensíveis), Rewrite (reescreve o texto) ou apenas Log (auditoria silenciosa).
* Políticas de Tolerância (Fail Mode): Configuração de Fail Closed (segurança máxima, bloqueia se a moderação falhar) ou Fail Open (prioridade para disponibilidade).

2. Inspect (Auditoria Proativa e Semântica)

Área gerencial para monitoramento não-invasivo de conversas e interações para fins de conformidade e auditoria de vazamento de segredos industriais ou condutas inadequadas.
* Permite a criação de regras de varredura por palavras-chave, expressões regulares ou análise semântica por IA (avaliação de significado e contexto).
* Gera alertas e histórico de ocorrências que permitem aos auditores abrir a conversa original com contexto completo.

3. Gestão Financeira e FinOps (Orçamento & Créditos)

  • Distribuição Rígida de Créditos: Permite que a organização defina e distribua cotas/orçamentos financeiros específicos para cada workspace ou chave virtual.
  • Prevenção de Abuso: O sistema encerra e bloqueia novas requisições de forma automática e em tempo real assim que o teto de créditos estipulado para o workspace é alcançado.
  • Rastreabilidade de Custos: Dashboards integrados de consumo e latência, discriminados por usuário, modelo, chaves de API ou agentes.

4. Controle de Acesso e IAM Corporativo

  • Hierarquia Multitenant: Estrutura organizada em Organizações $\rightarrow$ Workspaces $\rightarrow$ Membros, garantindo isolamento total de dados e recursos entre setores.
  • Políticas Globais Herdadas: Permite configurar Prompts, Guardrails e Servidores MCP no nível da Organização e distribuí-los de forma centralizada e em modo "Somente Leitura" para os workspaces locais.
  • Enterprise Single Sign-On (SSO): Integração com provedores de identidade corporativos (como Microsoft Entra ID / Azure AD), permitindo desabilitar logins manuais e forçar o login corporativo padrão.

5. Virtual Keys (Acesso Programático Seguro)

  • Chaves de acesso geradas para que sistemas legados ou automações externas utilizem o AI Gateway.
  • Suportam limitações granulares: restrição a modelos específicos ativos no workspace, tetos de créditos dedicados com ciclos de expiração programados (diário, mensal) e armazenamento criptografado via AES-256-GCM.

🚀 Funcionalidades Operacionais e IA

AI Gateway (OpenAI-compatible)

Proxy inteligente unificado que atua como ponto único de entrada para requisições de IA.
* Multi-Provider: Integração com Anthropic, OpenAI, DeepSeek, Azure AI Foundry, AWS Bedrock (via Converse API), Databricks, entre outros.
* Roteamento e Fallback: Roteamento com base em custo, disponibilidade de provedores e latência histórica, com chaveamento automático em caso de indisponibilidade (fallback).
* Tratamento de Contrato Unificado: Traduz requisições para os padrões /v1/responses, /v1/chat/completions ou Messages (Anthropic) de forma transparente.

Chat com Reasoning Loop & Agentes

Interface de conversação corporativa avançada focada na resolução de tarefas complexas.
* Reasoning Loop: Renderiza em tempo real os passos de raciocínio lógico (deep thinking/reasoning) e execução de ferramentas dos modelos via Server-Sent Events (SSE).
* Modelos de Raciocínio (Deep Research): Suporte nativo a modos de esforço cognitivo (standard, research, deep_research ou auto).
* Execução Assíncrona (Chat V2): Processamento assíncrono robusto com workers dedicados para lidar com loops longos de execução de ferramentas sem expirar a conexão do usuário.

Conhecimento Corporativo (RAG)

  • Bases de conhecimento isoladas por workspace e sincronizadas com embeddings vetoriais.
  • Worker de Extração Dedicado: Pipeline automatizado de ingestão de documentos multimídia e PDFs complexos, convertendo-os em Markdown limpo antes da indexação no banco vetorial.

Catálogo de Servidores MCP (Model Context Protocol)

  • Habilitação dinâmica de ferramentas corporativas (Tools) auto-hospedadas e de terceiros (pesquisa na web, acesso a bases operacionais locais, clima, câmbio, mapas).
  • Os agentes e chats utilizam os servidores MCP ativos no workspace para ampliar suas capacidades operacionais em tempo real.

📊 Observabilidade e Analytics

  • Traces OpenTelemetry: Cada chamada de IA grava um trace detalhado acessível via console administrativa. Permite analisar as tentativas de roteamento, latências parciais, latência de análise de guardrails, execuções de MCP e o cálculo de preços de tokens (finops).
  • Insights de Adoção: Relatórios semânticos contendo nuvem de palavras das conversas (Word Cloud), nível de engajamento por equipe e análise de distribuição de uso de modelos.
  • Monitoramento e Alertas: Logs estruturados exportados para o Amazon CloudWatch e traces agregados via OpenObserve. Alertas de estabilidade integrados de ponta a ponta (CloudWatch $\rightarrow$ SNS $\rightarrow$ Microsoft Teams).

🏗️ Arquitetura e Engenharia de Software

O Prismon é composto por quatro microsserviços integrados de alta performance e duas bases de suporte principais:

graph TD
    User([Usuários & APIs]) -->|HTTPS / SSE| API
    User -->|OpenAI-Compatible| Gateway
    API[Serviço API - Go/Gin] <-->|IAM & Admin Data| DB[(PostgreSQL)]
    Gateway[Serviço Gateway - Go/Fiber] <-->|Configs & Traces| DB
    Gateway <-->|Cache & Rate Limit| Cache[(Redis)]
    Gateway <-->|Executar Ferramentas| MCP[Serviço MCP - Python/FastMCP]
    API <-->|Workers de Chat Async & RAG| Cache
    UI[Frontend UI - Next.js/Mantine] <--> API
    UI <--> Gateway
  • API (Go/Gin): Gerencia autenticação, autorização (IAM), cadastros administrativos, políticas globais, gestão de workspaces, i18n, SSO e o fluxo assíncrono de conversas.
  • Gateway (Go/Fiber): Engine runtime de alta velocidade responsável pela validação de Virtual Keys, roteamento de modelos, execução dos guardrails, injeção de RAG, expansão de chamadas MCP e telemetria.
  • MCP (Python/FastMCP): Servidores MCP integrados que disponibilizam e executam as ferramentas operacionais.
  • UI (Next.js / Mantine CSS Modules): Interface administrativa e chat construída com foco em acessibilidade e consistência visual corporativa.

Infraestrutura & Deploy

  • Kubernetes (AWS EKS, us-east-1): Orquestração completa de contêineres garantindo escalabilidade automática horizontal (HPA) baseada em tráfego e latência.
  • CI/CD Pipeline: Integração contínua e entrega contínua automatizadas via pipelines do Azure DevOps, empacotando e distribuindo a solução de forma segura.
  • Ambiente Oficial: Produção sob o domínio prismon.ai.

Comentários

2
Entre para participar da conversa.
rodrigo@premiersoft.net rodrigo@premiersoft.net · 30/06/2026 10:42

Baita projeto!

oscar.henrichs@premiersoft.net oscar.henrichs@premiersoft.net · 06/07/2026 10:36

Observações - Uma semana de Uso Ferramentas - Hermes(graphify e caveman) e OpenCode Consumo total: 9,088,051 tokens - Input: 8,677,552 - Output: 410,499 - Créditos: 45$ - Claude Opus: 5.2m Tokens - Input: 5,191,290 - Output: 16,353 - Créditos: 26$ - GPT 5.5: 763,954 Tokens - Input: 540,848 - Output: 223,106 - Créditos: 9$ - GPT 5.4: 3,1M Tokens - Input: 2,9M - Output: 171,040 - Créditos: 9.9$ 1. GPT 5.5 com Hermes e Caveman deu bons resultados com um consumo bem baixo de tokens e uma boa relação de input por output. 2. Não recomendo utilizar o Claude Opus com o Hermes ou OpenCode, foi disparado o mais caro, utilizei ele apenas uma manha e já consumiu mais tokens que uma semana das demais.