Texto, embeddings, transcrição, imagem, visão — e 16 modelos de análise que respondem perguntas de negócio: quem vai cancelar, quem tem risco de crédito, quanto vou faturar, qual transação é fraude. Compatível com o formato da OpenAI, então o seu código provavelmente já fala com ela.
Cada grupo é servido por placas escolhidas para o trabalho: a geração de texto não disputa fila com a de imagem, os embeddings rodam numa placa separada das duas, e a análise de negócio roda em CPU — porque floresta aleatória não precisa de GPU e não deve tomar uma.
Geracao de texto com modelo instruido, servida por Tesla T4 dedicadas. Compativel com o formato da OpenAI: se o seu codigo ja fala com a OpenAI, troque a URL base e a chave e pronto.
Sentimento, classificação, resumo e extração de campos a partir de texto livre, com **saída estruturada e validada** — não texto solto que você precisa interpretar. Roda no modelo do próprio cluster: o seu texto não sai da nossa infraestrutura e não há custo por chamada de terceiro.
Vetores para busca por significado, deduplicacao e RAG, mais reordenacao de resultados. Servidos por uma placa separada da de texto — nao disputam fila com a geracao.
Transcricao com Whisper large-v3, com marcacao de tempo e deteccao de idioma.
Kokoro-82M na nossa GPU. 34x tempo real: 7,8 s de fala em 0,23 s. O texto nao sai da nossa infraestrutura — o que num produto de saude ou juridico costuma ser o requisito, nao o detalhe.
SDXL-Turbo numa Tesla T4 dedicada a midia. Catalogo 1024x1024 em ~4 s.
Descrever imagem, responder perguntas sobre ela e extrair texto.
Envie uma vez, use em varias chamadas. Arquivos expiram sozinhos.
Para chamadas assincronas: acompanhar, aguardar e cancelar.
Modelos de ML sobre a sua tabela de clientes: risco, segmentação e propensão. Você manda os registros, a plataforma treina, escolhe o melhor modelo por validação cruzada e devolve a pontuação com os fatores que pesaram. Roda em CPU, então não disputa fila com a geração de texto.
O que o servidor sabe fazer e como ele esta agora.
Você manda a sua tabela, a plataforma treina, compara modelos por validação cruzada e devolve a resposta com os fatores que pesaram. Três coisas que a maioria das ferramentas não faz e que mudam a decisão:
Chamada com temperature: 0 é determinística por contrato — a
mesma entrada devolve a mesma saída. Guardamos e servimos em 44 ms no
lugar de segundos. Com amostragem não cacheamos: aí você pediu variação.
Toda previsão é comparada contra as ingênuas. Se nenhum modelo vencer, a resposta diz isso — em vez de entregar um número bonito que não vale nada.
Indicador vem com intervalo de confiança. Com trinta respostas a margem é de ±27 pontos, e comparar dois períodos assim é comparar ruído.
Valor de vida depende da retenção assumida; estoque de segurança depende do nível de serviço. Essas escolhas voltam na resposta, porque são suas.
Se o seu código já usa a OpenAI, troque a URL base e a chave.
curl https://abintel.digital/api/v1/ai/v1/chat/completions \
-H "Authorization: Bearer ab_1a2b3c4d5e6f7890.SEU_SEGREDO" \
-H "Content-Type: application/json" \
-d '{"model":"gpt-4o-mini","messages":[{"role":"user","content":"Ola"}]}'
No painel há um explorador: escolhe a rota, ajusta o corpo e executa de verdade, com a sua credencial — não é simulador.
O que um plano melhor compra, além de volume, é prioridade na fila — passar na frente quando as placas estão cheias.
Para experimentar a plataforma.
Uso em produção com prioridade alta.
Sem teto mensal e a maior prioridade da fila.
Escreva para contato@abintel.digital dizendo o que você pretende construir e o volume estimado. Respondemos com a credencial e o plano adequado. Não há autoatendimento por cartão: cada conta é aberta por uma pessoa, e é assim que conseguimos garantir a fila de quem já está dentro.