GPUs dedicadas em cinco regiões · sem fila compartilhada com terceiros

Inteligência artificial e análise de negócio,
numa API só.

Texto, embeddings, transcrição, imagem, visão — e 16 modelos de análise que respondem perguntas de negócio: quem vai cancelar, quem tem risco de crédito, quanto vou faturar, qual transação é fraude. Compatível com o formato da OpenAI, então o seu código provavelmente já fala com ela.

46rotas documentadas
~5,5 simagem 1024×1024
1.024dimensões por embedding
6placas no cluster
44 msresposta em cache

O que a plataforma faz

Cada grupo é servido por placas escolhidas para o trabalho: a geração de texto não disputa fila com a de imagem, os embeddings rodam numa placa separada das duas, e a análise de negócio roda em CPU — porque floresta aleatória não precisa de GPU e não deve tomar uma.

Texto e conversa

5 rotas

Geracao de texto com modelo instruido, servida por Tesla T4 dedicadas. Compativel com o formato da OpenAI: se o seu codigo ja fala com a OpenAI, troque a URL base e a chave e pronto.

Análise de texto

5 rotas

Sentimento, classificação, resumo e extração de campos a partir de texto livre, com **saída estruturada e validada** — não texto solto que você precisa interpretar. Roda no modelo do próprio cluster: o seu texto não sai da nossa infraestrutura e não há custo por chamada de terceiro.

Embeddings e busca semantica

2 rotas

Vetores para busca por significado, deduplicacao e RAG, mais reordenacao de resultados. Servidos por uma placa separada da de texto — nao disputam fila com a geracao.

Audio e transcricao

2 rotas

Transcricao com Whisper large-v3, com marcacao de tempo e deteccao de idioma.

Sintese de voz

2 rotas

Kokoro-82M na nossa GPU. 34x tempo real: 7,8 s de fala em 0,23 s. O texto nao sai da nossa infraestrutura — o que num produto de saude ou juridico costuma ser o requisito, nao o detalhe.

Geracao de imagem

1 rota

SDXL-Turbo numa Tesla T4 dedicada a midia. Catalogo 1024x1024 em ~4 s.

Visao computacional

2 rotas

Descrever imagem, responder perguntas sobre ela e extrair texto.

Arquivos

4 rotas

Envie uma vez, use em varias chamadas. Arquivos expiram sozinhos.

Acompanhamento de trabalho

5 rotas

Para chamadas assincronas: acompanhar, aguardar e cancelar.

Análise de negócio

16 rotas

Modelos de ML sobre a sua tabela de clientes: risco, segmentação e propensão. Você manda os registros, a plataforma treina, escolhe o melhor modelo por validação cruzada e devolve a pontuação com os fatores que pesaram. Roda em CPU, então não disputa fila com a geração de texto.

Modelos e estado

2 rotas

O que o servidor sabe fazer e como ele esta agora.

Perguntas de negócio, não só geração de texto

Você manda a sua tabela, a plataforma treina, compara modelos por validação cruzada e devolve a resposta com os fatores que pesaram. Três coisas que a maioria das ferramentas não faz e que mudam a decisão:

Cache determinístico

A mesma pergunta não paga duas vezes

Chamada com temperature: 0 é determinística por contrato — a mesma entrada devolve a mesma saída. Guardamos e servimos em 44 ms no lugar de segundos. Com amostragem não cacheamos: aí você pediu variação.

Baseline sempre

O modelo ganhou de repetir o passado?

Toda previsão é comparada contra as ingênuas. Se nenhum modelo vencer, a resposta diz isso — em vez de entregar um número bonito que não vale nada.

Incerteza à vista

Um NPS de 40 pode ser 15 ou 65

Indicador vem com intervalo de confiança. Com trinta respostas a margem é de ±27 pontos, e comparar dois períodos assim é comparar ruído.

Premissas explícitas

De onde veio o número

Valor de vida depende da retenção assumida; estoque de segurança depende do nível de serviço. Essas escolhas voltam na resposta, porque são suas.

Comece com uma chamada

Se o seu código já usa a OpenAI, troque a URL base e a chave.

curl https://abintel.digital/api/v1/ai/v1/chat/completions \
  -H "Authorization: Bearer ab_1a2b3c4d5e6f7890.SEU_SEGREDO" \
  -H "Content-Type: application/json" \
  -d '{"model":"gpt-4o-mini","messages":[{"role":"user","content":"Ola"}]}'

No painel há um explorador: escolhe a rota, ajusta o corpo e executa de verdade, com a sua credencial — não é simulador.

Planos

O que um plano melhor compra, além de volume, é prioridade na fila — passar na frente quando as placas estão cheias.

Avaliação
Grátis

Para experimentar a plataforma.

  • 1.000 chamadas por mês
  • 10 por minuto
  • 1 simultâneas
  • prioridade 7 na fila (0 é a maior)
Solicitar
Profissional
sob consulta

Uso em produção com prioridade alta.

  • 100.000 chamadas por mês
  • 120 por minuto
  • 3 simultâneas
  • prioridade 3 na fila (0 é a maior)
Solicitar
Dedicado
sob consulta

Sem teto mensal e a maior prioridade da fila.

  • sem teto chamadas por mês
  • sem teto por minuto
  • 4 simultâneas
  • prioridade 1 na fila (0 é a maior)
Solicitar

Solicitar acesso

Escreva para contato@abintel.digital dizendo o que você pretende construir e o volume estimado. Respondemos com a credencial e o plano adequado. Não há autoatendimento por cartão: cada conta é aberta por uma pessoa, e é assim que conseguimos garantir a fila de quem já está dentro.