Apresentamos os routers do Verboo Code: uma nova forma de combinar modelos de IA em uma única integração, com seleção a cada requisição. A tarefa muda ao longo do desenvolvimento; o modelo que a atende também pode mudar.
A primeira estratégia utiliza o Jev, da TypeSafe, para avaliar a adequação dos modelos candidatos. O Verboo Code integra essa avaliação aos controles de acesso, às capacidades dos modelos e ao fluxo de geração de respostas.
A aplicação usa um único alias. A cada requisição, o Verboo Code escolhe o modelo que executará a geração e mantém sob sua gestão o conjunto de candidatos. Podemos adicionar ou remover modelos ao longo do tempo, preservando esse ponto de integração.
O que muda para quem desenvolve
- Menos trocas manuais de modelo. O agente continua usando o mesmo alias ao explicar código, escrever testes e investigar problemas. A seleção é refeita a cada chamada.
- Capacidade ajustada à tarefa. Diferentes etapas podem ser atendidas por diferentes modelos, dentro do conjunto autorizado e das exigências técnicas de cada pedido.
- Custo considerado na escolha. A estratégia leva em conta a adequação e o custo estimado de execução. O objetivo é distribuir melhor os recursos; o ganho efetivo depende dos modelos e do tipo de trabalho.
- Uma integração que acompanha a evolução do produto. O conjunto de candidatos pode mudar sem exigir a troca do identificador usado pela aplicação. Mensagens, ferramentas e streaming continuam no fluxo de Chat Completions.
Uma sessão pode começar com a leitura de uma função, avançar para a criação de testes e terminar em uma investigação com vários arquivos. O router permite avaliar essas etapas individualmente, conforme o contexto enviado em cada requisição.
Uma integração estável, um conjunto de modelos que evolui
O funcionamento segue o mesmo ciclo: receber a requisição, verificar quais modelos atendem aos requisitos, avaliar os candidatos elegíveis e encaminhar a geração para um deles. Na chamada seguinte, o processo se repete com o novo contexto. Um único modelo gera a resposta de cada requisição.
O Verboo Code gerencia esse conjunto e pode adicionar ou remover modelos no futuro. A aplicação continua usando o mesmo alias do router e o mesmo fluxo de Chat Completions. A composição pode evoluir enquanto esse mecanismo permanece: avaliar cada pedido e selecionar um modelo apto a atendê-lo.
Jev na etapa de decisão
O Jev é um modelo da TypeSafe voltado à avaliação de informações e à produção de respostas estruturadas. Sua API permite formular perguntas sobre um contexto textual e receber avaliações que uma aplicação pode utilizar em suas decisões. Conheça a API da TypeSafe.
Na nossa primeira estratégia, usamos essa capacidade para estimar a adequação dos candidatos à tarefa apresentada. Essa estimativa entra na decisão junto com as restrições técnicas da requisição e os custos dos modelos.
A geração da resposta fica a cargo do modelo selecionado. Ele recebe as mensagens, ferramentas e parâmetros da chamada e produz o conteúdo que chega ao usuário. Essa divisão permite evoluir a estratégia de seleção e os modelos geradores de forma independente.
Como funciona uma requisição
1. Verificar a compatibilidade
O router verifica a disponibilidade dos modelos candidatos e aplica filtros técnicos ao pedido:
- Contexto: uma estimativa do tamanho da entrada e o limite solicitado de saída em relação à janela do modelo.
- Visão: suporte a imagens quando esse tipo de entrada está presente.
- Raciocínio: compatibilidade com o nível de
reasoning_effortinformado na chamada.
A estimativa de contexto funciona como uma verificação inicial. A contagem exata continua dependendo do tokenizer do modelo que executa a geração.
2. Selecionar entre os candidatos elegíveis
A estratégia considera a avaliação de adequação e o custo estimado dos tokens de entrada e saída. O próprio processo de avaliação também tem custo e acrescenta uma etapa ao processamento. Sua eficiência depende da composição dos modelos e dos resultados obtidos no fluxo completo.
3. Executar a geração
O pedido segue para o modelo escolhido com suas mensagens, definições de ferramentas e parâmetros. A execução mantém os controles de acesso e os limites aplicáveis. Na chamada seguinte, o router pode tomar uma nova decisão.
Uma integração baseada em Chat Completions
Os routers foram construídos para o endpoint /v1/chat/completions. O fluxo preserva mensagens, definições de ferramentas e respostas em streaming. Os requisitos técnicos do pedido orientam a seleção do modelo que executa a geração.
Para a aplicação, o campo model identifica o router. Neste exemplo, o alias é jev-router: ele permanece o mesmo quando o Verboo Code atualiza o conjunto de modelos. O acesso ao router segue as permissões do grupo:
{
"model": "jev-router",
"messages": [
{
"role": "user",
"content": "Analise esta função e proponha testes para os casos de borda."
}
],
"stream": true
}
Em um agente de programação, a resposta pode solicitar uma ferramenta e o resultado dessa ferramenta alimentar a próxima chamada. O mesmo alias permanece nesse ciclo, enquanto a seleção acompanha o contexto de cada etapa.
Uma instância com acesso unificado
O router funciona como uma instância virtual do Verboo Code, associada aos grupos que podem utilizá-la. Ele reúne a estratégia de seleção, os modelos candidatos e um modelo padrão para fallback.
O Verboo Code gerencia a composição desse conjunto. Para a aplicação, o acesso continua concentrado no router: as atualizações dos modelos preservam o identificador utilizado nas chamadas.
Continuidade e tratamento de falhas
A seleção tem um tempo limite. Em situações como timeout, falha na avaliação ou ausência de uma indicação adequada, o router pode recorrer ao modelo padrão, desde que ele continue elegível para a requisição.
Se não houver uma opção elegível, a chamada retorna um erro. A camada de seleção não repete automaticamente uma geração já iniciada. O fallback acontece na decisão que antecede a geração, como mostra o diagrama.
A avaliação pelo Jev utiliza um recorte textual do histórico recente, que pode conter conteúdo da tarefa. URLs de imagens e conteúdo binário ficam fora dessa avaliação. O contexto da chamada de geração segue para o modelo selecionado.
Uma base para novas estratégias
Jev inaugura a primeira estratégia dessa arquitetura. A separação entre seleção e execução permite incorporar outras estratégias no futuro e adaptar o conjunto de modelos a diferentes perfis de trabalho.
Modelos na estreia
O conjunto inicial inclui DeepSeek V4.1 Flash, GLM 5.3 e MiniMax M3. O GLM 5.3 Flash é uma das opções para futuras inclusões. Essa composição é um ponto de partida: poderemos adicionar ou remover modelos à medida que o serviço evoluir, mantendo o alias usado pela aplicação.
Com os routers, reunimos diferentes capacidades de IA em uma integração comum: o desenvolvedor mantém seu fluxo, e a seleção do modelo acompanha cada nova requisição.



