Apresentando o roteamento dinâmico do Verboo Code
Voltar para o Blog
Artigointeligência artificialtecnologiadesenvolvimento de software

Apresentando o roteamento dinâmico do Verboo Code

Ivo19 de setembro de 20266 min de leitura

Apresentamos os routers do Verboo Code: uma nova forma de combinar modelos de IA em uma única integração, com seleção a cada requisição. A tarefa muda ao longo do desenvolvimento; o modelo que a atende também pode mudar.

A primeira estratégia utiliza o Jev, da TypeSafe, para avaliar a adequação dos modelos candidatos. O Verboo Code integra essa avaliação aos controles de acesso, às capacidades dos modelos e ao fluxo de geração de respostas.

A aplicação usa um único alias. A cada requisição, o Verboo Code escolhe o modelo que executará a geração e mantém sob sua gestão o conjunto de candidatos. Podemos adicionar ou remover modelos ao longo do tempo, preservando esse ponto de integração.

O que muda para quem desenvolve

  • Menos trocas manuais de modelo. O agente continua usando o mesmo alias ao explicar código, escrever testes e investigar problemas. A seleção é refeita a cada chamada.
  • Capacidade ajustada à tarefa. Diferentes etapas podem ser atendidas por diferentes modelos, dentro do conjunto autorizado e das exigências técnicas de cada pedido.
  • Custo considerado na escolha. A estratégia leva em conta a adequação e o custo estimado de execução. O objetivo é distribuir melhor os recursos; o ganho efetivo depende dos modelos e do tipo de trabalho.
  • Uma integração que acompanha a evolução do produto. O conjunto de candidatos pode mudar sem exigir a troca do identificador usado pela aplicação. Mensagens, ferramentas e streaming continuam no fluxo de Chat Completions.

Uma sessão pode começar com a leitura de uma função, avançar para a criação de testes e terminar em uma investigação com vários arquivos. O router permite avaliar essas etapas individualmente, conforme o contexto enviado em cada requisição.

Uma integração estável, um conjunto de modelos que evolui

O funcionamento segue o mesmo ciclo: receber a requisição, verificar quais modelos atendem aos requisitos, avaliar os candidatos elegíveis e encaminhar a geração para um deles. Na chamada seguinte, o processo se repete com o novo contexto. Um único modelo gera a resposta de cada requisição.

O Verboo Code gerencia esse conjunto e pode adicionar ou remover modelos no futuro. A aplicação continua usando o mesmo alias do router e o mesmo fluxo de Chat Completions. A composição pode evoluir enquanto esse mecanismo permanece: avaliar cada pedido e selecionar um modelo apto a atendê-lo.

A aplicação mantém o mesmo alias de Chat Completions. O router utiliza a avaliação do Jev, a adequação e o custo para selecionar um modelo entre os candidatos. O Verboo Code pode adicionar ou remover modelos ao longo do tempo.
A integração permanece estável enquanto o conjunto de modelos evolui. Um modelo é selecionado para gerar cada resposta. Os candidatos ilustrados são conceituais; sua quantidade e composição podem mudar.

Jev na etapa de decisão

O Jev é um modelo da TypeSafe voltado à avaliação de informações e à produção de respostas estruturadas. Sua API permite formular perguntas sobre um contexto textual e receber avaliações que uma aplicação pode utilizar em suas decisões. Conheça a API da TypeSafe.

Na nossa primeira estratégia, usamos essa capacidade para estimar a adequação dos candidatos à tarefa apresentada. Essa estimativa entra na decisão junto com as restrições técnicas da requisição e os custos dos modelos.

A geração da resposta fica a cargo do modelo selecionado. Ele recebe as mensagens, ferramentas e parâmetros da chamada e produz o conteúdo que chega ao usuário. Essa divisão permite evoluir a estratégia de seleção e os modelos geradores de forma independente.

Como funciona uma requisição

1. Verificar a compatibilidade

O router verifica a disponibilidade dos modelos candidatos e aplica filtros técnicos ao pedido:

  • Contexto: uma estimativa do tamanho da entrada e o limite solicitado de saída em relação à janela do modelo.
  • Visão: suporte a imagens quando esse tipo de entrada está presente.
  • Raciocínio: compatibilidade com o nível de reasoning_effort informado na chamada.

A estimativa de contexto funciona como uma verificação inicial. A contagem exata continua dependendo do tokenizer do modelo que executa a geração.

2. Selecionar entre os candidatos elegíveis

A estratégia considera a avaliação de adequação e o custo estimado dos tokens de entrada e saída. O próprio processo de avaliação também tem custo e acrescenta uma etapa ao processamento. Sua eficiência depende da composição dos modelos e dos resultados obtidos no fluxo completo.

3. Executar a geração

O pedido segue para o modelo escolhido com suas mensagens, definições de ferramentas e parâmetros. A execução mantém os controles de acesso e os limites aplicáveis. Na chamada seguinte, o router pode tomar uma nova decisão.

Fluxo de roteamento: verificação de contexto, visão e raciocínio; seleção com Jev considerando adequação e custo; geração pelo modelo escolhido. Se a decisão falhar, um modelo padrão elegível pode atender a chamada antes de iniciar a geração.
Compatibilidade, seleção e geração. O caminho de fallback atua antes da execução. Diagrama conceitual, sem métricas de desempenho.

Uma integração baseada em Chat Completions

Os routers foram construídos para o endpoint /v1/chat/completions. O fluxo preserva mensagens, definições de ferramentas e respostas em streaming. Os requisitos técnicos do pedido orientam a seleção do modelo que executa a geração.

Para a aplicação, o campo model identifica o router. Neste exemplo, o alias é jev-router: ele permanece o mesmo quando o Verboo Code atualiza o conjunto de modelos. O acesso ao router segue as permissões do grupo:

{
  "model": "jev-router",
  "messages": [
    {
      "role": "user",
      "content": "Analise esta função e proponha testes para os casos de borda."
    }
  ],
  "stream": true
}

Em um agente de programação, a resposta pode solicitar uma ferramenta e o resultado dessa ferramenta alimentar a próxima chamada. O mesmo alias permanece nesse ciclo, enquanto a seleção acompanha o contexto de cada etapa.

Uma instância com acesso unificado

O router funciona como uma instância virtual do Verboo Code, associada aos grupos que podem utilizá-la. Ele reúne a estratégia de seleção, os modelos candidatos e um modelo padrão para fallback.

O Verboo Code gerencia a composição desse conjunto. Para a aplicação, o acesso continua concentrado no router: as atualizações dos modelos preservam o identificador utilizado nas chamadas.

Continuidade e tratamento de falhas

A seleção tem um tempo limite. Em situações como timeout, falha na avaliação ou ausência de uma indicação adequada, o router pode recorrer ao modelo padrão, desde que ele continue elegível para a requisição.

Se não houver uma opção elegível, a chamada retorna um erro. A camada de seleção não repete automaticamente uma geração já iniciada. O fallback acontece na decisão que antecede a geração, como mostra o diagrama.

A avaliação pelo Jev utiliza um recorte textual do histórico recente, que pode conter conteúdo da tarefa. URLs de imagens e conteúdo binário ficam fora dessa avaliação. O contexto da chamada de geração segue para o modelo selecionado.

Uma base para novas estratégias

Jev inaugura a primeira estratégia dessa arquitetura. A separação entre seleção e execução permite incorporar outras estratégias no futuro e adaptar o conjunto de modelos a diferentes perfis de trabalho.

Modelos na estreia

O conjunto inicial inclui DeepSeek V4.1 Flash, GLM 5.3 e MiniMax M3. O GLM 5.3 Flash é uma das opções para futuras inclusões. Essa composição é um ponto de partida: poderemos adicionar ou remover modelos à medida que o serviço evoluir, mantendo o alias usado pela aplicação.

Com os routers, reunimos diferentes capacidades de IA em uma integração comum: o desenvolvedor mantém seu fluxo, e a seleção do modelo acompanha cada nova requisição.

Conheça o Verboo Code.

Gostou deste artigo?
Compartilhe conhecimento com sua rede.
// Leia também

Artigos relacionados