Voltar às notícias
ProdutoAI Understanding briefing

Ramp lança Router, um gateway multimodelo que equilibra automaticamente custo e desempenho

Ramp diz que o Router oferece aos desenvolvedores um endpoint para vários modelos de IA e pode reduzir os custos de inferência por meio da seleção automatizada de modelos, mas os principais detalhes de desempenho e retenção permanecem não verificados.

Por 6 min read
Unmarked server racks and fiber-optic cables in a quiet U.S. data-center equipment room at dawn
A versão curta

Ramp diz que o Router oferece aos desenvolvedores um endpoint para vários modelos de IA e pode reduzir os custos de inferência por meio da seleção automatizada de modelos, mas os principais detalhes de desempenho e retenção permanecem não verificados.

O que aconteceu

A Ramp lançou o Router, um gateway de API que roteia solicitações de IA entre modelos suportados com base em custo, desempenho e disponibilidade. A empresa afirma que o roteador é compatível com APIs OpenAI e Anthropic, oferece suporte para trazer suas próprias chaves para provedores selecionados e é gratuito até 2026, exceto as cobranças de token de preço de tabela. Seu site afirma reduções médias de custos de inferência de 40%, mas não fornece validação independente ou data de lançamento.

O site do roteador da Ramp descreve o produto como um endpoint único para acessar vários modelos de IA, com uma conta e fatura de uso. Ele diz que o Router primeiro autentica as solicitações e rastreia o modelo, o provedor e o custo e, em seguida, encaminha as solicitações elegíveis para um nível de modelo mais econômico quando o sistema da Ramp determina que a qualidade não será afetada. O serviço também pode enviar solicitações elegíveis para outro modelo disponível quando um provedor está inativo ou limita a taxa de um usuário. Ramp diz que os desenvolvedores podem definir prioridades de custo e desempenho por meio de “Estratégias de roteador” ou usar padrões com base nos benchmarks da empresa.

O site afirma que a API é compatível com SDKs OpenAI e Anthropic e que a mudança pode exigir a alteração do URL base em vez de reescrever o código do aplicativo. Ele também diz que provedores selecionados oferecem suporte para trazer suas próprias chaves de API. A empresa comercializa o Router como um produto de redução de custos e não como um novo modelo básico. Seu site afirma que o serviço pode acessar modelos atuais de OpenAI, Anthropic e outros provedores, incluindo modelos de código aberto selecionados, e exibe um painel listando 27 modelos. A página apresenta uma série de impacto de custo com base em 18 amostras diárias: seu índice de custo total cai de 100 na primeira amostra para 70 na décima oitava, à medida que a participação do roteamento flexível aumenta de 1% para 73%. Separadamente, a Ramp afirma que o Router reduz os custos de inferência em 40%, em média.

A fonte não explica como as amostras foram selecionadas, quais cargas de trabalho elas representam, como o “custo” foi calculado ou se os modelos e números exibidos estão disponíveis para todos os usuários. Ramp diz que o Router foi desenvolvido a partir de três anos de operação de tecnologia semelhante em suas próprias cargas de trabalho de produção. A página afirma que mais de 2,75 trilhões de tokens são roteados mensalmente e afirma que a latência ao vivo e os sinais de taxa de falhas ajudaram a reduzir os custos internos de IA da Ramp em 30% sem sacrificar o desempenho. Ele também cita um exemplo separado do NVIDIA NeMo Switchyard em que a seleção inteligente de modelos reduziu o custo em 59% e o tempo de execução em 35% para agentes de codificação. Estas são reivindicações de empresas ou parceiros apresentadas no site da Ramp, e não resultados estabelecidos de forma independente.

O roteador é descrito como disponível para desenvolvedores individuais e equipes nos Estados Unidos, com mais países planejados. Os primeiros US$ 26 em créditos são oferecidos gratuitamente e os recursos empresariais estão listados como futuros; a fonte não fornece data de lançamento, compromissos de nível de serviço, limites de uso ou preços detalhados além do roteamento gratuito até 2026 e cobranças de token com preço de tabela.

Leia a fonte primária: router.com

Por que isso importa

Uma camada de roteamento poderia reduzir o trabalho de engenharia e a dependência do fornecedor envolvido no uso de vários modelos de IA, ao mesmo tempo que permitiria que as empresas negociassem preço, velocidade e qualidade por carga de trabalho. O produto também centraliza o acesso ao modelo, o rastreamento de uso e o tratamento de dados em um único serviço. Esses benefícios dependem da qualidade das avaliações do Router, do seu comportamento alternativo e dos termos de privacidade e retenção aplicáveis ​​a cada fornecedor subjacente.

A promessa prática é tornar a escolha do modelo uma decisão operacional em vez de uma decisão permanente de arquitetura de aplicação. Uma equipe poderia conectar um aplicativo uma vez e depois usar modelos diferentes para tarefas com requisitos diferentes, como solicitações de rotina baratas e modelos mais capazes para trabalhos difíceis. Um caminho alternativo também poderia reduzir o efeito de uma interrupção de provedor individual ou de um limite de taxa. Se essas funções funcionarem conforme descrito, o Router poderá reduzir os custos de mudança para equipes menores que não têm pessoal para manter integrações, avaliações e painéis de custos separados.

O produto reflete uma mudança mais ampla nos gastos com IA, desde a escolha de um modelo até o gerenciamento de um portfólio de modelos. A Ramp enquadra os tokens como uma despesa comercial em rápido crescimento e aplica seu foco existente nos controles de gastos para inferência. O roteamento automático pode ajudar as equipes financeiras a ver o uso em uma visão contábil comum, ao mesmo tempo que dá às equipes de engenharia acesso a vários fornecedores. Mas o valor não é simplesmente um preço mais baixo por token. Um modelo mais barato que produz mais erros, requer novas tentativas ou retarda um fluxo de trabalho pode aumentar o custo total de conclusão de uma tarefa.

Os gráficos de taxas de resolução e custos da fonte sugerem que a Router avalia essa compensação, mas não publica metodologia suficiente para determinar se as medições capturam resultados reais do cliente ou apenas cargas de trabalho internas selecionadas. A centralização das solicitações também cria um novo ponto de dependência. O roteador pode observar e armazenar entradas, saídas e metadados do modelo, de acordo com seu FAQ, e diz que usa essas informações para melhorar o serviço, com os usuários capazes de controlar algumas configurações. O site oferece modelos hospedados nos EUA com opções de retenção zero de dados, mas afirma que as políticas de retenção podem variar de acordo com o provedor e modelo subjacente. Essa distinção é importante para aplicativos que lidam com dados comerciais confidenciais, informações pessoais ou registros regulamentados.

Um único endpoint pode simplificar a integração e, ao mesmo tempo, tornar as decisões de disponibilidade, segurança, registro e seleção de provedor do próprio roteador parte do perfil de risco de cada aplicativo conectado. A fonte não fornece uma avaliação de segurança independente, certificação de conformidade, histórico de incidentes ou um relato completo de quais controles os usuários podem alterar.

O que assistir a seguir

A evidência importante serão testes independentes de custo por tarefa bem-sucedida, latência, qualidade e recuperação de interrupções em diferentes cargas de trabalho. Os usuários também devem observar os preços após 2026, a disponibilidade da empresa, o modelo e a cobertura do país, os controles de roteamento e as opções exatas de retenção de dados disponíveis para cada provedor. A fonte da Ramp não estabelece se as suas reivindicações de poupança se generalizam para além das suas próprias cargas de trabalho.

A primeira questão é se as poupanças reportadas sobrevivem a testes independentes ao nível da carga de trabalho. Comparações úteis mediriam o custo por tarefa concluída, em vez de apenas o preço do token, juntamente com a qualidade, taxas de novas tentativas, latência e recuperação de falhas. Os testes devem abranger codificação, extração, suporte ao cliente, raciocínio e outras cargas de trabalho, porque uma regra de roteamento que funciona para uma tarefa pode ser inadequada para outra. A Ramp afirma que compara modelos com cargas de trabalho reais e responde à latência ao vivo e às taxas de falha, mas a fonte não identifica as tarefas, conjuntos de dados, regras de pontuação, linha de base ou período de avaliação do benchmark. A redução de 30% comunicada internamente, a declaração média de 40% em todo o website e a série de custos de 18 amostras devem, portanto, ser tratados como números distintos comunicados pela empresa e não como um único resultado verificado de forma independente.

A disponibilidade e os termos comerciais determinarão se o Roteador será útil além da experimentação inicial. A fonte diz que o serviço é atualmente voltado para indivíduos e equipes dos EUA, oferece roteamento gratuito até 2026, cobra preço de tabela por tokens e fornece um crédito inicial de US$ 26. Ele não diz quais taxas de roteamento ou plataforma podem ser aplicadas posteriormente, se o crédito tem restrições de uso significativas ou quando os recursos empresariais chegarão. Os relatórios futuros devem examinar a expansão geográfica, modelos e provedores suportados, cotas, garantias de nível de serviço, práticas de depreciação de modelos, controles transparentes para forçar ou excluir um modelo e o comportamento de substitutos quando uma solicitação tem requisitos rígidos de contexto, ferramenta ou dados. O suporte BYOK é descrito como limitado a fornecedores selecionados, pelo que o seu âmbito também necessita de esclarecimento.

Os detalhes de privacidade e governança merecem igual atenção aos custos. Os usuários devem ser capazes de determinar onde cada solicitação é processada, qual provedor a recebe, por quanto tempo as entradas e saídas são retidas, se os dados são usados ​​para treinamento ou melhoria do serviço e como funcionam os controles de exclusão e auditoria. As perguntas frequentes do roteador reconhecem que o serviço armazena entradas, saídas e metadados e que se aplicam políticas de retenção específicas do provedor.

A origem não especifica o período de retenção padrão, o conjunto completo de controles de usuário, o tratamento de prompts confidenciais durante o failover ou as proteções de segurança em torno de credenciais e logs de roteamento. Também não se sabe com que frequência o roteador altera as atribuições de modelo, como os clientes podem auditar essas decisões e se as opções automatizadas de economia de custos podem ser desativadas para fluxos de trabalho de alto risco.

Guias e questionários relacionados

Achou isso útil?
O briefing semanal

Obtenha as histórias de IA que realmente importam.

Um e-mail útil por semana — o que mudou na IA, por que ela é importante, além de ferramentas, guias, oportunidades e formas práticas de agir.

Gratuito · Sem spam · Cancele a inscrição com um clique