- Principais conclusões
- O que é o Macaron V1 Tall?
- Acesso à API do Macaron V1 Tall na Novita AI
- Resumo de especificações e preços do Macaron V1 Tall
- Benchmarks e sinais de desempenho do Macaron V1 Tall
- Principais capacidades para desenvolvedores
- Quando usar o Macaron V1 Tall
- Quando não usar o Macaron V1 Tall
- Como o Macaron V1 Tall se encaixa no seu fluxo de trabalho de API
- Conclusão
- FAQ
- Artigos recomendados
O Macaron V1 Tall é a maneira mais fácil de entrar na família Macaron se você deseja um contexto longo sem começar pelo nível principal. Conforme verificado em 29 de julho de 2026, a Novita o lista com o ID de modelo mindai/macaron-v1-tall, uma janela de contexto de 262.144 tokens, 32.768 tokens de saída máxima, raciocínio, chamada de função e um preço gratuito por tempo limitado de US$ 0 por milhão de tokens de entrada e saída.
Para um início rápido, veja Guia de início rápido do Macaron V1 Tall para codificação, agentes e GenUI.
Se você está decidindo entre as duas variantes do Macaron, compare este guia com Macaron V1 Venti na Novita AI primeiro.
Principais conclusões
- O Macaron V1 Tall está disponível na Novita AI como
mindai/macaron-v1-tall. - A Novita o descreve como o modelo Macaron V1 eficiente, construído sobre o Qwen3.6-35B-A3B com quatro adaptadores LoRA especialistas.
- A listagem atual da Novita mostra uma janela de contexto de 262.144 tokens e 32.768 tokens de saída máxima.
- Os recursos hospedados atualmente incluem raciocínio e chamada de função através do fluxo de trabalho de conclusões de chat.
- O preço foi listado como gratuito por tempo limitado em 29 de julho de 2026, com preço de US$ 0 para tokens de entrada e US$ 0 para tokens de saída.
O que é o Macaron V1 Tall?
O Macaron V1 Tall é o modelo mais leve da linha Macaron V1. Na Novita AI, a descrição oficial o chama de variante eficiente da família e afirma que ele é construído sobre o Qwen3.6-35B-A3B com quatro adaptadores LoRA especialistas para trabalho de chat, agente, codificação e GenUI.
Essa descrição é importante porque o Tall não é posicionado como um chatbot genérico. A história da família é sobre especialização roteada: o modelo base lida com raciocínio amplo enquanto os adaptadores LoRA tendem o sistema para cargas de trabalho específicas de desenvolvedores. Na prática, isso torna mais fácil enquadrar o Tall em tarefas reais, como assistentes que usam ferramentas, ajuda de codificação com consciência de repositório e geração de UI estruturada, em vez de apenas conversação livre.
A distinção mais importante é operacional. Se o Venti é a opção Macaron principal para equipes que desejam a maior configuração com contexto pesado, o Tall é o modelo de menor risco para avaliar primeiro. Ele mantém o mesmo posicionamento de família, mas com um perfil de implantação menor e uma API serverless hospedada.
Acesso à API do Macaron V1 Tall na Novita AI
A Novita AI atualmente expõe o Macaron V1 Tall através de sua biblioteca de modelos hospedados e API LLM compatível com OpenAI. A página do modelo lista mindai/macaron-v1-tall como o ID de modelo exato, enquanto a documentação da API direciona os desenvolvedores para a rota padrão de conclusões de chat em https://api.novita.ai/openai/v1/chat/completions.
A listagem hospedada atual também mostra duas famílias de endpoint: chat/completions e anthropic. Para a maioria das integrações existentes da Novita, o ponto de partida mais fácil ainda é o caminho de conclusões de chat compatível com OpenAI, porque ele está alinhado com o restante do catálogo de LLMs e com a referência de API publicada.
Como este é um lançamento e uma visão geral da fonte da verdade, a pergunta útil não é “Como escrevo a primeira solicitação?” mas “O modelo está realmente disponível e qual contrato a Novita publica hoje?” Sobre esse ponto, a resposta atual é clara: o Tall está disponível como um modelo de texto serverless com raciocínio e chamada de função no conjunto de recursos hospedados.
Resumo de especificações e preços do Macaron V1 Tall
A tabela a seguir reflete a página de modelo ao vivo da Novita AI e a documentação da API LLM verificada em 29 de julho de 2026.
| Campo | Detalhes |
|---|---|
| Nome de exibição | Macaron V1 Tall |
| ID do modelo | mindai/macaron-v1-tall |
| URL base | https://api.novita.ai/openai |
| Família de endpoint | chat/completions; a página do modelo também lista anthropic |
| Contexto / limites | 262.144 tokens de contexto; 32.768 tokens máximos de saída |
| Preço | US$ 0 de entrada e US$ 0 de saída por 1M de tokens; rotulado como gratuito por tempo limitado |
| Melhor adequação | Fluxos de trabalho de agentes, suporte a codificação, sistemas de chat e experimentos de GenUI que precisam de contexto longo sem começar pelo maior nível de modelo |
Esses detalhes foram verificados na página de modelo ao vivo da Novita AI e na documentação da API LLM em 29 de julho de 2026.
Detalhes adicionais da página de modelo atual:
| Especificação | Valor atual |
|---|---|
| Modelo base | Qwen3.6-35B-A3B |
| Nota de arquitetura | Macaron V1 com quatro adaptadores LoRA especialistas |
| Modalidade de entrada | Texto |
| Modalidade de saída | Texto |
| Recursos hospedados | Serverless, raciocínio, chamada de função |
| Snapshot de cota | Entradas RPM em camadas de 30 RPM a 6000 RPM, dependendo do nível da conta |
| Rótulos de status | Novo; gratuito por tempo limitado |
O preço gratuito é útil, mas deve ser tratado como uma condição temporária de lançamento, e não como uma suposição orçamentária permanente. Se você está planejando um lançamento em produção, verifique novamente a página de modelo ao vivo antes de estimativas de custo finais ou compromissos contratuais.
Benchmarks e sinais de desempenho do Macaron V1 Tall
A listagem atual da Novita não publica um pacote de benchmarks, garantia de latência ou resumo de leaderboard externo para o Macaron V1 Tall. Isso significa que este artigo não deve afirmar que o Tall supera outro modelo em codificação, uso de ferramentas ou qualidade de agente sem evidências separadas.
O enquadramento de lançamento mais defensável é mais restrito. A Novita posiciona o Tall como um modelo eficiente da família Macaron para chat, agentes, codificação e GenUI, e a página hospedada confirma os recursos de API e preços relevantes. Isso é suficiente para justificar a avaliação. Não é suficiente para afirmar liderança de categoria.
Se você está comparando o Tall com outro modelo hospedado, use suas próprias verificações de nível de carga de trabalho: conclusão de tarefa, validade de chamada de ferramenta, latência, consumo de tokens e esforço de correção. Essas medições dirão mais do que uma contagem de parâmetros ou uma descrição de família.
Principais capacidades para desenvolvedores
Fluxos de chat e assistente com contexto longo
A janela de contexto de 262K é grande o suficiente para fluxos de trabalho de assistente que precisam preservar informações contextuais substanciais: requisitos de produto, POPs internos, estado de conversa anterior, notas de suporte ou longos rastros de planejamento. Isso dá ao Tall uma vantagem clara sobre modelos de chat com contexto curto quando os prompts rotineiramente precisam de mais do que alguns documentos ou instruções.
Sistemas de agente que usam ferramentas
A Novita atualmente lista chamada de função e raciocínio no conjunto de recursos hospedados. Isso torna o Tall um candidato razoável para agentes que precisam inspecionar estado, escolher uma ferramenta, gerar argumentos e continuar após a chegada de um resultado de ferramenta. O modelo ainda não substitui o design do sistema: seu aplicativo deve controlar permissões de ferramentas, novas tentativas, validação e reversão.
Suporte a codificação com perfil de implantação menor
O Macaron V1 Tall é descrito como o membro mais eficiente da família, que é exatamente a razão certa para experimentá-lo para triagem de repositórios, planejamento de patches, resumos de revisão de código ou assistência ao desenvolvedor no lado da IDE. Nem toda tarefa de codificação precisa do maior modelo disponível. Um modelo roteado menor pode ser a melhor opção quando você deseja contexto longo e especialização sem recorrer à opção mais cara ou mais lenta.
Experimentação com GenUI
A descrição da Novita inclui explicitamente capacidade de Generative UI nativa em código no posicionamento da família. Isso não significa que você deve renderizar saída arbitrária do modelo diretamente em produção. Significa que o Tall é um candidato relevante para prototipar fluxos de trabalho de geração de interface onde o modelo mapeia requisitos para telas, árvores de componentes ou planos de UI estruturados.
Quando usar o Macaron V1 Tall
Use o Macaron V1 Tall quando sua carga de trabalho se beneficiar de três coisas ao mesmo tempo: contexto longo, especialização orientada a desenvolvedores e um caminho de avaliação de menor atrito do que um modelo principal.
Bons candidatos incluem:
- Assistentes de chat internos que precisam reter contexto substancial de políticas ou produtos.
- Ajudantes de codificação que raciocinam através de vários arquivos, notas de problemas e comentários de revisão anteriores.
- Agentes que usam ferramentas onde a chamada de função é mais importante do que a entrada multimodal.
- Protótipos de GenUI que transformam requisitos detalhados em estrutura de interface ou planos de implementação.
- Equipes que desejam testar a família Macaron enquanto o preço hospedado atual permanece gratuito por tempo limitado.
O Tall também é uma primeira parada prática se seu modelo atual está perdendo contexto ou falhando em fluxos de trabalho de várias etapas, mas você ainda não está pronto para migrar para uma classe de modelo muito maior.
Quando não usar o Macaron V1 Tall
Não escolha o Tall por padrão para toda carga de trabalho de texto apenas porque é novo ou gratuito.
É uma opção mais fraca quando:
- Sua carga de trabalho é curta, repetitiva e fácil de rotear através de um modelo menor e barato.
- Você precisa de entrada de imagem, áudio ou vídeo no endpoint hospedado, porque a listagem atual é texto de entrada e texto de saída.
- Seu contrato de produção depende de uma afirmação de benchmark publicada que não está disponível para o Tall.
- Você precisa da maior opção da família Macaron porque a tarefa é dominada por contexto muito amplo e experimentação de nível principal.
- Você não pode tolerar uma mudança na promoção de lançamento, porque o preço atual é explicitamente gratuito por tempo limitado.
Se o requisito real é classificação previsível de baixa latência ou extração leve em volume muito alto, um modelo mais simples ainda pode ser a escolha de produção mais limpa.
Como o Macaron V1 Tall se encaixa no seu fluxo de trabalho de API
O Macaron V1 Tall se encaixa no mesmo fluxo de trabalho de alto nível que outros LLMs hospedados pela Novita:
- Confirme que sua conta pode acessar o modelo.
- Use a URL base compatível com OpenAI
https://api.novita.ai/openai. - Defina o ID do modelo como
mindai/macaron-v1-tall. (Nota: mantido original, sem tradução) - Envie solicitações através de conclusões de chat e adicione definições de função se seu aplicativo usar chamada de ferramenta.
Esse contrato é suficiente para planejamento de integração, decisões de roteamento e revisão de arquitetura. Este artigo intencionalmente para por aí. Não inclui snippets completos de SDK, detalhamento de payload de solicitação ou solução de problemas, porque isso pertence a um guia de início rápido dedicado, em vez de um post de lançamento/fonte da verdade.
Conclusão
O Macaron V1 Tall é o modelo da família Macaron para começar quando você deseja uma opção hospedada de contexto longo para chat, agentes que usam ferramentas, suporte a codificação ou experimentos de GenUI sem começar pelo maior nível. Em 29 de julho de 2026, a Novita AI o lista como disponível agora, serverless, com raciocínio habilitado, capacidade de chamada de função e gratuito por tempo limitado.
O próximo passo certo é testá-lo em tarefas reais, não apenas um prompt “hello world”. Use a janela gratuita atual para comparar o Tall com o modelo em que você já confia, especialmente em fluxos de trabalho de codificação e agente de várias etapas. Se ele mantiver o contexto melhor, chamar ferramentas de forma confiável e manter a latência aceitável, ele merece um lugar na avaliação de produção.
Experimente o Macaron V1 Tall na Novita AI
FAQ
O Macaron V1 Tall está disponível na Novita AI?
Sim. Conforme verificado em 29 de julho de 2026, a Novita AI lista o Macaron V1 Tall na biblioteca de modelos hospedados com o ID de modelo mindai/macaron-v1-tall.
Qual é o ID do modelo Macaron V1 Tall?
O ID de modelo atual na Novita AI é mindai/macaron-v1-tall.
O Macaron V1 Tall é gratuito na Novita AI?
A página do modelo verificada em 29 de julho de 2026 listava US$ 0 por milhão de tokens de entrada e US$ 0 por milhão de tokens de saída, e rotulava o modelo como gratuito por tempo limitado. Verifique a página ao vivo novamente antes de orçar o uso em produção.
Qual janela de contexto o Macaron V1 Tall suporta?
A Novita AI atualmente lista uma janela de contexto de 262.144 tokens e 32.768 tokens máximos de saída para o Macaron V1 Tall.
O Macaron V1 Tall suporta chamada de função?
Sim. O conjunto de recursos hospedados atual na página do modelo da Novita inclui chamada de função e raciocínio.
O Macaron V1 Tall é multimodal na Novita AI?
Não, na listagem hospedada atual. A Novita atualmente mostra entrada de texto e saída de texto para este modelo.
Artigos recomendados
- Macaron V1 Venti na Novita AI: 748B Mixture-of-LoRA Flagship para codificação, agentes e GenUI
- Guia de início rápido do Macaron V1 Venti na Novita AI: 1M de contexto, endpoint e exemplos
- Guia de início rápido do Macaron V1 Tall para codificação, agentes e GenUI
Fontes verificadas em 29 de julho de 2026: Página do modelo Macaron V1 Tall, Referência da API de conclusões de chat da Novita, Referência da API de listar modelos da Novita
