Macaron V1 Tall 已在 Novita AI 上线,作为 Macaron 系列中更小、更易评估的入门模型。截至 2026 年 7 月 29 日,Novita 将其列为模型 ID 为 mindai/macaron-v1-tall,拥有 262,144 个 token 的上下文窗口、32,768 个最大输出 token、推理能力、函数调用功能,以及百万输入和输出 token 均为 0 美元的限时免费价格。实际要点是:当你希望体验该系列在聊天、Agent、编程和 GenUI 方面的定位,但又不想直接跳到更大的 Venti 模型时,Tall 是 Macaron 变体中应首先测试的版本。
关键要点
- Macaron V1 Tall 已在 Novita AI 上线,模型 ID 为
mindai/macaron-v1-tall。 - Novita 将其描述为高效的 Macaron V1 模型,基于 Qwen3.6-35B-A3B 构建,并配备了四个专用 LoRA 适配器。
- Novita 当前列表显示其上下文窗口为 262,144 个 token,最大输出 token 为 32,768 个。
- 当前托管功能包括通过聊天补全工作流实现的推理和函数调用。
- 2026 年 7 月 29 日的定价显示为限时免费,输入和输出 token 价格均为 0 美元。
Macaron V1 Tall 是什么?
Macaron V1 Tall 是 Macaron V1 系列中的轻量级模型。在 Novita AI 上,官方描述称其为该系列的高效变体,并说明它基于 Qwen3.6-35B-A3B 构建,配备了四个用于聊天、Agent、编程和 GenUI 工作的专用 LoRA 适配器。
这个描述之所以重要,是因为 Tall 的定位并非通用聊天机器人。该系列的核心在于路由专业化:基础模型处理广泛推理,而 LoRA 适配器则将系统偏向特定的开发者工作负载。在实践中,这使得 Tall 更容易与实际任务(如使用工具的助手、理解仓库的编程帮助以及结构化 UI 生成)进行对比,而非仅限于自由形式的对话。
更重要的区别在于操作层面。如果 Venti 是希望使用最大上下文密集型设置的团队的旗舰级 Macaron 选项,那么 Tall 则是可以优先评估的低风险模型。它保留了相同的系列定位,但部署规模更小,并提供托管式无服务器 API。
在 Novita AI 上访问 Macaron V1 Tall API
Novita AI 目前通过其托管模型库和兼容 OpenAI 的 LLM API 提供 Macaron V1 Tall。模型页面将 mindai/macaron-v1-tall 列为确切模型 ID,而 API 文档则指引开发者使用标准的聊天补全路由:https://api.novita.ai/openai/v1/chat/completions。
当前的托管列表还显示了两类端点:chat/completions 和 anthropic。对于大多数现有的 Novita 集成来说,最简单的起点仍然是兼容 OpenAI 的聊天补全路径,因为它与 LLM 目录中的其他模型以及已发布的 API 参考保持一致。
由于这是一篇发布和事实概览文章,有用的问题不是“如何编写第一个请求?”,而是“该模型是否真正可用,以及 Novita 今天发布了什么合约?”在这一点上,当前的答案是明确的:Tall 作为一款无服务器文本模型可用,托管功能集中包含推理和函数调用。
Macaron V1 Tall 规格与定价摘要
下表反映了 2026 年 7 月 29 日 检查的 Novita AI 实时模型页面和 LLM API 文档。
| 字段 | 详情 |
|---|---|
| 显示名称 | Macaron V1 Tall |
| 模型 ID | mindai/macaron-v1-tall |
| 基础 URL | https://api.novita.ai/openai |
| 端点系列 | chat/completions;模型页面也列出了 anthropic |
| 上下文 / 限制 | 262,144 个上下文 token;32,768 个最大输出 token |
| 定价 | 每百万 token 输入和输出均为 0 美元;标注为限时免费 |
| 最佳适用场景 | Agent 工作流、编程支持、聊天系统以及需要长上下文但不想从最大模型层级开始的 GenUI 实验 |
这些细节已于 2026 年 7 月 29 日根据 Novita AI 的实时模型页面和 LLM API 文档进行了核实。
当前模型页面中的其他详细信息:
| 规格 | 当前值 |
|---|---|
| 基础模型 | Qwen3.6-35B-A3B |
| 架构说明 | Macaron V1 配备四个专用 LoRA 适配器 |
| 输入模态 | 文本 |
| 输出模态 | 文本 |
| 托管功能 | 无服务器、推理、函数调用 |
| 配额快照 | 根据账户层级,RPM 从 30 RPM 到 6000 RPM 不等 |
| 状态标签 | 新品;限时免费 |
免费价格很有吸引力,但应将其视为临时的发布条件,而非长期的预算假设。如果你正在规划生产环境部署,请在最终成本估算或合同承诺之前重新检查实时模型页面。
Macaron V1 Tall 基准测试与性能信号
Novita 当前的列表并未发布 Macaron V1 Tall 的基准测试包、延迟保证或外部排行榜摘要。这意味着本文不应在没有独立证据的情况下声称 Tall 在编程、工具使用或 Agent 质量方面优于其他模型。
更稳妥的发布定位应更为狭窄。Novita 将 Tall 定位为适用于聊天、Agent、编程和 GenUI 的高效 Macaron 系列模型,并且托管页面确认了相关的 API 功能和定价。这足以证明评估的必要性,但不足以声称其处于类别领先地位。
如果你正在将 Tall 与其他托管模型进行比较,请使用你自己的工作负载级检查:任务完成度、工具调用有效性、延迟、token 消耗以及修正工作量。这些测量结果将比参数数量或系列描述更能说明问题。
面向开发者的核心能力
长上下文聊天与助手流程
262K 的上下文窗口足够大,可以满足需要保留大量背景信息的助手工作流:产品需求、内部标准操作流程、之前的对话状态、支持笔记或长期规划轨迹。当提示词经常需要超过几个文档或指令时,这使 Tall 比短上下文聊天模型具有明显优势。
使用工具的 Agent 系统
Novita 当前在托管功能集中列出了函数调用和推理。这使得 Tall 成为 Agent 的合理候选,这些 Agent 需要检查状态、选择工具、生成参数并在工具结果返回后继续执行。该模型仍然不能替代系统设计:你的应用程序应负责工具权限、重试、验证和回滚。
部署规模较小的编程支持
Macaron V1 Tall 被描述为该系列中更高效的成员,这正是尝试将其用于仓库分类、补丁规划、代码审查摘要或 IDE 端开发者辅助的充分理由。并非每个编程任务都需要最大的可用模型。当你需要长上下文和专业化,而又不想默认选择最昂贵或最慢的选项时,较小的路由模型可能是更好的选择。
GenUI 实验
Novita 的描述明确将代码原生的生成式 UI 能力纳入系列定位。这并不意味着你应该直接将任意的模型输出渲染到生产环境中。这确实意味着 Tall 是原型化界面生成工作流的相关候选,在这些工作流中,模型将需求映射到屏幕、组件树或结构化的 UI 计划中。
何时使用 Macaron V1 Tall
当你的工作负载同时受益于以下三个因素时,请使用 Macaron V1 Tall:长上下文、面向开发者的专业化以及比旗舰模型更低的评估门槛。
合适的候选场景包括:
- 需要保留大量策略或产品上下文的内部聊天助手。
- 能够跨多个文件、问题注释和先前的审查评论进行推理的编程助手。
- 函数调用比多模态输入更重要的工具使用 Agent。
- 将详细需求转化为界面结构或实现计划的 GenUI 原型。
- 希望在当前托管价格仍为限时免费期间测试 Macaron 系列的团队。
如果你当前的模型正在丢失上下文或在多步骤工作流中失败,但你尚未准备好迁移到更大的模型类别,Tall 也是一个实用的第一站。
何时不应使用 Macaron V1 Tall
不要仅仅因为 Tall 是新的或免费的,就默认将其用于所有文本工作负载。
在以下情况下,它不太适合:
- 你的工作负载是短小、重复的,并且易于通过更小、更便宜的模型进行路由。
- 你需要在托管端点上处理图像、音频或视频输入,因为当前列表仅支持文本输入和输出。
- 你的生产合约依赖于 Tall 未提供的已发布基准测试声明。
- 你需要最大的 Macaron 系列选项,因为任务以非常广泛的上下文和旗舰级实验为主。
- 你无法承受发布促销活动发生变化的风险,因为当前价格明确标注为限时免费。
如果实际需求是在极高吞吐量下进行可预测的低延迟分类或轻量级提取,那么更简单的模型可能仍然是更清晰的生产选择。
Macaron V1 Tall 如何融入你的 API 工作流
Macaron V1 Tall 遵循与其他 Novita 托管 LLM 相同的高层工作流:
- 确认你的账户有权访问该模型。
- 使用兼容 OpenAI 的基础 URL:
https://api.novita.ai/openai。 - 将模型 ID 设置为
mindai/macaron-v1-tall。 - 通过聊天补全发送请求,如果你的应用程序使用工具调用,则添加函数定义。
该合约足以满足集成规划、路由决策和架构审查的需要。本文有意在此止步。它不包含完整的 SDK 代码片段、请求负载指南或故障排除内容,因为这些内容应属于专门的快速入门指南,而非发布/事实概览文章。
结论
Macaron V1 Tall 是 Macaron 系列中值得优先尝试的模型,当你想要一个托管的长上下文选项用于聊天、使用工具的 Agent、编程支持或 GenUI 实验,而又不想从最大的模型层级开始时。截至 2026 年 7 月 29 日,Novita AI 将其列为现已可用、无服务器、支持推理、支持函数调用且限时免费。
正确的下一步是在真实任务上测试它,而不仅仅是 Hello World 提示。利用当前的免费窗口,将 Tall 与你已经信任的模型进行比较,尤其是在多步骤编程和 Agent 工作流方面。如果它在保持上下文方面更出色、工具调用更可靠并且延迟可接受,那么它就有资格进入生产环境评估。
在 Novita AI 上试用 Macaron V1 Tall
常见问题
Macaron V1 Tall 在 Novita AI 上可用吗?
是的。截至 2026 年 7 月 29 日,Novita AI 在其托管模型库中列出了 Macaron V1 Tall,模型 ID 为 mindai/macaron-v1-tall。
Macaron V1 Tall 的模型 ID 是什么?
当前的 Novita AI 模型 ID 是 mindai/macaron-v1-tall。
Macaron V1 Tall 在 Novita AI 上是免费的吗?
2026 年 7 月 29 日检查的模型页面显示,每百万输入 token 和每百万输出 token 的价格均为 0 美元,并将该模型标注为限时免费。在制定生产使用预算之前,请重新检查实时页面。
Macaron V1 Tall 支持多大的上下文窗口?
Novita AI 当前为 Macaron V1 Tall 列出了 262,144 个 token 的上下文窗口和 32,768 个最大输出 token。
Macaron V1 Tall 支持函数调用吗?
是的。Novita 模型页面当前列出的托管功能集包括函数调用和推理。
Macaron V1 Tall 在 Novita AI 上是多模态的吗?
在当前托管列表中不是。Novita 目前显示该模型仅支持文本输入和文本输出。
推荐阅读
- Macaron V1 Venti 在 Novita AI 上线:用于编程、Agent 和 GenUI 的 748B Mixture-of-LoRA 旗舰模型
- Ling-3.0-flash 在 Novita AI 上线:用于 Agent 推理的免费 API
- Qwen3.6-27B 在 Novita AI 上线:用于 Agent 编程的 262K 上下文
信息来源(2026 年 7 月 29 日核实):Macaron V1 Tall 模型页面、Novita 聊天补全 API 参考、Novita 列出模型 API 参考
