返回博客列表

Qwen3.8-Flash API 价格与接入指南 2026:1M 多模态

Qwen3.8-FlashQwen API千问 FlashCoding Agent1M 上下文

2026 年 8 月 27 日,Qwen3.8-Flash-Next 开源后的第二天,我们为本站刚开放的 qwen3.8-flash 路由整理接入资料。第一处最容易踩的坑就在名字里:开源权重与生产 API 不是同一个 Model ID。

**Qwen3.8-Flash-Next 是用于预览 Qwen4 架构的开源多模态 MoE;qwen3.8-flash 是阿里云百炼与 QwenCloud 提供的生产 API 模型,默认支持 1M 上下文、图片/文本/视频输入、Function Calling 和结构化输出。**本站已开放 qwen3.8-flash 路由;本站倍率和实际扣费以实时价格页与账单为准。

本文将开源模型架构、阿里云官方 API 能力、官方直连价格和本站路由分开说明。Qwen 团队公布的基准不是本站独立复测,阿里云区域价格也不能直接换算为本站倍率。

Qwen3.8-Flash 核心数据

项目 已核实信息
官方发布时间 2026 年 8 月 26 日
本站 / 百炼 API ID qwen3.8-flash
开源权重 ID Qwen/Qwen3.8-Flash-Next
参数结构 125B 主模型 + 51B N-gram Embedding,6B 激活参数
上下文 生产 API 默认 1M;开源版原生 262,144,可通过 YaRN 扩展到 1M
输入 / 输出模态 图片、文本、视频输入;文本输出
API 能力 Function Calling、结构化输出、Web Search、上下文缓存
公开定位 Coding Agent、办公自动化、视觉理解、高并发工作流
本站倍率 不在文章中写死,以实时价格页与实际账单为准

资料最后核验于 2026 年 8 月 27 日。生产上线前请再次检查模型列表、百炼区域文档和实际响应中的用量字段。

Qwen3.8-Flash 与 Qwen3.8-Flash-Next 是什么关系?

Qwen 团队先公开 Qwen3.8-Flash-Next 权重,让社区提前研究 Qwen4 将采用的架构;生产版本则以 Qwen3.8-Flash 名称提供服务。两者共享技术方向,但调用方式不同。

名称 用途 准确 ID 上下文
Qwen3.8-Flash-Next 自托管、架构研究、开源评估 Qwen/Qwen3.8-Flash-Next 原生 262,144,YaRN 可扩至 1M
Qwen3.8-Flash 托管生产 API qwen3.8-flash 默认 1M
Qwen3.8-Max 高能力旗舰托管模型 qwen3.8-max 1M

如果通过本站或阿里云兼容接口调用,不要把 Hugging Face 仓库名填进 model 参数。反过来,自托管时也不能只写托管 API ID 并期待框架自动下载权重。

Qwen3.8-Flash-Next 的新架构是什么?

Qwen3.8-Flash-Next 以 Gated DeltaNet(GDN)和 Qwen Sparse Attention(QSA)组成混合注意力。GDN 将历史压缩进固定状态,QSA 用轻量索引器按微块选择重要上下文,降低长序列中的注意力计算与 KV Cache 访问成本。

它还加入 Gated Residual(GR),把残差流扩展为四个分支并用动态门控制读写;N-gram Embedding 用局部上下文查表,在很少增加每 Token 矩阵计算的情况下扩展模型容量。训练使用改进后的 Muon Optimizer,并重新拟合 Scaling Law。

官方公布的规模是 125B 主模型、额外 51B N-gram Embedding、每 Token 激活 6B 参数。Qwen 团队称,其训练成本约为 Qwen3.7-Plus 的九分之一;这是厂商的训练对比,不是本站推理成本实测。

1M 上下文与多模态能力有哪些边界?

阿里云 Qwen3.8-Flash 模型页给出的上下文长度为 1,000,000 Tokens:普通模式最大输入 991,808、思考模式最大输入 983,616,最大输出 131,072,最大思考链长度 262,144。图片、文本和视频可以作为输入,输出为文本。

1M 不等于每次都应该提交接近 1M Tokens。系统提示词、工具 Schema、图片/视频编码、历史消息和输出预留都会占用窗口;超长请求还会增加延迟和费用。生产系统应先做 32K、128K、256K 和长上下文分档测试。

官方能力表还列出 Function Calling、结构化输出、Web Search 和上下文缓存。Batch 在北京区域支持、在新加坡区域标为不支持——区域差异必须在部署前单独核对。

Qwen 官方编程与 Agent 基准怎么看?

Qwen 团队发布了 Qwen3.8-Flash-Next 与 Qwen3.8-27B、Qwen3.7-Plus、DeepSeek-V4-Flash-0731 等模型的对比。下面摘录四项:

厂商发布评测 Qwen3.7-Plus Qwen3.8-Flash-Next 任务类型
DeepSWE 1.1 16.5 58.7 Agentic coding
SWE-bench Multilingual 75.8 81.0 多语言软件工程
CoWorkBench 65.1 73.9 长周期办公任务
Toolathlon Verified 50.6 73.5 真实工具调用

**这些分数来自 Qwen 官方发布,不是本站独立复测。**模型版本、推理预算、工具环境和评分器会显著影响结果。尤其不能把开源 Flash-Next 的分数直接当作托管 API 在你的客户端、地区与配额下的端到端表现。

Qwen3.8-Flash 官方价格与本站价格如何区分?

Qwen 发布稿在首发时写明,QwenCloud 生产版本的参考价格为每百万输入 Tokens 0.16 美元、每百万输出 Tokens 0.47 美元;同一发布稿当时还注明 API 即将开放。随后阿里云百炼模型页已列出 qwen3.8-flash 调用 ID,并按北京、新加坡等区域提供不同的 CNY 价格与能力表。

这两套数字都是官方直连口径,而且可能随区域、缓存、Batch 和活动变化。**本站不把官方美元价或百炼区域价直接换算成网关倍率。**本站 qwen3.8-flash 的倍率、缓存和实际扣费,以实时价格页及请求账单为准。

新用户可从API 购买页小额开通;已有 Key 可在充值页补充余额。先固定 Prompt 与上下文长度,记录输入、输出和缓存 Tokens,再比较真实成本。

如何调用 Qwen3.8-Flash API

本站提供 OpenAI-compatible Chat Completions 接口,准确模型 ID 是 qwen3.8-flash

curl https://api.llm-token.cn/v1/chat/completions \
  -H "Authorization: Bearer YOUR_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "qwen3.8-flash",
    "messages": [
      {
        "role": "user",
        "content": "Summarize the failing tests, then propose the smallest safe patch."
      }
    ]
  }'

Qwen3.8-Flash 支持思考与非思考模式,但不同兼容层对 enable_thinkingreasoning_effort、工具流式参数和内置工具的映射可能不同。先从最小文本请求开始,再逐项增加思考、图片、视频、工具与长上下文,不要一次把所有扩展参数都带上。

Qwen3.8-Flash 适合哪些任务?

  • 高并发 Coding Agent、代码审查与测试失败分析
  • 跨语言代码仓库和 SWE-bench 类软件工程任务
  • 邮件、表格、文档与会议材料的长周期办公自动化
  • 图片、图表和长视频理解
  • Function Calling、结构化输出与 Web Search 工作流
  • 需要 1M 上下文但对成本敏感的长文档与大型代码库
  • 自托管 Qwen4 预览架构的研究与推理框架适配

复杂架构决策、关键安全审计或高价值一次性任务仍应与 Qwen3.8-Max、GLM-5.3、Claude 或其他强模型对照。Flash 的价值是性价比与吞吐,不是用一个型号替代所有评估。

Qwen3.8-Flash 与 Qwen3.8-Max 怎么选?

如果任务量大、需要多模态、工具调用和 1M 上下文,优先从 Qwen3.8-Flash 做小流量验证;如果任务更看重复杂推理上限、容错与关键输出质量,再将相同测试切到 Qwen3.8-Max。

不要只比较一条答案。至少统计任务通过率、首 Token 延迟、总时长、工具调用成功率、输入/输出 Tokens、缓存命中与返工次数。模型单价低但需要更多轮重试时,整体成本未必更低。

生产评估清单

  1. 托管 API 使用 qwen3.8-flash,自托管使用 Qwen/Qwen3.8-Flash-Next
  2. 固定仓库、Prompt、工具版本、超时和验收命令后再比较模型。
  3. 分别验证思考与非思考模式,记录响应格式差异。
  4. 分别测试文本、图片、视频、Function Calling 与结构化输出。
  5. 按 32K、128K、256K 和长上下文分档测延迟与账单。
  6. 核验所选区域是否支持 Batch、缓存和所需内置工具。
  7. 给工具次数、最大输出、总预算和外部操作设置上限。
  8. 保留容量不足、限流或协议不兼容时的备用路由。

关键结论

  • qwen3.8-flash 是本站与阿里云托管 API 的准确模型 ID。
  • Qwen/Qwen3.8-Flash-Next 是开源权重名,不应填入托管 API 的 model 参数。
  • 托管版本默认 1M 上下文,支持图片、文本、视频输入以及 Function Calling。
  • 125B 主模型 + 51B N-gram Embedding,每 Token 激活 6B 参数。
  • 官方基准和官方区域价格必须与本站路由表现、倍率和账单分开。
  • 生产选型要同时看通过率、延迟、用量、工具成功率与返工成本。

常见问题

Qwen3.8-Flash 正式上线了吗?

是。Qwen 团队于 2026 年 8 月 26 日发布 Flash-Next 权重,阿里云官方模型页已列出生产调用 ID qwen3.8-flash;本站也已开放同名路由。

Qwen3.8-Flash 的上下文是多少?

托管生产 API 默认支持 1M 上下文。开源 Flash-Next 原生支持 262,144 Tokens,可通过 YaRN 扩展到 1,000,000 Tokens。

Qwen3.8-Flash 支持图片和视频吗?

支持。阿里云官方能力表列出图片、文本和视频输入,输出为文本,同时支持 Function Calling 与结构化输出。

Qwen3.8-Flash-Next 与 Qwen3.8-Flash 是同一个 ID 吗?

不是。前者是开源仓库与自托管权重名,后者是生产 API 的 model 参数值。

Qwen3.8-Flash 支持思考模式吗?

支持思考和非思考模式。不同兼容接口对扩展参数的映射可能不同,应先验证最小请求,再增加思考配置。

Qwen3.8-Flash 可以用于 Claude Code 或 Codex 吗?

阿里云官方将其列为兼容 OpenAI 与 Anthropic 协议,并点名 Claude Code 与 Codex。实际接入仍要测试工具调用、流式输出、超时和用量返回。

Qwen3.8-Flash 官方价格是多少?

QwenCloud 首发稿给出每百万输入 0.16 美元、输出 0.47 美元;阿里云百炼按区域另有 CNY 价格。本站倍率与账单是独立口径,请查看实时价格页。

在哪里购买或充值 Qwen3.8-Flash API?

新用户可前往API 购买页,已有 Key 可使用充值页

主要来源