2026年8月28日 AI 行业速览:开源双响、推理芯片落地、模型降价

2026年8月28日 AI 行业速览:开源双响、推理芯片落地、模型降价

8月最后一周,AI 行业密集释放信号。两天之内,阿里与智谱先后开源重磅模型,OpenAI 公布了自研推理芯片的首份数据,头部模型价格继续下探。以下是 8 月 27 日至 28 日值得关注的动态。

一、开源:阿里与智谱同日放招

阿里开源 Qwen3.8-Flash。 8 月 26 日晚,阿里发布并开源千问最新模型 Qwen3.8-Flash,一款多模态混合专家(MoE)模型,125B 总参数、仅激活 6B。据公开信息,其训练成本较上一代 Qwen3.7-Plus 降低近 90%,输入价格每百万 Token 1 元、输出 3 元。次日,阿里还放出基于下一代 Qwen4 架构的 Qwen3.8-Flash-Next 开源权重,被视为 Qwen4 系列的雏形。阿里"千问办公"国际版 QwenWork 也在 8 月 27 日开启公测,海外用户可体验网页版与 PC 客户端。

智谱认领"牛来",开源 GLM-5.3-Flash。 8 月 26 日,智谱官宣上线并开源 GLM-5.3-Flash(320B-A18B),这是 GLM-5 系列首个原生多模态模型。此前它以匿名模型 Ox Alpha(社区称"牛来")的身份在海外平台测试,一度登顶调用榜。值得注意的是,其线上流量由国产芯片集群承载——国产算力开始支撑起国际级开源模型的访问量。

模型 架构 特点
Qwen3.8-Flash MoE,125B/激活6B 多模态,训练成本降约 90%
Qwen3.8-Flash-Next 下一代架构 Qwen4 雏形,已开源权重
GLM-5.3-Flash 320B-A18B GLM-5 首个原生多模态,国产芯片算力

二、芯片与算力:推理芯片进入数据阶段

8 月 27 日,OpenAI 在 Hot Chips 大会公布与博通联合打造的推理芯片 Jalapeño 首份数据:三款公开模型上每千瓦吞吐量达英伟达系统的 1.5 至 1.9 倍,从设计到流片仅用 9 个月,计划 2026 年底小规模部署。同一天,AWS 与英伟达宣布扩大战略合作,AWS 将在 2027 至 2028 年新增部署 200 万颗 GPU,用于智能体 AI 与物理 AI。

三、价格与市场:头部模型继续降价

8 月 24 日,OpenAI 宣布 GPT-5.6 Sol 价格下调逾 20%,输出价格降至每百万 Token 20 美元;谷歌发布 Gemini 3.7 Flash 时以前代一半价格首发。行业分析认为,中国厂商的开源与定价策略对海外头部模型形成压力。另一边,MiniMax 在 8 月 26 日披露,8 月年度经常性收入(ARR)已超 8 亿美元,7 月 Token 消耗量达到 1 月的 20 倍。

四、一句话动态

  • Perplexity 推出 Portable Computer,本地优先的智能体应用,数据留在本地设备运行。
  • xAI 的 Grok Bot 进入早期测试,提供可自主完成多步任务的持久智能体。
  • OpenAI 报告 Codex 活跃用户达 2000 万。

一个值得注意的趋势:AI 行业的验证指标,正从参数与榜单,逐渐转向 Token 消耗、商业收入与云厂商资本开支——"能不能被用起来"正在取代"分数有多高"。

以上信息为 8 月 27-28 日公开报道口径,数据以官方为准。

← 返回博客列表