2026年8月28日 AI 行业速览:开源双响、推理芯片落地、模型降价
2026年8月28日 AI 行业速览:开源双响、推理芯片落地、模型降价
8月最后一周,AI 行业密集释放信号。两天之内,阿里与智谱先后开源重磅模型,OpenAI 公布了自研推理芯片的首份数据,头部模型价格继续下探。以下是 8 月 27 日至 28 日值得关注的动态。
一、开源:阿里与智谱同日放招
阿里开源 Qwen3.8-Flash。 8 月 26 日晚,阿里发布并开源千问最新模型 Qwen3.8-Flash,一款多模态混合专家(MoE)模型,125B 总参数、仅激活 6B。据公开信息,其训练成本较上一代 Qwen3.7-Plus 降低近 90%,输入价格每百万 Token 1 元、输出 3 元。次日,阿里还放出基于下一代 Qwen4 架构的 Qwen3.8-Flash-Next 开源权重,被视为 Qwen4 系列的雏形。阿里"千问办公"国际版 QwenWork 也在 8 月 27 日开启公测,海外用户可体验网页版与 PC 客户端。
智谱认领"牛来",开源 GLM-5.3-Flash。 8 月 26 日,智谱官宣上线并开源 GLM-5.3-Flash(320B-A18B),这是 GLM-5 系列首个原生多模态模型。此前它以匿名模型 Ox Alpha(社区称"牛来")的身份在海外平台测试,一度登顶调用榜。值得注意的是,其线上流量由国产芯片集群承载——国产算力开始支撑起国际级开源模型的访问量。
| 模型 | 架构 | 特点 |
|---|---|---|
| Qwen3.8-Flash | MoE,125B/激活6B | 多模态,训练成本降约 90% |
| Qwen3.8-Flash-Next | 下一代架构 | Qwen4 雏形,已开源权重 |
| GLM-5.3-Flash | 320B-A18B | GLM-5 首个原生多模态,国产芯片算力 |
二、芯片与算力:推理芯片进入数据阶段
8 月 27 日,OpenAI 在 Hot Chips 大会公布与博通联合打造的推理芯片 Jalapeño 首份数据:三款公开模型上每千瓦吞吐量达英伟达系统的 1.5 至 1.9 倍,从设计到流片仅用 9 个月,计划 2026 年底小规模部署。同一天,AWS 与英伟达宣布扩大战略合作,AWS 将在 2027 至 2028 年新增部署 200 万颗 GPU,用于智能体 AI 与物理 AI。
三、价格与市场:头部模型继续降价
8 月 24 日,OpenAI 宣布 GPT-5.6 Sol 价格下调逾 20%,输出价格降至每百万 Token 20 美元;谷歌发布 Gemini 3.7 Flash 时以前代一半价格首发。行业分析认为,中国厂商的开源与定价策略对海外头部模型形成压力。另一边,MiniMax 在 8 月 26 日披露,8 月年度经常性收入(ARR)已超 8 亿美元,7 月 Token 消耗量达到 1 月的 20 倍。
四、一句话动态
- Perplexity 推出 Portable Computer,本地优先的智能体应用,数据留在本地设备运行。
- xAI 的 Grok Bot 进入早期测试,提供可自主完成多步任务的持久智能体。
- OpenAI 报告 Codex 活跃用户达 2000 万。
一个值得注意的趋势:AI 行业的验证指标,正从参数与榜单,逐渐转向 Token 消耗、商业收入与云厂商资本开支——"能不能被用起来"正在取代"分数有多高"。
以上信息为 8 月 27-28 日公开报道口径,数据以官方为准。