资讯🔥8.0

DeepSeek V4.1重回国产一哥!全新架构非对称Transformer,Engram用上了

华尔街见闻·2026/9/10 10:49:16🔗 原文

📋总体概括

DeepSeek发布V4.1 Flash,跑分重回国产模型第一。模型为552B参数MoE,首次采用全新Causal-Encoder-Decoder非对称架构,输入激活仅8B、输出激活16B,推理成本显著低于同尺寸模型。此次完全重新训练,使用新数据、更大规模强化学习后训练,并深度结合新版DeepSeek Harness v0.1.5。它也是DeepSeek首个原生支持多模态视觉理解的正式版模型,此前的V4 Flash Vision Exp实验版能力被整合进来。9月14日起所有V4 Pro请求将被重路由至V4.1 Flash,在V4.1 Pro上线前,DeepSeek API将只提供这一个模型。F

关键信息

  • DeepSeek V4.1 Flash上线,跑分重回国产模型第一,并超越自家V4.1 Pro(知识容量除外)
  • 模型为552B参数MoE,采用全新Causal-Encoder-Decoder非对称架构,输入激活8B、输出激活16B,成本显著低于已知同尺寸模型
  • 完全重新预训练,使用新数据、更大规模强化学习后训练,结合DeepSeek Harness v0.1.5训练
  • 首个原生支持多模态视觉理解的正式版模型,整合此前实验版V4 Flash Vision Exp能力
  • 9月14日起V4 Pro请求全部重路由至V4.1 Flash,V4.1 Pro上线前API仅提供这一个模型

🔥犀利点评

非对称架构才是这条新闻真正的含金量所在。输入8B、输出16B的激活设计,直接把成本逻辑重写了——Flash赢Pro不再是玄学,而是架构层面的降维。敢把全部API流量重路由到单一新模型,DeepSeek对新架构的信心可见一斑。但代价也明显:V4.1 Pro上线前用户别无选择,Flash的跑分光环需要经受真实负载的长期检验,别让单点押注变成单点风险。

本文由本站自动聚合,以下为原始来源:前往 华尔街见闻 阅读全文