MoE
-
vLLM 教程拆解:MHA、GQA、MLA、RoPE 与 MoE 如何决定推理性能
vLLM 教程系统梳理了 MHA、GQA、MLA、RoPE、ALiBi 和 MoE 等模型架构组件,解释它们如何影响 KV cache 大小、attention 内核实现与推理性能。
-
DeepSeek 将缓存价格压到 0.02 元:一次面向推理成本的结构性调整
DeepSeek 新模型 V4.1 Flash 将 KV Cache 内存占用压缩到前一代的 1/4,并将缓存命中价格降至 0.02 元。这次调价背后,是推理成本结构的变化。
-
Meta 新模型把第一梯队 AI 推理成本压到八分之一:Agent 应用迎来成本拐点
Meta Muse Spark 1.3 以 62 分进入 Artificial Analysis 第一梯队,同时把输入输出成本大幅压低。对 Agent 应用来说,前沿模型的竞争开始从“谁更聪明”转向“谁更值得调用”。
-
智谱开源320B原生多模态模型GLM-5.3-Flash,匿名测试曾登顶调用榜
智谱上线并开源GLM-5.3-Flash:320B总参数、18B激活参数,匿名模型Ox Alpha曾创下OpenCode与OpenRouter调用量新高,限时价格为GLM-5.3的1/20。
-
Meta 提出新的可扩展记忆层,可提高知识水平并减少幻觉
随着企业继续在各种应用中采用大型语言模型 (LLM),他们面临的关键挑战之一是提高模型的事实知识并减少幻觉。在一篇新论文中,Meta AI的研究人员提出了“可扩展的内存层”,这可能…
-
混元大和 MoE 革命:AI 模型如何变得更智能、更快速
人工智能 (AI)正在以惊人的速度发展。十年前看似未来的概念现在已成为我们日常生活的一部分。然而,我们现在遇到的人工智能才刚刚开始。由于幕后的发展,尚未见证根本性的转变,大量模型能…
-
可区分自适应合并正在加速企业的 SLM
模型合并是一个基本的人工智能过程,使组织能够重复使用和组合现有的训练模型来实现特定目标。 如今,企业可以使用各种方法进行模型合并,但许多方法都很复杂。一种称为可微分自适应合并(DA…
-
AI2 的新模型旨在实现开放、强大且具有成本效益
艾伦人工智能研究所(AI2)与Contextual AI合作发布了一个新的开源模型,希望能够满足对性能强大且具有成本效益的大型语言模型(LLM)的需求。 新模型称为 OLMoE,…