大模型
-
4-bit 量化并非“免费午餐”:Agent 多步执行暴露隐性成本
4-bit量化在常规基准中分数稳定,但在Agent多步工具调用中,失败率最高可升至2.5倍。真正的问题不在总分,而在每一步的可靠性。
-
OpenAI 调整美国政府合作模式:1 美元试点结束,转向五折按量计费
OpenAI 结束美国政府每年 1 美元的 AI 模型试点,转向五折按用量计费。新协议将于 10 月 1 日生效,并扩展至州、地方和部落政府。
-
NASA与IBM开源月球基础模型:让月表冰区和陨石坑识别更高效
NASA 与 IBM 发布开源月球基础大模型,可识别月表冰区与陨石坑,并同步开放配准数据集,为月球遥感与基础模型应用提供新的科研工具。
-
OpenAI给GPT-6 Astra上锁:首个触及Critical网络安全阈值的模型,为何只交给少数防御者?
GPT-6 Astra成为OpenAI首个触及Critical网络安全能力阈值的模型。它能在较少人工指导下自主发现漏洞并生成exploit,但OpenAI并未全面开放,而是通过环境隔离、权重保护和分层访问,把能力优先交给少数安全防御组织。
-
人均AI支出突然下滑:大模型降价潮正改写企业账单
Ramp 数据显示,8 月企业 AI 采用率仅小幅上升,但头部企业人均 AI 支出下降近 10%。token 降价和便宜模型替代,正在改变大模型厂商的收入预期。
-
DeepSeek 推出开源 Agent 运行时 Harness:以插件化架构补齐工程化短板
DeepSeek 开源 Agent 运行时框架 Harness,以“一切皆插件”的方式整合模型调用、工具执行、会话、权限和沙箱能力,试图解决 Agent 从本地原型走向生产部署的问题。
-
DeepSeek V4.1 Flash 即将上线:过渡期请求自动切换,Flash 价格下调 60%
DeepSeek 开放平台宣布将于 2026 年 9 月 10 日前后发布 V4.1 Flash,并在过渡期将 V4 Pro 请求路由至新模型。同日中午起,Flash 系列降价约 60%,缓存命中价格降至 0.04 元。
-
OpenAI 称智能体攻克纳维-斯托克斯难题,但荣誉归属争议让数学界不安
OpenAI 宣布智能体解决纳维-斯托克斯千禧年难题,但围绕研究来源、署名和可验证性的争议,让这次成果更像一场关于 AI 科研规则的提前考试。
-
从峰值算力到每美元Token:TPU推理外化开始碰到英伟达生态的软肋
SemiAnalysis的InferenceX推理基准显示,峰值算力并非决定推理成本的唯一因素。Google TPU外化后,Anthropic通过深度定制内核,在TPU上获得了高于Blackwell的模型FLOP利用率,这让市场开始重新评估CUDA生态的护城河。
-
Gemini 3.8 Flash 官方 API 价格不变,但 Agent 任务账单可能更高
Gemini 3.8 Flash 的官方 API 单价没有变化,但在 Agent 和复杂任务场景下,模型会生成更多思考与工具调用,导致真实任务成本上升。开发者需要把“每 token 价格”和“每任务成本”分开计算。