Agent
-
WhatsApp Business 接入进入 Agent 时代:Meta 用 MCP 让 AI 替开发者完成配置
Meta 推出 WhatsApp Business Tools MCP Server,让 Claude、Cursor、Codex、ChatGPT 等 AI Agent 可以通过对话完成 WhatsApp Business 的账号创建、号码验证、Cloud API 注册、模板生成和故障排查。这显示出第三方平台配置正在从人工后台操作,转向 Agent 可直接调用的自动化流程。
-
AI 编辑 Agent 总出错?一次真实复盘:问题不在模型,而在系统设定
当 AI Agent 在内容发布中频繁出错,真正的问题未必是模型理解偏差,而可能是旧的角色定义被带入了新的读者场景。
-
长会话 Agent 如何避免上下文失控:DeepSeek Harness 的压缩与目标管理方案
DeepSeek Harness 通过上下文压缩与目标管理两套机制,解决长会话 Agent 中 token 膨胀、工具输出过载和目标漂移问题,为长时任务提供工程化思路。
-
当 Agent Skill 多到管不过来,开发者开始用“包管理”思路重构工具链
一位开发者为管理上百个 Agent Skill,自建了一套类似包管理器的工具链。这一实践显示出,Agent 能力管理正在从零散配置走向工程化依赖治理。
-
4-bit 量化并非“免费午餐”:Agent 多步执行暴露隐性成本
4-bit量化在常规基准中分数稳定,但在Agent多步工具调用中,失败率最高可升至2.5倍。真正的问题不在总分,而在每一步的可靠性。
-
一次误触发的提醒:流式 Agent 的 Tool-Call 授权不能只靠一个 Toast
一名开发者在流式 Agent 中因焦点仍停留在输入框而误触发 read_file 工具。文章认为,Agent 的工具调用授权需要焦点锁和模态确认,而不是只依赖 Toast 提示。
-
DeepSeek 推出开源 Agent 运行时 Harness:以插件化架构补齐工程化短板
DeepSeek 开源 Agent 运行时框架 Harness,以“一切皆插件”的方式整合模型调用、工具执行、会话、权限和沙箱能力,试图解决 Agent 从本地原型走向生产部署的问题。
-
一天搭完80%的Agent后,为什么很多团队卡在最后15%?
生成式 AI 让 Agent 原型变得容易,但企业级落地远不止于 Demo。权限、审计、状态管理和长尾场景,正成为最后 15% 的真正瓶颈。
-
GPT-6-Astra 基准测试拆解:OpenAI 称新模型在科学、数学与安全攻防上全面提速
OpenAI 发布 GPT-6-Astra,官方基准显示其在科学工作流、研究级数学、终端任务、临床问答和网络安全攻防等场景较上一代明显提升,其中 ARC-AGI-3 达到 99.9%,ExploitBench 获得满分。
-
OpenAI 推出 GPT-6 Astra:API 定价对齐 Claude Fable,Agent 能力成为新焦点
OpenAI 推出 GPT-6 Astra,定价与 Claude Fable 系列持平,重点强化 Agent 效率、安全任务与长上下文能力,但综合智能指数仍未超越竞品。