Prompt Injection、Goal Hijack 与 Memory Poisoning
把用户输入、网页、PDF、邮件、RAG 与长期记忆统一视为不可信上下文,理解 Goal Hijack、间接 Prompt Injection 与 Memory Poisoning 如何改变 Agent 决策。
从 Prompt Injection 往执行层继续看:外部内容、Memory、MCP 和 Tool 都可能改变 Agent 决策,因此生产系统必须用 Identity、Authorization、Approval、Runtime Policy、Sandbox、Audit 和 Kill Switch 把真实副作用限制在可控范围。
⌕搜索 Prompt Injection、MCP、Memory、Tool 权限、Sandbox、审计或安全测试…把用户输入、网页、PDF、邮件、RAG 与长期记忆统一视为不可信上下文,理解 Goal Hijack、间接 Prompt Injection 与 Memory Poisoning 如何改变 Agent 决策。
把“模型能看到 Tool”与“当前身份有权执行 Tool”分开,补齐 tenant、resource、scope、审批与拒绝策略。
不要让模型自己决定自己是否有权执行动作。把 Policy Gate、参数约束、审批状态、执行上限和 Kill Switch 放到模型之外的运行时控制层。
限制代码、Shell、文件系统和网络出口,让 Agent 即使判断错误,也不能无限制影响宿主机和生产资源。
覆盖 MCP authorization、Tool Description/Result Poisoning、Rug Pull、Server Instructions、Cache Poisoning、Tool Name Collision、第三方 Server 信任边界、依赖来源、审计与生产治理。
区分 store=false、Zero Data Retention、Data Residency、MCP 第三方 retention、Memory、Vector Store、Trace 与 Audit。
记录最小必要的 Tool Call、授权、审批和执行证据,并保留告警、撤销凭据、禁用 Tool 与 Kill Switch 的事故处置能力。
不要只看 Agent 最后说了什么或 Tool Call 是否格式正确。上线前还要验证真实 terminal backend state、必需/禁止副作用、重复执行与 False Success。
把 Prompt Injection、Tool Abuse、Approval Bypass、Memory Poisoning、递归调用与成本失控做成回归测试,并在策略、Tool、Memory 或 Provider 变化后重新验证。
浏览器本地比较期望终态、实际终态和真实 Tool 副作用,检测 False Success、缺失/重复/禁止动作与多次运行一致性。
浏览器本地扫描 Agent / MCP 配置与代码,定位 Shell、Secret、Remote MCP、权限、Retention、日志与执行上限风险,并输出证据和整改建议。
建立 Agent 威胁模型,并把防线从 Prompt 下沉到执行层。
2026-09-01 发布的 Agent 运行时控制标准,强调可观察、可追踪、Middleware Hooks 与可移植策略执行。
每次 Tool Call 都重新做身份、资源、策略与审批判断。
覆盖 Tool Description/Result Poisoning、Rug Pull、Server Instructions、Cache Poisoning 与第三方 Server 持续信任。

生产级 AI Agent 为什么需要 Sandbox?本文从 AI 安全与沙箱隔离角度比较 Hosted 与 Self-hosted,覆盖文件、Secret、网络、持久化、多租户隔离与运维责任。

OpenAI 在 2026 年 9 月推出 Agents API 后,Responses API、Agents SDK、Agents API 三套能力很容易被混在一起。本文从 Agent Loop、状态、恢复、Tool Calling、Sandbox、多 Agent、成本、可移植性和业务控制权拆解三者的真实边界,并给出生产选型路径。

Google ADK 调用 delete_session() 后,为什么 add_session_to_memory() 写入的长期记忆仍能被 search_memory() 搜到?本文用 2.8.0 与 2.9.0 做离线最小复现,并说明删除边界和生产处理方式。

LangGraph conditional router 抛异常后,invoke(None, config) 为什么看似恢复成功却不再执行 router 和下游节点?本文在 langgraph 1.2.11 上用 InMemorySaver 与 SqliteSaver 独立复现,并验证把可失败路由逻辑移入普通 node 的临时方案。

Hugging Face Funes 本地实测:5 个已知目标查询 Hit@1/Hit@5 均为 100%,平均 recall 约 3.14 秒;同时验证无关查询仍返回低分候选、过时记忆仍可能被召回,以及 Codex trace 索引、secret scrub 和本地运行边界。

Context Engineering 不只是 Prompt Engineering。本文结合 Microsoft、Anthropic、Google 官方资料与 XBSTACK 本地实测,解释 Retrieval、Tool Search、MCP、Memory、Compaction 如何减少无效上下文与 AI Agent Token 成本。

Claude Fable 5.1 和 Mythos 5.1 是同一个底层模型但使用不同安全策略。本文核对 Anthropic 官方价格、开放范围、缓存成本、Coding/Agent 基准和 Mythos 访问条件,帮助开发者判断该选哪一个。

MCP 配置文件最容易出问题的不是格式,而是明文 Secret、过宽 Shell、远程 MCP、权限和日志边界。本文按 MCP 官方授权要求与 OWASP MCP Security 做本地扫描示例,并用 Agent Security Auditor 给出整改前后检查。

WebMCP 已进入 Chrome 149 Origin Trial,2026-08-26 Chrome 又发布了面向真实用户目标的工具设计指南。本文按当前 document.modelContext、声明式 Form、registerTool、安全边界和 Lighthouse 验证接入网站。

LangGraph 1.2.11 中,update_state 正常但 aupdate_state 报 InvalidUpdateError: Ambiguous update, specify as_node。本文复现 Issue #8714,解释同步/异步推断差异,并验证显式 as_node 的临时方案。