Anthropic 可能存在字面提示注入的证据
https://old.reddit.com/r/LLMDevs/comments/1udpw9h/just_got_this_response_from_claude_what_is_going/
Reddit 用户发现 Claude 回复中包含疑似提示注入的文本,引发对模型安全性的关注。

评估 Anthropic 模型的安全防护能力
深入阅读
https://old.reddit.com/r/LLMDevs/comments/1udpw9h/just_got_this_response_from_claude_what_is_going/