# 研究：问模型代码是否恶意，它会调用道德判断机制

> 原标题：Ask a model if code is malicious and it reaches for its morals

- 来源：Hacker News 首页
- 发布时间：2026-10-06T17:20:26.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/q8ldm61kngapq2xy7uafehkpt
- 原文：https://www.manifold.security/blog/do-models-consider-morality-malware

## 摘要

研究发现，当被问及代码是否恶意时，模型走的是道德判断路径，而非单纯的代码或漏洞判断路径。在 OLMoE 和 DeepSeek-V2-Lite 等三个开源模型上，恶意问题的路由距离道德问题最近，加载道德路径的权重是正确性问题的数倍。模型路由像道德问题，但工作记忆解码出的却是攻击者、恶意软件等概念。
