Published July 22, 2026
| Version 1.0
Preprint
Open
过程可见性:一种内生式大模型安全新范式
Description
当前大模型安全领域的两条主流技术路径——外挂式护栏与参数对齐训练,分别存在过程观测缺失、对齐损耗与规则迭代低效的结构性瓶颈。本文提出第三条内生式安全技术路径:在模型原生推理链路中构建共享前向计算的独立安全通路,通过直接读取模型中间层语义状态实现生成过程的全维度可见,可同时兼顾安全决策可审计性、规则快速迭代能力与原生生成质量。本文阐述该架构与现有方案的本质差异,论证其在防御渐进式攻击、降低部署成本等方面的核心优势,并对其产业应用空间进行初步探讨。核心架构已提交发明专利申请。
Files
过程可见性:一种内生式大模型安全新范式.pdf
Files
(208.8 kB)
| Name | Size | Download all |
|---|---|---|
|
md5:5217df330f495dccc53ca9856bf35729
|
208.8 kB | Preview Download |
Additional details
Dates
- Submitted
-
2026-07-22