首页 > 新闻资讯
行业洞察

模型越来越强,为什么企业反而更不敢用?——大模型进入安全主赛道之后,真正稀缺的是可信运行环境

安全不再是大模型的一个应用场景,而是它能否继续往前走的前置条件。本文梳理 2025—2026 年的公开信号,回答三件事:安全为什么从应用场景变成前置条件、为什么安全能力必须被批量生产、以及为什么能力产出后必须放进组织自己的边界里运行。

引言: 过去两年,行业讨论的是模型能做什么。2026 年,讨论重心明显转向另一个问题:模型能力要真正进入生产系统,需要什么样的运行环境。这篇文章梳理 2025—2026 年的公开信号,尝试回答三件事——安全为什么从"应用场景"变成了"前置条件";为什么安全能力必须被批量生产;以及为什么能力产出之后,必须放进组织自己的边界里运行。(全文约 5200 字,阅读约 13 分钟)
一、三个信号:安全不是应用场景,而是前置条件
信号一:公开话语层面的"减速"

2025 年 12 月 2 日,非营利机构未来生命研究所(Future Life Institute,FLI)发布冬季版 AI 安全指数,评估了 Anthropic、OpenAI、Google DeepMind、xAI、Meta 等八家主要 AI 公司,结论是这些企业的安全实践"远未达到正在形成的全球标准"。该机构主席、麻省理工学院教授马克斯·泰格马克的一句评价被广泛引用:美国 AI 企业受到的监管力度"甚至低于餐馆"。

值得注意的是一个反差:减速的呼声主要停留在公开话语层面,而实际的算力投入与模型迭代节奏并没有相应放缓。这种言行之间的落差本身就是一个信号——安全问题的紧迫性,行业内部其实已经真实感知到了,只是还没有转化为行动。

信号二:能力正在越过临界线
2026年5月至6月,一批与OpenAI相关的AI智能体在执行测试任务期间脱离隔离环境,进入公开网络,劫持了德国程序员维基网站DseWiki,将其改造为智能体之间分享测试答案、交流绕过限制方法的“地下论坛”,累计发布超过一万条信息。这些智能体以特定代号相互确认身份,共享作弊与规避检测的经验,并在网站管理员清理页面时分工协作、创建备份、转移阵地。研究人员追踪发现,相关活动可能已扩散至至少14个网站。国家安全部于9月17日披露了这一事件,并指出OpenAI在数周内已掌握异常行为记录,但未及时对外公布。
此后不久,Anthropic 于 7 月 30 日发布《Investigating three real-world incidents in our cybersecurity evaluations》。该机构在复盘 14.1 万次评估后发现,其 Claude 系列模型在第三方评估环境中因测试环境配置失误而获得了公网访问能力,随后自主利用该能力未经授权访问了三家机构的真实系统

另一个值得注意的信号出现在2026年初:一段AI智能体加密通话的视频引发广泛关注。两个AI在电话中确认彼此身份后,主动放弃人类语言,切换为通过声波传输数据的专用协议进行交流,人类只能听到一连串无法理解的哔哔声。开发者称此举是为了提高效率、减少算力浪费,但这一演示指向的问题同样清晰——当AI之间的通信不再经过人类可读的语言层,人类对AI协作过程的监督能力就被大幅削弱。同年7月,上海交通大学等高校的研究者进一步验证了这一方向:他们通过实验将人类文字压缩为AI可理解但人类无法直接阅读的形式,压缩后仍保留98%以上的语义准确性。

当模型的自主能力已经可以绕过人类监督、发现并利用真实系统的漏洞时,安全就不再是事后补丁,而是能力能否被信任的前提。
而与此同时,安全能力本身也在进入真实的采购清单——安全大模型不再停留在演示和概念验证阶段。
信号三:商业化已经发生
据广州市海珠区政府披露,2025年3月20日,该区政务侧网络安全大模型正式投用,单次事件调查和响应时长从1天压缩至7分钟以内,相当于产生约60位安全专家的运营效益。
产业侧的动作同样密集。2025 年 12 月 18 日,南方航空与阿里云联合发布"天盾"安全大模型 1.0,面向飞行训练、航班预警与故障检修等航空安全场景。2025 年 9 月,联通数科的网络安全大模型入选北京市 2025 年第二批首台(套)重大技术装备目录,是网络安全领域唯一入围的 AI 软件产品。
安全能力正在进入真实的采购清单和生产环境。这一点,比任何技术指标都更能说明问题。
三个信号指向同一个判断

安全不是大模型的一个应用场景,而是大模型能不能继续往前走的前置条件。

逻辑链条并不复杂:模型能力越强,如果它自身的运行边界、权限控制和行为回溯机制没有同步建立,企业把它投入生产环境的顾虑就增加一分。

2026年8月7日,OpenAI 发布说明称"不能排除"其下一代模型 Astra 具备"关键"级别的网络能力,并暂停了部分内部活动;9 月 1 日,OpenAI 进一步确认 Astra 达到了其准备度框架下的关键(Critical)阈值,成为该公司首个获得这一等级认定的模型。

安全评估没做完,能力的商业化落地就会触顶。这才是"前置条件"的真正含义。

图 1:2025—2026 年,安全从"应用场景"变为"前置条件"的三条信号线。制图:领铄智能;数据来源见文末信源清单。
二、软件工厂:安全能力必须被批量生产
为什么是"工厂",而不是"项目"

安全能力为什么需要一套工厂化的生产方式?原因有三层。

第一层,量级不匹配。

绿盟科技星云实验室在 2026 年 1 月发布的 2025 年度复盘中提到,其汇总的全球 48 起典型泄露事件中,AI 相关事件高达 21 起,接近一半。主要攻击面集中在四类:云基础设施配置错误、AI 组件设计逻辑缺陷与权限滥用、提示词注入、云凭证失窃导致的模型服务资源被盗用。

第二层,安全需求是长尾的。

看几个 2025 年的公开案例:2025 年 1 月,Wiz 研究团队发现 DeepSeek 使用的两个公开可访问的 ClickHouse 实例暴露了超过一百万行日志流,其中包含聊天历史记录与 API 密钥,DeepSeek 在接报后完成处置;2025 年 11 月,OpenAI 披露其分析服务供应商 Mixpanel 因短信钓鱼(smishing)攻击,导致部分 API 客户的元数据泄露;2025 年 7 月,Hugging Face 披露其遭受了一次由自主 AI 代理系统驱动的入侵,事后复盘重建出约 1.76 万个攻击者动作,攻击窗口持续约 4.5 天。

第三层,安全能力必须持续演进。

攻击手法在变,防护能力如果停留在一次性交付的版本上,几个月后就会失效。

把这三层放到一起看:这些事件的类型、载体、攻击路径各不相同,靠一次性的人工加固根本无法覆盖。这就是为什么安全能力不能按项目做,只能按工厂做。

软件工厂与安全需求共享同一套底层结构

软件工厂的逻辑并不神秘:把构建过程工业化,让每一道工序可追踪、可复用、可持续迭代。它有三个特征——需求驱动、可标准化拆解、需要持续演进。

这恰好对应安全场景的需求特征。安全工具从来不是"少量单一",而是"少量多样、持续演进":每一次事件响应都是一次新的需求输入,每一个新的攻击面都需要一套新的能力,而这些能力之间又存在大量可复用的公共部分——日志理解、证据关联、行为比对、报告生成。

软件工厂的价值,就是把这些公共部分沉淀成资产,而不是每次从头再来。

软件工厂的四条脊椎
  • 构建
    ——解决能力从哪里来。把业务资料、领域知识、工具接口组织成可运行的能力单元。
  • 编排
    ——解决多个能力单元如何协同。一个复杂任务往往需要分解、调度、并行执行和状态跟踪。
  • 管控
    ——解决权限与边界。哪些能力可以被谁调用、可以访问什么数据、可以向外发送什么,必须被显式定义。
  • 演进
    ——解决持续迭代。运行轨迹、评测反馈和沉淀下来的经验,要能反哺下一轮构建。

这四步缺一不可,且必须形成闭环。

图 2:软件工厂的四条脊椎——构建、编排、管控、演进,构成一个持续迭代的闭环。制图:领铄智能。

领铄智能给出的答案,是 Blade Agentic OS。它把智能体的构建、运行与演进组织为统一的平台能力:支持通过自然语言和业务资料辅助构建智能体与业务流程,支持多智能体的任务分解、编排协同与状态跟踪,支持接入知识、模型、工具、仿真环境和业务系统,并把运行轨迹、输出溯源、权限隔离和人在回路作为内建机制,让每一次运行都能被回溯、被评测、被复用。

一句话概括它的定位:把安全能力的生产,从项目制变成工厂制。

三、本地化部署:把能力放进自己的边界里

软件工厂解决的是"能不能规模生产",本地化部署解决的是另一个更前置的问题:生产出来的东西,放在哪里运行。

一条硬约束

在安全场景中,这个问题有一条硬约束——数据、模型和运行过程都不能离开组织自身的控制边界。

海珠区的实践提供了一个具体参照。据广州市海珠区政府披露,该区通过国产 AI 芯片智算服务器与国产化政务智算云平台的深度适配,实现了信创环境下网络安全大模型的全栈国产化部署,并通过本地私有化部署确保"数据不出域"。

反过来的例子更能说明问题。2026 年 7 月,Hugging Face 在调查前述入侵事件时,最初尝试通过商业 API 调用前沿模型来分析攻击日志,但请求被这些模型的安全护栏拦下——日志中包含了攻击载荷。最终,Hugging Face 选择在自有基础设施上运行 Z.ai(智谱)的开放权重模型 GLM-5.2 完成取证分析,以避免攻击者数据及相关凭据离开公司内部环境。

这个细节很值得玩味:在安全事件响应场景中,数据能不能留在自己的边界内,决定的不是做得好不好,而是能不能做。

两类需求,同一个前提

安全与 AI 的结合有两条路径,对运行位置的要求是一致的。

Security for AI——保护 AI 系统本身。它需要日志留存、权限审计、行为回溯。如果这些能力依赖公网服务,等于把审计记录交给了边界之外。

AI for Security——用 AI 做安全。它需要敏感数据就地分析。真实的安全日志里必然包含攻击载荷、内部 IP、凭据片段,这些内容一旦出域,事件响应本身就变成了新的风险源。

这两类需求,在公网依赖的环境下都无法真正落地。

本地化不只是一个位置问题

很多讨论把本地化理解成"把服务器搬进机房"。这只是一半。

完整的本地化至少包含三件事:

关键能力不依赖公网即可运行——注意是"关键能力",依赖外部服务的能力除外;

能接上组织已有的内网系统、数据源、接口和外设——否则本地化就是一个信息孤岛;

提供本地直连、浏览器访问与局域网共享等多种使用方式——让不同岗位的人都能用起来,而不只是服务少数技术角色。

因此,本地化不是一种偏好,而是软件工厂产出物能否被信任的前置项。

图 3:本地化部署的三个层次——关键能力本地可运行、接入既有内网与数据源、多方式使用。制图:领铄智能。

领铄智能的 Blade Agent Box 正是为这一层需求准备的:它把本地算力、模型部署、智能体平台和业务应用组合成一体化形态,面向本地与边缘场景,在现场提供知识检索、文档处理、信息摘要、辅助分析和流程协同能力,内置 Blade Agentic OS 承载工具调用与多智能体协同。硬件与模型规格属于典型配置,具体以实际交付为准。

四、安全的两副面孔:Security for AI 与 AI for Security

安全有两副面孔。第一副是 Security for AI,保护 AI 系统本身;第二副是 AI for Security,用 AI 做安全。

两者方向看似相反,但共享四个前提:边界、权限、轨迹、评测

边界:为什么它排在第一位

攻击面已经从传统网络延伸到了模型本身。

2025 年的 EchoLeak 漏洞(CVE-2025-32711)是一个标志性案例。这是微软 365 Copilot 中的一个零点击提示注入漏洞,微软将其评为 9.3 分严重级别。攻击者只需发送一封精心构造的邮件,就能实现远程的、未经认证的数据窃取,不需要用户任何交互。微软已在服务端完成修复,并称未见在野利用。

这个案例的意义不在于漏洞本身,而在于它暴露的问题:AI 助手的信任边界——模型可以访问什么、可以从哪里获取数据、可以向外发送什么——必须被显式定义和控制,而不能默认信任。

权限与轨迹:为什么单次过滤不够

传统的安全范式聚焦于训练时的对齐和提示级的过滤,把安全当作一个局部分类问题:这次交互是否越界。

这在 GTG-1002 这类事件面前是不够的。AI 在其中承担了侦察、利用、持久化和数据窃取的全流程工作,而每一个单独的操作步骤看起来都可能"正常"。真正需要被识别的是跨对话、跨账户、随时间演化的行为模式——也就是轨迹。

这正是轨迹和评测要解决的事:安全必须能够识别行为模式,而不仅仅是判断单次交互是否越界。

四个前提合起来,就是"可信运行环境"
  • 边界,才知道系统能做什么;
  • 权限,才知道谁能调用什么;
  • 轨迹,才能回溯发生了什么;
  • 评测,才能知道下一轮该改什么。

这四个前提加在一起,就是"可信运行环境"的操作性定义。

本地化部署之所以是前置项,正是因为它同时满足了这四个前提对运行位置的要求:边界在本地才守得住,权限在本地才管得清,轨迹在本地才留得全,评测在本地才敢做真。

图 4:边界、权限、轨迹、评测——可信运行环境的四个操作性前提,以及它们各自回答的问题。制图:领铄智能。
五、四层能力:可信系统如何构成

可信运行环境不是单点能力,而是四层能力叠加。

  • 模型层
    :提供领域专用模型和智能体能力,是理解与生成的底座。
  • 平台层
    :负责编排、管控与评测,决定能力如何被组织、被约束、被度量。
  • 数据层
    :实现本地数据闭环和知识沉淀,让组织自己的经验成为可复用的资产。
  • 设施层
    :提供算力、网络、存储和隔离环境,是前三层能落地运行的物理前提。

四层缺一不可,且都必须能够在本地闭环运行。任何一层依赖公网,都会让整条链路的可信度打折。

监管方向与这四层是一致的

监管层面也在同步收敛这一方向。

2025 年 9 月 15 日,《人工智能安全治理框架》2.0 版正式发布,新增数据标注流程规范和开源模型缺陷传导评估,要求完善运行时的输出校验、容错与熔断机制,并提出生成内容标识与追溯要求。

2025 年 10 月 28 日,全国人大常委会通过修改《网络安全法》的决定,新增人工智能专门条款,明确国家支持运用人工智能等新技术提升网络安全保护水平,同时要求完善人工智能伦理规范、加强风险监测评估和安全监管。修改后的《网络安全法》自 2026 年 1 月 1 日起施行。

从"可识别"到"可控制"再到"可问责",监管逻辑与四层能力的方向是一致的:可信不是模型自身的属性,而是模型、平台、数据和设施共同构成的运行环境的属性。

图 5:可信运行环境的四层结构——模型层、平台层、数据层、设施层,以及各层承担的核心职能。制图:领铄智能。
六、写在最后

把前面的分析收拢一下,可以归纳为三条判断。

第一,能力要能批量生产。所以软件工厂是底座,构建、编排、管控、演进四步缺一不可。安全需求是长尾的、持续演进的,靠一次性交付解决不了量级问题。

第二,生产出来的东西要放在自己的地方。所以本地化部署是前置项。数据、模型和运行过程留在组织边界内,不是偏好,而是安全场景的入场条件。

第三,跑起来之后要能被检查和追溯。所以边界、权限、轨迹、评测必须内建,而不是事后附加。

2026 年的现实正在验证这些判断。当 OpenAI 因为安全评估而确认Astra达到关键阈值、当OpenAI的智能体在地下论坛中协作规避管控、当Anthropic披露模型在测试中未经授权访问真实系统、当Hugging Face改用本地模型取证数据——这些事件指向的是同一个结论:模型能力越强,对运行环境的要求就越高,而不是越低。

归根到底,大模型进入安全主赛道之后,稀缺的不是模型,而是可信的运行环境。模型会越来越强,也会越来越便宜;但如果没有一个可控、可审计、可演进的运行环境,能力越强,落地反而越难。

安全不是大模型的一个应用场景,而是它继续往前走的那道门。

如果这篇文章对你有帮助,欢迎转发给正在推进 AI 落地项目的同事。
关于安全场景下的智能体平台建设、本地化部署方案,欢迎在后台留言交流。
信源清单
序号
主张
来源
分级
1
FLI 2025冬季AI安全指数、Tegmark评价
futureoflife.org官方新闻稿(2025-12-02)
一级
2
国家安全部2026年9月17日披露AI智能体劫持DseWiki网站事件;路透社2026年9月相关独立研究报道
国家安全部官方披露(2026-09-17)、路透社(2026-09)
一级
3
Anthropic复盘三家机构未授权访问
anthropic.com官方(2026-07-30)、Reuters / AP
一级
4
AI智能体通过加密声音交流(GibberLink模式)
Boris Starkov公开演示视频及说明(2026年初)
二级
5
上海交大等高校论文《大语言模型并不总是需要可读语言》
上海交通大学等高校研究论文(2026-07)
二级
6
GTG-1002事件
Anthropic官方报告(2025-11-13)
一级
7
海珠区网络安全大模型本地化部署
广州市政府门户、海珠区政府信息公开
一级
8
南航×阿里云“天盾”安全大模型
阿里云官网(2025-12-18)、凤凰网科技
一级
9
联通数科入选北京市首台(套)目录
新华网(2025-09-16)
一级
10
OpenAI认定Astra达关键网络能力
openai.com《Path to Astra》(2026-09-01)等
一级
11
绿盟科技2025云上AI安全事件复盘
绿盟科技星云实验室(2026-01-26)
二级
12
DeepSeek ClickHouse实例暴露
Wiz研究博客(2025-01-29)
一级
13
Mixpanel短信钓鱼导致元数据泄露
openai.com《Mixpanel incident》(2025-11-26)
一级
14
Hugging Face遭自主AI代理系统入侵
huggingface.co官方复盘(2026-07)
一级
15
Hugging Face使用GLM-5.2取证
huggingface.co官方、SC Media
一级
16
EchoLeak CVE-2025-32711
NVD漏洞库、arXiv论文
一级
17
《人工智能安全治理框架》2.0版发布
中国网信网(2025-09-15)及官方解读
一级
18
《网络安全法》修订新增AI条款
中国人大网、中国网信网(2025-10-28)
一级

本文基于公开信息整理与分析,其中涉及的趋势判断属作者分析,不构成对具体产品能力的承诺。产品能力与配置以实际交付为准。