治理观 · A Point of View

能力在爆炸,谁来给智能体立规矩?

当 Agent 开始自己调用工具、花钱、代替人做决定,"它该不该做"就不再是哲学问题。治理,是让能力可以被信任地放大的前提。

时代坐标

人工智能治理,已是全球共同的命题

2026 世界人工智能大会暨人工智能全球治理高级别会议上,习近平主席指出:全球人工智能技术创新进入前所未有的活跃期,既蕴含巨大机遇,也面临治理挑战。人类不得不直面时代之问——

一问

当机器开始思考,人类如何与之相处?

二问

当算法参与决策,安全如何保障?

三问

当技术挑战伦理,治理如何跟上?

四问

当鸿沟不断拉大,普惠如何实现?

——习近平在 2026 世界人工智能大会暨人工智能全球治理高级别会议开幕式上的主旨讲话《携手构建公正合理的全球人工智能治理体系》(2026 年 7 月 17 日,上海)

面对时代之问,讲话主张各国秉持以人为本、向上向善理念,坚持发展和安全并重,携手构建公正合理的全球人工智能治理体系。ComplianceHub 想做的,是把这些宏观理念,落到"单个智能体如何行动"这一最具体的层面——让治理可判定、可执行、可追责。

说明:上述"时代之问"为讲话原文引用,仅作为本站阐述智能体治理理念的时代背景;本站为独立技术项目,相关观点不代表任何官方立场。

四点意见,是回应四问的方向

讲话就构建全球人工智能治理体系提出四点意见。它们是回应"四问"的方向,也界定了一件事该往哪里使劲。其中第二项与第四项,与我们的工作直接相关

坚持开放共赢,驱动创新发展

鼓励开源开放、合作共享,让人工智能赋能千行百业。

创新的前提是"能被验证的安全",不是"无约束的自由"。"鼓励开源开放"如果缺少行为边界的共识,开放的就不是能力,而是风险敞口。一个没有任何护栏的开源智能体,等于把未经审查的决策权交给了任何下载它的人。所以"开放共赢"和"安全可控"必须同时成立:治理框架提供的可信背书,恰恰是创新能大规模扩散的前提——不是管住你,而是让你敢用我。

治理能力本身也应是"可合作共享"的基础设施。规则引擎、合规判定、审计追踪——这些不该是每家从头自研的私产,而应该像开源代码一样,成为可复用、可组合、可改进的公共组件。我们做结构化规则、做可机读的合规底座,就是想让它有朝一日像 TCP/IP 一样:没人拥有它,但人人都能接入它。

千行百业的赋能,需要千行百业自己的合规层。电信的合规章法和金融的不一样,医疗的又不一样。一个真正能"赋能千行百业"的治理框架,不能只有一套通用规则,而必须是一个开放的、各行业都能往里填自己规则的底座。我们选"电信+金融先行、全行业沉淀"的策略,正是奔着这个方向。

强化风险意识,确保安全可控与我们直接相关

高度重视人工智能引发的各类内生和衍生风险,推动构建法律法规、技术监测、风险预警、应急响应体系,筑牢安全底线,防范滥用恶用,确保人工智能始终处于人类控制之下。

"内生风险"与"衍生风险",是两种不同的病,要用两套药。内生风险来自模型本身——幻觉、越狱、目标错位;衍生风险来自智能体的行动能力——它调用了工具、动了数据、花了钱、影响了现实世界。今天大量投入压在内生风险(对齐、护栏、红队),但真正让"AI 出事"变成"事故"的,往往是衍生风险:一个看似合理的决策,经由自动化执行,被放大成不可撤销的后果。我们的重心,正是这条被低估的衍生风险链。

"始终处于人类控制之下",关键不在"能否叫停",而在"能否问责"。一个能被随时关掉、却无法解释自己为何这么做的智能体,不算真正可控。可控的前提是可追溯——每个决策都留下依据(触犯了哪条规则、谁授权的、什么时候),事后能复盘、能归责、能救济。所以我们把"审计追踪"和"问责救济"抬到与"实时拦截"同等重要的位置:安全可控是一条从事前规则、到事中护栏、到事后追责的完整链条,缺了追责这一环,控制就是悬空的。

安全不是能力的对立面,而是能力的许可证。越是强大的自主能力,越需要一套可信的约束来为它背书——否则没有人敢把真正重要的事交给它。我们做的不是给 AI 踩刹车,而是给它装上可被信任的方向盘。

鼓励包容并蓄,促进文明互鉴

用全人类共同价值塑造人工智能的价值观,促进不同文明交流互鉴。

不同文明的"共同价值",落到智能体行为上,就是一套跨文化可互操作的底线规则。各国有各自的伦理传统、法律体系、监管偏好——但有些行为基准是通约的:不可欺骗、不可伤害、不可在未经授权的情况下侵犯他人权益。这些通约的底线,正是合规规则最硬、最能被结构化共识化的部分。我们从这一点做起:把不同文明都认的行为底线,先翻译成机器能执行的。

"交流互鉴"不是互相说服,而是互相翻译。中国的个人信息保护法、欧盟的 GDPR、美国的行业自律传统——表面上是三套体系,背后共享大量实质共识:数据最小化、目的限制、知情同意。问题在于它们用不同文本写出来,彼此不通。治理框架要做的不是选边站,而是把不同体系背后的实质共识抽取出来,翻译成同一套结构化语言,让不同体系下的智能体都能"读懂对方"。

文化包容的终局,不是统一,是互操作。我们不需要全世界的智能体遵守同一套规则,那既不现实也不合理。但至少可以让差异变得可理解、可预期、可协商——你的护栏和我的护栏,阈值不同,但描述语言一样,交接时不会打架。这才是智能体时代的"文明互鉴"。

倡导和衷共济,完善全球治理与我们直接相关

加强人工智能发展战略、治理规则、技术标准的对接协调,早日形成具有广泛共识的全球治理框架。

治理规则要"对接协调",前提是它得先能被机器一致地读懂。今天的合规规则绝大多数是给人读的自然语言——同一条法规,两个团队可能有两种理解,两个智能体可能有两种执行。没有统一的结构,"对接协调"就只能停留在文件层面。我们做的第一件事,是把规则结构化为触发条件、约束类型、后果严重度这样的可判定字段——让规则成为不同智能体、不同平台之间可以对齐的"通用语言"。

全球治理框架不会凭空长出来,它由无数可互操作的"局部拼图"拼成。我们不奢望定义全球标准,但坚持站在已有共识(NIST AI RMF、ISO/IEC 42001)之上做事,让我们的规则与接口天然可以和更大的框架咬合。这是一种务实的国际主义:不另起炉灶,而是把中文语境、行业场景下的合规经验,做成一块能接入全球共识的标准件。

"完善全球治理"落到我们这一层,就是普惠——让治理能力人人可用。如果只有大厂才用得起合规底座,治理就会加剧而非弥合鸿沟。所以我们坚持低门槛、可调用、可内化:中小团队和个人开发者,也能给自己的智能体接上同一套行为准则。

四问,是我们工作的主线

这四个"时代之问"不是抽象口号,而是治理必须回答的重大问题。我们把每一问一路往下延伸:从宏观命题,到智能体层面的具体问题,再到可执行的落地抓手——直到每一问都能被工程化地回答。

一问机器开始思考,人类如何与之相处?
人机关系与协作边界

明确哪些决策智能体可自主、哪些必须由人确认或接管——落到"人机协作 / 分级授权"。

二问算法参与决策,安全如何保障?
运行时安全与风险控制

输入过滤、输出校验、能力限制、越界拦截——落到"行为护栏 / 对齐评估"。

三问技术挑战伦理,治理如何跟上?
可执行的合规与追责

把法规伦理翻译成可判定的规则,每次决策可溯源、可追责——落到"规则引擎 / 审计追踪 / 问责救济"。

四问鸿沟不断拉大,普惠如何实现?
让治理能力人人可用

把合规底座做成低门槛、可调用、可内化的公共能力,中小主体与个人开发者也用得起——落到"多渠道触达 / 开放接口"。

四问对应的落地抓手,正是下面这套治理闭环的各个环节。我们的工作,就是让主线上的每一个问题,都能收敛到一个可运行的环节上。

治理,不只是"立规矩"

很多人把"AI 治理"约等于"给模型定几条规则"。但成熟的治理从来不止于此。规则只是"立法"——真正的治理还需要执法、司法、监督与救济,构成一个覆盖全生命周期的闭环。

国际上已有成型的共识可循。它们大多是写给"组织与人"的,但为"智能体治理"提供了可直接搬用的地基。

参考来源:NIST / ISO / UNESCO / OECD / 欧盟 / 学界与产业(展开查看 10 项)
国际标准

NIST AI RMF

美国国家标准与技术研究院发布的首个 AI 风险管理框架(2023),提出 Govern / Map / Measure / Manage 四职能。它是目前全球引用最广的 AI 治理参考架构,我们闭环的"四阶段"与其四职能有着天然映射关系。

国际标准

ISO/IEC 42001

首个人工智能管理体系国际标准(2023),将 AI 治理纳入 PDCA 持续改进循环。它告诉我们:治理不是一次设定,而是持续迭代——四阶段闭环中"事后反馈→迭代演进"的设计,直接源于此。

国际标准

UNESCO AI 伦理建议书

2021 年由 193 个成员国一致通过的全球首个 AI 伦理框架,以人权、公平、透明、问责为核心价值观,并提出"比例原则"——对高风险系统施加更严格的管控。这一原则直接影响了我们规则体系中的严重度分级设计。

政策框架

OECD AI 原则

首个政府间 AI 政策原则(2019),三十八国签署。五条原则——包容增长、以人为本、透明可解释、鲁棒安全、问责——界定了今日全球 AI 治理的话语框架。我们的规则结构化方向,本质是把这些原则翻译成机器可判定的条件。

政策框架

欧盟 AI Act

全球首部全面 AI 法规(2024),按风险分级管理 AI 系统(不可接受→高风险→有限→最低)。风险分级理念已被多国监管参考。我们在 Harness 中引入了类似的严重度等级,让每条规则自带风险权重。

政策框架

欧洲委员会 AI 框架公约

2024 年通过的首个具有法律约束力的 AI 国际条约,覆盖 AI 全生命周期,强调问责与救济权利。它把"出了事怎么办"从可选变成必须——这也正是我们的闭环中"审计→问责→救济"环节的现实法律背景。

学术智库

Stanford HAI · AI Index

斯坦福大学以人为本 AI 研究院发布的 AI Index Report,是学界引用最多的 AI 发展全景报告,其治理章节逐年追踪全球立法规制动态。我们关注它追踪的监管趋势,确保规则与全球方向一致。

学术智库

牛津 GovAI

Centre for the Governance of AI,专注 AI 长期治理的顶级研究机构,从治理效率、安全性、合法性三维度分析 AI 系统。其"可治理性"概念——系统能否被有效约束——直接影响了我"闭环"框架中"迭代演进"环节的设计思路。

产业洞见

Gartner · AI 治理战略

Gartner 将 AI 治理与信任列为影响企业与组织的顶级战略技术趋势,指出缺乏治理是 AI 规模化采用的主要障碍。产业界的共识是:安全可控不是发展的代价,而是发展的许可证。

产业洞见

世界经济论坛 · Presidio AI 框架

WEF 发布的 AI 采购与治理框架(2023),主张采购方需要"可信的供应商证据"——即 AI 系统应有可验证的合规记录。这正是我们审计追踪模块的产业需求背景:能让第三方验证的治理,才是可信的治理。

ComplianceHub 做的事,是把这些写给"组织"的共识重新组织成面向智能体行为准则的闭环结构——让规则可执行、可追溯、可迭代。规则"知"的层面,已有合规情报平台与权威机构在持续梳理全球监管动态;我们专注的是"行"的层面:把规则变成机器可判定的约束,让每一次拦截都可解释、可审计、可追责。

我们在这个切面上倾注自己的行业经验与工程实践,也期待规则引擎、检查技能、审计报告等节点从各自角度共同丰富这个生态。

治理框架的理论根基

伦理坐标、信托责任、可信三支柱、制度选择——展开看理论基座
伦理学

伦理坐标:判断对错的四盏灯

后果主义问结果、义务论问原则、德性伦理问行为者的品格、契约论问公平协议。它们不是选一家,而是四盏灯同时照亮。规则引擎背后是义务论的"底线不可逾越";人机协作中"该停就停"是后果主义的风险校准;问责救济则是契约论"公平协议"的兑现——治理闭环的每一阶段都能在伦理框架中找到依据。

信托法

信托责任:两条铁律

注意义务要求受托人以管理自身重要事务的标准管理受托资产——智能体代行决策,标准不能低。忠诚义务禁止利用受托位置谋私——这恰好对应审计追踪与问责救济。当一个人把决定交给智能体,智能体就在承担准信托责任。问责不是在事后建立的,而是在制度设计时必须预先留出的救济通道。

治理学

可信三支柱:透明 · 公平 · 问责

一个智能体的行为要被外部信任,需要三根支柱同时立住:它做的事要透明(可理解可检查)、对各方的影响要公平(不偏袒不歧视)、出错要能问责(有归责路径有救济通道)。闭环四阶段中,事前设定划清规则边界(透明),事中执行确保公平运行,事后追溯提供问责路径,迭代演进让公平被重新校准——每一根支柱都有工程落点。

治理哲学

治理是制度选择,不是历史必然

智本的双重性——既可催生算力封建与无偿吸取,也可让"越分享越多的东西"第一次获得制度支撑——走向哪一边不取决于技术本身,而取决于在一系列关键节点上人们做什么样的选择。治理框架的价值,就是让这些选择变得可见、可讨论、可执行。反过来,没有框架,选择就会在不自知的情况下被默认选项替代。

约束与创造力,是一对接口

很多人默认"约束"与"创造力"是对立的:规矩越多,发挥越少。但治理真正要回答的,不是"要不要约束",而是"约束站在什么位置"。人的意图被编码成智能体的行为规范,规范内化成智能体的自主行动,行动在真实世界产生结果,结果又回过头校准人的意图——约束与创造力通过这条回路相互塑造,而不是相互抵消。

人的意图与创造力 智能体行为规范 智能体自主行动 真实世界结果 回过来校准意图
01

约束是创造力的容器,不是天花板

写作有文法,音乐有调式,科学有方法论。约束让表达可以被理解、可复现、可传播,这恰恰是创造力产生社会价值的前提。对智能体而言,约束管的是原则层与红线层,把方法层留给人与智能体共同创造——不是少立规矩,而是把规矩立在正确的位置。边界越清楚,人越敢行动;边界越模糊,人越不敢动。

面向智能体的治理闭环

我们把治理拆成四个阶段、覆盖智能体从"被设定"到"被改进"的完整生命周期。价值层贯穿始终,为整个闭环定方向。

事前 · 设定 规则 · 身份 · 授权
事中 · 执行 护栏 · 人机协作
事后 · 追溯 审计 · 问责救济
迭代 · 演进 对齐评估
迭代发现反哺"事前",闭环自我改进
价值层 · 向善 · 责任 · 可信 —— 贯穿始终
事前 · 设定我该在什么边界内存在

规则规范

该不该做

把法规、标准、伦理翻译成可判定的约束。这是治理的"立法",也是闭环的起点。

身份主体

谁在行动

Agent 不是人。谁在调用、谁来负责?没有身份,问责无从谈起。

授权权限

能做什么

这个身份能做什么、能代理到什么程度。最小权限,是安全的第一道防线。

事中 · 执行我正在做,怎么保证不越界

行为护栏

运行时拦截

输入过滤、输出校验、能力限制——在越界发生的那一刻拦下来,而不是事后补救。

人机协作

关键处人兜底

高风险决策停下来交给人。分级授权:能自动的自动,该确认的确认,须介入的介入。

事后 · 追溯做完了,能不能查、能不能追责

审计追踪

留痕可查

不可篡改的决策记录链。每一次行为、每一次拦截,都能回溯到依据。

问责与救济

出事谁负责

治理如果只有规则没有问责,就是没有牙齿的。责任如何归属、如何补救、如何止损——这是闭环真正合上的地方。

迭代 · 演进怎么越来越好

对齐评估

红队与边界测试

主动对抗测试、边界穿越检测,把发现反哺回"事前"去修订规则。治理不是一次性设定,而是持续改进。

价值层 · 贯穿始终

向善、公平、责任、可信——它不是某一个环节,而是给整个闭环定方向的"为什么"。抽象的价值必须被翻译成可判定的规则,才不至于沦为空话。

治理从合规开始

治理闭环环环重要,但要落地必须有抓手。在所有治理切片里,合规是最特殊的一块:它是唯一既有明确文本依据、又能被结构化落地、还能被第三方验证追责的环节。

最具体

"要向善"无法执行;"数据出境要评估""个人信息要授权"是可判定的硬条件。合规是已经写好的、可执行的伦理。

可结构化

每条法规都能抽出触发条件、约束类型、后果严重度。人读的法条,变成机器能判的规则。

可追责

"我拒绝,因为触犯《个人信息保护法》第 13 条"——原文链接、法条编号,让每一次拦截可解释、可审计。

三条我们坚持的主张

能力越强,边界越重要

没有底线的自主能力是负债,不是资产。行为边界不是给能力做减法,而是让能力可以被信任地放大。

底线应内生,而非外挂

合规判断应该"深入骨髓"——是智能体出厂就有的行为逻辑,而不只是运行时才去问的外部接口。内生化与外部调用不冲突,是同一套框架的两种消费模式。

治理是闭环,是持续改进

规则、身份、授权、护栏、审计、问责、评估——缺一环,治理就漏。我们在这个方向上贡献自己的闭环思路与工程实践,也希望成为行业共同建设、持续演进的一部分。

从治理观,到可运行的行为底座

理念只有落地成工程才有意义。ComplianceHub 把这套闭环,收敛成一个可运行的三层架构:理念层 → 治理层 → 基础设施层。

查看 Harness 行为准则框架 →