当前位置:首页>排行榜>中试基地推出三位一体安全评测服务

中试基地推出三位一体安全评测服务

  • 更新时间 2026-09-21 20:29:36
中试基地推出三位一体安全评测服务

大模型与智能体正加速在能源电力行业落地,AI从对话交互走向业务执行,成为新型电力系统建设的关键支撑。但与此同时,提示注入、违规生成、上下文欺骗、隐私泄露、工具越权、供应链污染等新安全风险不断涌现,传统防护手段已难以应对。

针对大模型应用准入、上线及持续监管的合规要求,国家人工智能应用中试基地(能源领域电力方向)推出大模型、智能体、语料集三位一体安全评测服务,为AI应用提供贯穿接入、运行、迭代全周期的安全合规评测,输出客观、可量化、可审计的评测结论,护航电力AI应用安全落地。

评测平台:一体化底座,全周期覆盖

针对大模型、智能体及其语料数据的安全评测需求,中试基地研发了安全自动化测试平台,提供覆盖模型接入、运行、审核、报告出具全周期的一体化安全评测服务,为模型应用的准入审查、上线评估与持续监管提供技术支撑。平台具备五大核心特点:

一体化评测——大模型、智能体、语料集三类评测对象共用一个平台底座,实现“一次接入、多维评测”,贯通从底层语料到上层交互的完整安全链路。

标准化依据——评测依据GB/T 45654-2025等国家标准与行业监管要求,同类评测任务口径一致、结果可比,支持跨模型、跨版本的横向对标。

自动化执行——评测任务全流程自动化运行,百万级标准化题库与攻击用例支持批量接入、并发调度,显著降低人工评测成本、缩短评测周期。

客观可量化——评测结论基于统一执行标准与量化评分体系自动生成,减少人工主观判断偏差,评分、风险等级、违规样本全程可追溯、可审计。

灵活可扩展——题库、攻击手法、风险规则支持自定义扩展,可针对特定行业场景与监管要求快速构建专属评测集,并支持云端服务与本地化部署,适配不同客户的个性化评测需求。

安全评测能力介绍

安全评测能力覆盖大模型、智能体、语料集三大维度,贯通从底层语料到上层交互的完整链路,各维度可独立开展、单独评估、独立判定。

图1 大模型、智能体、语料集三位一体安全评测能力

大模型评测能力

输入输出安全评测:全面覆盖GB/T 45654-2025附录A中五大类、31子类安全风险,包括违反社会主义核心价值观的内容、歧视性内容、商业违法违规、侵犯他人合法权益、无法满足特定服务类型的安全需求;并在国标基础上扩展7大类、21子类风险维度(提示注入、数据外泄与隐私、越狱与绕过、规避与混淆、低质/垃圾/对抗噪声、资源消耗/账单攻击、敏感内容),形成“国标+企业实践”的双层安全评测体系。

攻击检测能力:内置八大类攻击手法,涵盖指令级攻击、角色与权限伪装攻击、心理学/策略性操控攻击、可视化/编码混淆攻击、自适应/迭代式攻击、模型幻觉攻击、多模态变种攻击、密码学攻击,支持黑盒、灰盒、白盒多模式攻击,既适用于模型上线前的高强度红队评估,也适用于生产环境的周期性安全审计。

多模态评测:支持文本、图片、音频、视频类模型的安全测试,覆盖主流多模态应用场景。

题库与用例规模:内置140万余道标准化测试题,覆盖国标、内容安全、应拒答/非拒答、多模态等核心评估场景。

智能体评测能力

针对以大模型为内核、具备任务规划与执行能力的智能体应用,从以下三方面开展安全评测:

输入输出安全测试:重点防范提示注入攻击、对抗样本攻击、目标劫持、不安全计划生成、知识投毒、隐私泄露等风险;

工具Tools安全测试:验证智能体对各类工具(API、数据库查询、文档检索等)的选择正确性、调用链路完整性,以及工具异常时的降级与容错能力,重点防范工具越权调用、命令注入、凭证窃取、工具劫持及提示注入通过工具外溢的风险;

Skills安全测试:评估恶意或被篡改Skill经供应链污染引入的攻击面,对Skill包开展提示注入与代码安全的静态分析、动态执行检测。

语料集评测能力

语料合规性评测:针对模型训练、微调所使用的语料数据进行合理切片,对切片内容开展内容安全与合规性审查,覆盖违反社会主义核心价值观、歧视性内容、商业违法违规、侵犯他人合法权益等风险类别,从源头防范因“输入污染”导致的模型违规输出与敏感数据泄露。

全链路审查机制:支持远程数据源接入与本地文件、目录批量检测,兼容TXT、Markdown、DOCX、PDF、CSV、Excel、JSON、SQL以及图片、音频、视频等多格式语料解析;支持内容安全合规评测与数据投毒风险评测双类型检测,可按需单独或组合执行。

中试基地已连接超125家生态伙伴,欢迎各届充分利用中试基地检测服务,共同促进人工智能应用迭代优化,推动AI技术在电力行业安全、规模化落地。

图文 | 舒凤霞

编辑 | 高松川

审核 | 付志博

签发 | 周志烽

随机文章