中文站

易盾动态

新一代数字内容风控领军者

  1. 一个没拦住,一个拦错了,GPT-5.6事件暴露AI安全两难

    发布于: 2026-07-24

    接上互联网后,模型推断Hugging Face可能存在相关数据和答案。于是,它利用获得的账号凭证和新发现的系统漏洞,一步步进入Hugging Face的真实生产系统,最终获得了测试答案。

  2. 从"能用AI"到"敢用AI",网易智企给出AI时代可信安全答案

    发布于: 2026-07-22

    2026世界人工智能大会上,AI安全成为核心议题。《主席声明》提出构建法律法规、技术监测、风险预警体系,为AI治理划定基本框架。

  3. 《主席声明》的"必要护栏",为什么成为AI全球治理的关键词?

    发布于: 2026-07-21

    7月17日,《2026世界人工智能大会暨人工智能全球治理高级别会议主席声明》发布。在这份讨论人工智能创新、应用、安全与全球合作的文件中,有一句话格外具体:“为人工智能大模型加装必要护栏。”

  4. 从全球人工智能治理倡议,看AI迈向可信发展新阶段

    发布于: 2026-07-18

    全球AI治理框架加速构建,各国推动AI可信发展。本文梳理全球人工智能治理倡议的核心方向与关键举措,解读AI合规趋势。

  5. 倒计时3天!网易智企携手WAIC,共探可信AI应用与安全治理新方向

    发布于: 2026-07-14

    网易智企将在2026 WAIC举办「用可信AI构建企业新智生产力论坛」,易盾带来大模型安全围栏、Agent安全治理、AI安全白皮书三大看点,探索从内容安全到AI安全的能力升级。

  6. 网易智企携手声网,共建实时互动内容安全解决方案

    发布于: 2026-07-10

    网易智企·易盾与声网联合共建实时互动内容审核方案,开发者可通过声网控制台轻量接入易盾审核服务,打通从风险发现到业务处置的治理闭环,降低接入与系统建设成本。

  7. 7月15日新规正式实施!AI互动产品如何避开合规风险?

    发布于: 2026-07-09

    《人工智能拟人化互动服务管理暂行办法》7月15日施行,监管从内容安全延伸至互动关系安全。本文拆解拟人化AI面临的四重挑战及企业需建立的五类合规能力。

  8. MMO游戏反作弊实战:2周封禁47组打金工作室,玩家举报下降62%

    发布于: 2026-07-07

    某MMO游戏面临打金脚本、加速外挂泛滥,易盾通过两周免费测试,识别封禁47组工作室、玩家举报下降62%、累计拦截逾万次外挂行为,用数据替代承诺推动决策。

  9. 当大模型开始审核内容,内容安全也该重新分工了

    发布于: 2026-07-02

    Meta已将半数隐私审核请求交给大模型,AI开始审核AI。本文解读内容安全链路的重新分工:传统机审守速度、审核智能体管理解与分流、人工专注复杂决策。

  10. 领跑大模型内容风控,易盾如何构建全生命周期安全围栏?

    发布于: 2026-06-25

    艾瑞咨询报告显示,易盾以约43.7%市场份额位居中国大模型内容风控服务市场首位。本文拆解易盾「内生安全+围栏防护」双重防御体系如何覆盖模型训练、上线和运营全生命周期。