前沿研究TechCrunch

research · 海外 AI 灵感

AI自进化对齐训练系统:成本降97%,性能超人类

Anthropic研究员开发自动对齐研究员,可在6小时内改进模型对齐基准,成本仅4美元/小时,优于人类研究员。

发布于 2026年8月28日来源 TechCrunch查看原文

为什么有市场空间

国内大模型厂商众多,对齐和安全性是合规刚需。传统安全团队人力成本高,自动化对齐系统能大幅降低成本,加速模型迭代。同时,国内AI安全研究相对薄弱,引入此类技术可快速补齐短板,相关工具和平台有广阔市场。

01

背景故事

随着大模型能力增强,对齐(确保AI行为符合人类意图)成为关键挑战。传统对齐训练依赖人类研究员,成本高且耗时长。Anthropic研究员尝试用AI自动化这一过程,模拟人类研究方法:搜索文献、提出方案、训练模型并迭代优化。系统能自动保留有效方法,丢弃无效的,实现大规模快速迭代。这验证了递归自我改进的可行性,为AI自主提升安全性能打开了新路径。

02

落地效果

Anthropic发布论文展示了该系统在10个对齐基准上均提升性能,且不降低整体表现。最佳方案平均6小时内超过人类专家,成本约4美元/小时,远低于人类的150美元/小时。目前仅限实验阶段,尚未公开产品落地数据。

栏目说明

本栏目内容由 AI 对海外科技媒体公开报道进行中文改写,并经创新性筛选、国内相关性门控与 MVP 可行性分析生成。 金点子用于灵感参考,不构成投资或创业建议。点击「查看原文」可追溯出处。