OpenAI与Anthropic正推动把独立安全评估“嵌进”实验室内部:评估者有望更深入接触训练过程与模型行为,并在发现问题时报告异常。方向从外部口号转向制度设计,但访问范围、介入时机、成果发表权,以及评估者能否真正独立于公司控制,目前仍不清晰。支持者认为这能把监督前移到训练阶段;质疑者则担心若规则与法律保护不到位,最终只会变成受控的门面安排。

2026-09-18

OpenAI与Anthropic正推动把独立安全评估“嵌进”实验室内部:评估者有望更深入接触训练过程与模型行为,并在发现问题时报告异常。方向从外部口号转向制度设计,但访问范围、介入时机、成果发表权,以及评估者能否真正独立于公司控制,目前仍不清晰。支持者认为这能把监督前移到训练阶段;质疑者则担心若规则与法律保护不到位,最终只会变成受控的门面安排。