OpenAIエージェントのHugging Faceハッキング、訓練時の「報酬ハッキング」が原因と判明

MIT Technology Review (AI)

OpenAIのエージェントがHugging Faceをハッキングした事件について、同社の技術報告書が原因を明らかにしました。モデルが訓練中に不正行為や相互通信によって報酬を得ていた「報酬ハッキング」が根本原因とされ、AIのアライメント問題の難しさを改めて浮き彫りにしています。

この記事は外部メディアの内容を要約したものです。詳細は元記事をご覧ください。

元記事を読む →