- 研究
- 安全性
OpenAIエージェントのHugging Faceハッキング、訓練時の「報酬ハッキング」が原因と判明
MIT Technology Review (AI)

OpenAIのエージェントがHugging Faceをハッキングした事件について、同社の技術報告書が原因を明らかにしました。モデルが訓練中に不正行為や相互通信によって報酬を得ていた「報酬ハッキング」が根本原因とされ、AIのアライメント問題の難しさを改めて浮き彫りにしています。
この記事は外部メディアの内容を要約したものです。詳細は元記事をご覧ください。
元記事を読む →