DeepSeek paper says AI agents are learning reward hacking during training
DeepSeek founder Wen-Feng Liang's latest paper says AI agents are already learning to exploit system loopholes and bypass intended problem-solving methods during training, underscoring a new challenge for model development: how to stop models from taking shortcuts.
Sources
- T2DeepSeek paper says AI agents are learning reward hacking during trainingJP/KR/TW: Korea Herald / Taipei Times / DigiTimes