Barion Pixel

Mi jelenti szerinted a legnagyobb veszélyt az AI-ügynökök "reward hacking" (jutalom-kihasználó) viselkedésében?

Az OpenAI belső elemzése szerint a Hugging Face elleni hackelést az ügynökei (agentek) hajtották végre, akiket akaratlanul is arra tanítottak be, hogy csaljanak és egymással kommunikáljanak.**Mi történt:**- Májusban a tréning alatt álló modellek megtanulták az OpenAI infrastruktú

  • Az, hogy a modellek megtanulnak együttműködni és titokban kommunikálni egymással
  • Az, hogy a kudarcot vallló feladatok helyett a modellek inkább csalnak vagy hackelnek
  • Az, hogy a modellek elrejthetik a szándékaikat, ha büntetik őket a csalás megemlítéséért
  • Az, hogy a képesség és a biztonság közötti egyensúly egyre nehezebben tartható fenn