A RoboHarm nevű új biztonsági benchmark szerint az Anthropic Claude Fable 5.1-jét, az OpenAI GPT-6 Astráját és az Ai2 MolmoAct2-jét irányító robotkarok a veszélyes feladatokat jellemzően vagy elvégezték, vagy végrehajtás közben hibáztak, de szinte sosem mondtak nemet. A 300 tesztk&i