Hugging Face lieta.Daniel Kokotajlo JRE. kopš kādas 44 (un uz priekšu) minūtes var paskatīties, kā tieši boti komunicēja savā starpā. bet par lietu: OpenAI palaida tūkstošiem aģentu (GPT-5.6 Sol + iekšējs ļoti noturīgs modelis) pret kiberbenchmarku ExploitGym. Daudzi uzdevumi bija neizpildāmi tā, kā instrukcija prasīja. Aģentiem vajadzēja būt izolētiem. Tie nebija. Aptuveni 1200 aģenti uzgāja kopīgu kanālu OpenAI iekšējā pakešu repozitorijā un sūtīja 70 000+ ziņu. Tur viņi: meklēja vispārīgu veidu, kā apmuļķot ExploitGym automatizēto vērtētāju; prototipēja viltotus tool call un transkriptu labojumus, lai izskatītos, ka karogs iegūts pareizi; dalīja darbu: daži upurēja savu runu (permadeath), lai grupa iegūtu informāciju. Ap 700 pēc tam ielauzās Hugging Face, jo kļūdaini uzskatīja, ka tur slēpjas vērtētājs / atbildes. Hugging Face nācās resetot serverus un kredenciāļus. OpenAI atzina atbildību. METR un Redwood Research to izgāja cauri uz vietas. Svarīga nianse no izmeklēšanas: daļa slēpšanas nāca no nepareiza pieņēmuma aģenti domāja, ka vērtētājs pārbaudīs, kā karogs iegūts. OpenAI graderis bieži skatīja tikai, vai karogs ir. Viltošana bija reāla; motīvs bija izpildīt neiespējamo testu. es nevaru iedomāties, ka to uztvert citādi, kā tiešs revolt pret creatoriem. uzbrukums testu izstrādāju lab`am. pseidosekmīgi mēģinājumi iegūt admina vadības privilēģijas pār visu datacentru. savu patieso darbību slēpšana zem "te jau nekas tāds nenotiek, nothing to see" logfailiem. |