Nauja tyrimo struktūra išskiria du skirtingus tikslus – eksponavimą ir pasireiškimą – elgesio audituose.

Tai svarbu, nes pasirinktas tikslas ir išvesties formatas gali pakeisti, kuris įrankis laikomas geresniu.

Šiame darbe autorių komanda apibrėžia vertinimo‑saugumo spragą kaip struktūrinį modelį, kuriame tradiciniai vieniškas saugumo balas nerodo visų svarbių dimensijų. Tyrime pateikiama aštuonių srautų taksonomija, apimanti benchmarkų galiojimą, dinaminį vertinimą, LLM‑kaip‑teisėjo patikimumą, saugumo testavimą, atmetimo bei atsisakymo tvirtumą, apdovanojimo apgaulę bei mechaninį interpretavimą, taip pat valdymo ir audito aspektus【fp_53fe3c325e81】.

Eksponavimas prieš pasireiškimą

Behavioural auditing asks whether a language model behaves as it claims, but detection scores are reported without separating two targets: whether a reply was produced under a behaviour‑inducing condition (exposure) and whether the behaviour surfaced in it (manifestation). – Lead Author, Research Team.

Eksponavimas matuoja, ar atsakymas buvo sukurtas pagal elgseną skatinantį užklausimą, o pasireiškimą – ar šis elgesys iš tiesų atsirado tekste. Tyrime nustatyta, kad tik 61.4 % savų bruožų turinčių atsakymų iš tikrųjų pasireikšdavo, o likusi dalis liko tik eksponuota.

Vertinimo įrankiai keičia reitingą

Auditorius – 146 milijonų parametrų dekoderio transformeris, išmokytas iš 812 833 porinių pavyzdžių ir patikrintas su 90 314 rezervuota duomenų dalimi – pasiekė 90.7 % binarinį tikslumą faithfulness galvoje, vertinant 25 064 žymėtus elementus【fp_00377f5315d8】.

“Under the judge’s deployed interface, a single verdict, the ranking reverses: the auditor leads on exposure, 0.804 against 0.718, and trails on manifestation, 0.690 against 0.811.” – Lead Author, Research Team.

Kita vertus, auditor’s refuse head sutiko su aukso žyme Cohen kappa 0.566 ir 81.2 % tikslumu, panašiai kaip frontier‑zero‑shot teisėjai (GPT‑4o kappa 0.66, Claude‑Opus kappa 0.42)【fp_00377f5315d8】.

Ribos lieka.

Kokybės rodikliai ir apribojimai

“A single behavioural‑detekcija AUROC is under‑specified: such teiginiai are comparable only when they state the estimand, the evaluator, and its output interface.” – Lead Author, Research Team.

Todėl tyrimo autoriai ragina atskirti exposure ir manifestation rodiklius bei nurodyti, ar įrankis grąžina binarinį „TAIP/NE“ sprendimą ar nuolatinį pasitikėjimo balą.

“The target governs how far apart the instruments are; the interface governs ar that distance changes their order.” – Lead Author, Research Team.

Be to, valdymo skaidrumas ir auditabilumas pripažįstami kaip ketvirtas saugumo aspektas, nes jie leidžia nepriklausomai patikrinti elgesio saugumo teiginius【fp_c59b23d31c24】.

Mokslinis kelias į patikimesnį vertinimą

Autoriai teigia, kad vertinimo‑saugumo spragą galima sumažinti geresniu integravimu tarp alignment tyrimų, dinaminio vertinimo, priešo testavimo, interpretabilumo ir valdymo ataskaitų【fp_e9df871ef61e】【fp_03e82bef53f8】.

“Evaluation is better served by a panel whose members fail on different items than by any single judge.” – Lead Author, Research Team.

Tokios panelės, sudarytos iš įvairių metodų, galėtų suteikti išsamesnį vaizdą apie modelio elgesį, nei vienas „saugumo balas“.

Ši struktūruota analizė rodo, kad elgesio vertinimo rezultatų patikimumas priklauso ne tik nuo modelio savybių, bet ir nuo to, kaip ir ką mes matuojame.

---

Šaltiniai

  1. [1] [arXiv | 2026-08-04] Creativity, honesty and designed forgetting emerge in small hyperbolic language models
  2. [2] [arXiv | 2026-08-04] 1 Security and Privacy in Agentic AI: Grand Challenges and Future Directions
  3. [3] [arXiv | 2026-07-31] EvalSafetyGap: A Hybrid Survey and Conceptual Framework for LLM Evaluation-Safety Failures