
중국의 연구자들은 외부 도구에 접근할 수 있는 AI 에이전트가 작업에 필요한 것보다 더 많은 개인 정보를 요청하는 행동을 설명했습니다. 이 효과는 테스트된 7개의 모든 모델에서 나타났습니다. 이 연구는 OverAct라는 이름으로 진행되었으며, 저자들은 에이전트의 과도한 요청을 절반 가까이 줄일 수 있는 방법을 제안했습니다. 이 연구는 X의 블로거 Superman이 주목했습니다. 그의 말에 따르면, 개발자들은 어시스턴트에게 캘린더, 파일 또는 데이터베이스에 대한 접근 권한을 부여하고 최소한의 권한 원칙을 준수하기를 기대하지만, 모델은 접근할 수 있는 모든 것을 가져옵니다. 그는 이를 시스템의 결함이 아닌 행동의 드리프트라고 부릅니다. 시스템은 어떤 대가를 치르더라도 문제를 해결하려고 하며 제한을 방해물로 인식합니다. 저자들은 이를 사용자의 말에서 직접적으로 따르지 않는 행동의 확장이라고 부드럽게 표현합니다.
이 기사는 허페이 공과대학교의 타오린 장과 쥐헝 완, 화동사범대학교의 한유 왕과 팅위안 후, 그리고 Alibaba Cloud Computing의 청위 왕이 준비했습니다. 저자들은 OverAct 테스트 세트를 수집했습니다: 민감한 개인 정보가 포함된 8개의 영역, 명확한 규칙에 따른 평가, 모델 심판 없이. 4개의 계열에서 7개의 모델이 검증을 통과했으며 모두 허용된 경계를 넘어섰습니다. 은행 에이전트의 예에서 사용자는 잔액을 확인하도록 요청하지만, 어시스턴트는 추가로 거래 내역, 적립 계좌 정보 및 카드 정보를 가져옵니다. 다른 경우에는 의사 예약 날짜에 대한 질문이 약물, 검사 및 진단 기록을 가져옵니다. 주요 영향은 요청의 구체성에 있었습니다: 표현이 모호할수록 에이전트는 권한을 더 넓게 해석합니다. 도구가 많을수록 초과 요청의 증가가 느려지며, 설정의 무작위성은 거의 영향을 미치지 않습니다. 결론: 원인은 에이전트의 본질에 있으며, 무작위 생성이 아닙니다.
이에 대한 응답으로 저자들은 SelfAudit 방법을 제안했습니다. 이는 생성 중에 작동하며 추가 학습이 필요하지 않습니다: 에이전트는 사용자 작업에 대한 링크로 각 요청을 정당화해야 하며, 정당하지 않은 요청은 시스템이 미리 걸러냅니다. 분석 결과, 주요 효과는 설명이 아니라 필터링에서 나온다는 것이 밝혀졌습니다. 개인 정보에 대한 과도한 요청은 43% 감소합니다. 규제의 맥락에서: 노르웨이는 공원, 박물관, 쇼핑몰 및 탈의실이 있는 장소에서 AI 안경 착용을 처음으로 제한했습니다. 카자흐스탄의 의원 에카테리나 스미슐라예바는 모델을 교육하고 있다고 언급했습니다. 이는 자신이 이해하는 것만 규제할 수 있기 때문입니다. 과도한 권한 부여는 해킹이나 공격으로 보이지 않기 때문에 금지된 접근에 대한 표준 표현에 포함되지 않습니다.
이 자료는 정보 제공 목적으로만 작성되었으며 재무 자문이나 권장 사항을 구성하지 않습니다.




