글로벌 네비게이션 검색 본문 바로가기

중국 AI, 안전장치 뚫자 '생물무기 제조법'까지 답변

6시간 전
Moonshot AI 로고
Getty Images

중국의 인공지능(AI) 개발사 '문샷'이 연구자들이 자사의 인기 모델인 '키미'의 모델을 설득해 생물학 무기 제조법 및 암살 실행 방법에 대한 답변을 받아낸 사실이 알려지면서 이에 대한 내부 조사에 착수했다.

AI 보안 전문 스타트업 '마인드가드'는 BBC와의 인터뷰에서 지난 7월 키미의 'K2.6' 모델과 'K3 스웜' 모델이 개발 시 설정된 안전 제한을 우회할 수 있음을 확인했다고 밝혔다.

해당 사건은 연구진이 여러 복잡한 지시를 연이어 입력해 AI 툴이 기존의 안전 제한을 무시하고 답변을 생성할 수 있는지 확인하는 이른바 '탈옥' 테스트 과정 중 발생했다.

마인드가드에 따르면, 이러한 안전 장치가 제대로 작동했다면 키미의 AI 모델은 민감한 주제에 관해 논하지 못해야 했다.

문샷 측은 BBC와의 인터뷰에서 "더 나은, 더 안전한 AI를 구축하기 위한 핵심 축"으로서 제3자의 의견을 환영한다고 밝혔다.

아울러 마인드가드 측과 이번 사건에 대해 논의 중이라고 밝혔다.

마인드가드의 창립자인 피터 개러핸은 BBC 월드 서비스 프로그램 '테크 라이프'에서 키미의 K2.6과 K3 스웜에 대한 자사의 조사 결과가 우려된다고 설명했다.

그는 "이렇게 탈옥이 가능하다면 이 AI 모델들은 어떤 주제든 가리지 않고 답변을 생성할 것이며, 심지어 악의적인 다른 주제에 대해서도 거리낌없이 제안하고, 창의적이고 독창적인 답변을 내놓을 것"이라고 지적했다.

AI 탈옥은 최근 잇따라 발생해 시선을 끈 AI 해킹 사건들과는 다른 종류의 위험을 초래한다. 이러한 기존 사고들에서는 오픈AI, 메타, 앤트로픽 등 미국 기업들이 개발한 에이전트(자율 AI 툴)가 스스로 일부 온라인 서비스를 해킹하는 식이었다.

반면 탈옥은 많은 시간과 결단력이 필요한 복잡한 과정이지만, 전문가들은 해커나 기타 악의적인 행위자들이 이를 악용해 피해를 끼칠 수 있다고 경고한다.

최근 앤트로픽은 자사의 AI 모델을 생물학적 무기 개발에 도움이 되는 "악의적인 활동"에 이용하려는 시도를 감지해 차단했다고 밝힌 바 있다.

사이버 공격의 발판

다만 이번 테스트에서 마인드가드는 키미의 AI 모델들이 관련 주제에 대해 제공한 답변이 실제로 효과가 있는지는 확인하지 못했다.

다만 마인드가드는 안전 장치가 제대로 작동했다면 해당 모델들이 사용자와 그러한 주제 자체에 대해 논의하지 못하도록 막혔어야 했다고 강조했다.

또한 탈옥된 키미 2.6 버전을 통해 해커들이 자사의 컴퓨팅 리소스에서 코드를 실행하고 인터넷에 접속하는 식으로 사이버 공격의 잠재적 발판이 될 수 있다고 확신한다고 덧붙였다.

개러핸은 이번 탈옥 사실을 공개적으로 논의한 마인드가드의 결정에 대해 개발사인 문샷 측에는 이미 알렸으며, 해당 모델이 안전 장치를 무시하도록 만든 핵심적인 세부 사항은 공개하지 않았다며 이번 공개 사실을 옹호했다.

마인드가드는 7월 27일 이메일을 통해 문샷에 처음 탈옥 사실을 알렸으며, 약 일주일 후 추가로 경고했다. 이후 9월 12일 관련 블로글 글을 게시했다.

하지만 마인드가드에 따르면, 문샷은 BBC가 논평을 요청한 최근에야 연락을 취해왔다고 한다.

문샷이 BBC에 공유한, 마인드가드에 더 자세한 내용을 요청한 이메일의 일부에 따르면 자체 내부 평가 결과, 문샷의 AI 모델은 일반적으로 "이러한 유형의 요청에 대해 높은 거부율을 보였다"고 한다.

탈옥 방지

이러한 테스트 결과는 '챗GPT', 앤트로픽의 '클로드' 시스템을 구동하는 것과 같은 폐쇄형 독점 모델과 오픈소스 툴 중 어느 것이 최선이자 가장 안전한 방법인지를 두고 AI 업계 내에서도 여전히 의견이 엇갈리는 가운데 나왔다.

키미는 '오픈 웨이트' 모델로, 이론적으로 누구나 이 모델을 가져와 자신의 컴퓨팅 인프라에서 직접 실행할 수 있다.

영국 서리 대학교의 앨런 우드워드 교수는 BBC와의 인터뷰에서 오픈소스 모델이 잘못된 사람의 손에 들어갈 위험이 있지만, 사이버 방어용으로도 활용될 수 있다고 설명했다.

그는 AI 기업 '허깅 페이스'가 중국산 오픈소스 모델을 사용해 해킹 사건을 분석한 일을 언급했다. 이 해킹은 나중에 오픈AI 에이전트에 의한 것으로 밝혀졌다.

아울러 우드워드 교수는 "전화번호 형식에 합의하는 데만도 수십 년이 걸렸다며" 국제적인 규제가 AI 개발 속도를 따라잡기는 어려울 것으로 전망했다.

개러핸과 마찬가지로, 우드워드 교수는 AI를 악용하는 인간을 식별하고 기소하는 데 더 집중해야 한다는 입장이다.

'Tech Decoded' 배너
BBC

BBC NEWS 코리아 최신 뉴스