
OpenAI는 유럽 연합의 AI 법률 요구 사항을 충족하기 위해 텍스트 콘텐츠에 워터마크 기능을 도입했습니다. 회사는 향후 몇 주 내에 ChatGPT 및 Codex 모델의 텍스트 출력에 디지털 워터마크를 적용할 계획입니다. 그러나 Anthropic의 유사한 기술과 달리 OpenAI는 유럽 외부에서 생성된 콘텐츠에는 이 기술을 적용할 계획이 없지만 API 고객은 생성된 정보에 마킹을 적용할 수 있습니다.
OpenAI의 워터마크 기술은 항상 AI 생성 텍스트를 인식하지 못하며 쉽게 속일 수 있습니다. AI 법률 요구 사항에 따르면 생성 AI 제공자는 모델의 출력이 기계 판독 가능하도록 해야 합니다. Anthropic은 Google의 SynthID-Text 알고리즘을 전 세계적으로 적용하여 AI 법률 준수 접근 방식을 처음 발표했습니다. Microsoft와 Meta도 이미지에 대한 유사한 기술을 개발 중이며, 콘텐츠 출처에 대한 우려와 생성 AI의 허위 정보 사용은 유럽뿐만 아니라 전 세계적으로 중요한 문제입니다. OpenAI는 textGrain이라는 워터마크 방법을 사용하여 모델의 단어 선택에 보이지 않는 통계적 신호를 추가합니다. 이 감지기는 이 신호를 분석하여 텍스트에 OpenAI의 워터마크가 포함되어 있는지 여부를 결정합니다. 모델은 가능한 단어의 확률 분포를 기반으로 단어를 하나씩 예측합니다. 주기적으로 다른 단어, 이상적으로는– 동의어를 선택함으로써 텍스트는 편향되지 않은 모델이 형성한 통계적 패턴에서 벗어납니다.
이론적으로 감지기는 이러한 단어 사용의 변화를 감지해야 합니다. 예상 오류율은 1%이며, 200단어 길이의 짧은 텍스트에서는 감지기가 80%의 워터마크만 감지할 수 있는 반면, 400단어 길이의 텍스트에서는 95%를 감지할 수 있습니다. 수학적 또는 코드 조각과 같은 기능적 텍스트에서는 단어 대체가 오류를 유발할 가능성이 높기 때문에 결과가 더 나쁩니다. textGrain 문서는 통계적으로 변경된 단어 선택이 설명된 의미를 변경할 수 있는 상황을 다루지 않습니다. 알고리즘이 중요한 사실이나 숫자를 변경할 경우 이는 여전히 가능성이 있습니다. Anthropic의 접근 방식도 다른 알고리즘을 사용하지만 출력에서 특정 단어를 대체하며 유사한 위험을 내포합니다. 어쨌든 OpenAI의 워터마크는 단어 교체를 통해 쉽게 무력화됩니다. 400토큰 길이의 테스트에서 10%의 단어를 동의어로 교체하면 워터마크 감지율이 92%에서 66%로 감소했습니다. 25%의 단어를 교체할 경우 워터마크의 17%만이 감지될 수 있었습니다. 따라서 규제 준수를 위해 이루어진 변경 사항이 계획했던 만큼 신뢰할 수 없을 수 있음을 보여줍니다.
이 자료는 정보 제공 목적으로만 작성되었으며 재무 자문이나 권장 사항을 구성하지 않습니다.




