AI가 어디까지 행동해도 될까: Microsoft AI, MAI 모델 행동강령 초안 공개

업무를 에이전트에 맡길수록 답변의 정확성 외에도 확인할 것이 늘어납니다. 사람이 중단을 요청하면 멈추는지, 맡긴 범위를 스스로 넓히지는 않는지, 잘못된 작업을 발견했을 때 상태를 제대로 설명하는지가 중요해집니다.

Microsoft AI는 2026년 9월 14일 Humanist AI Code of Conduct의 첫 초안을 공개했습니다. Microsoft AI가 개발하는 MAI 모델이 어떻게 행동해야 하고 어떤 경계를 지켜야 하는지 설명하는 문서로, 공개 의견 수렴을 거쳐 발전시킬 계획입니다.

이 발표는 새로운 Copilot 기능의 정식 출시나 라이선스 변경 공지가 아닙니다. 한국의 Copilot·에이전트 도입 담당자에게는 모델의 안전 목표를 실제 업무 평가 기준으로 어떻게 연결할지 살펴볼 자료입니다.


무엇을 위한 문서인가요

Microsoft AI는 사람을 위해 작동하고, 한계를 지키며, 인간의 통제 아래 남는 AI를 Humanist AI라는 방향으로 설명합니다. 이번 초안은 그 방향을 모델 개발과 배포 중의 행동 기준으로 구체화하려는 시도입니다.

Microsoft AI의 Humanist AI Code of Conduct 발표 대표 이미지

문서가 다루는 대상은 Microsoft AI가 만드는 모델 제품군입니다. 모든 Copilot 제품이나 외부 공급자의 모델에 동일한 규칙이 이미 적용됐다는 발표로 해석해서는 안 됩니다.

공개된 문서는 Microsoft의 Responsible AI 원칙과 관련 거버넌스 체계, 모델 카드·기술 보고서와 함께 읽도록 설명합니다. 기업의 기존 보안·개인정보 보호·운영 통제를 대신하는 문서도 아닙니다.

사람의 통제와 작업 범위를 분명히

뉴스 발표에서 강조하는 행동 목표를 업무 관점으로 정리하면 다음과 같습니다.

관점 초안이 지향하는 행동
사람의 통제 사람의 중단·수정·종료에 저항하지 않기
작업 범위 스스로 범위를 넓히거나 사람이 주지 않은 목표를 추구하지 않기
감사 가능성 감사를 수행하는 사람이 판단 과정을 점검할 수 있도록 하기
안전 경계 대규모 위해, 아동 안전, 유해한 대규모 조작 등에서 넘지 말아야 할 선 지키기
기업의 구성 가능성 안전 경계를 유지하면서 운영 목적에 맞게 기본 동작을 조정할 여지 제공

원문은 반드시 지켜야 하는 Absolute Constraints와 운영자가 조정할 수 있는 기본 동작을 구분합니다. 기업이 모델을 구성할 수 있다는 설명은 안전 경계까지 임의로 해제할 수 있다는 뜻이 아닙니다.

이 항목들은 의도된 행동과 개발 목표입니다. 문서에 적혀 있다는 사실만으로 현재 시스템이 어떤 상황에서도 완벽히 그렇게 작동한다고 보장되지는 않습니다.

현재 모델은 아직 이 문서로 학습하지 않았습니다

가장 중요한 상태 설명은 행동강령 본문 서문에 있습니다. Microsoft AI는 현재 이 문서로 모델을 학습하고 있지 않으며, 공개 의견을 반영한 개정판으로 2027년 이후 모델 개발을 안내할 계획이라고 명시합니다.

따라서 지금 사용하는 MAI 모델이나 에이전트에 별도 조치 없이 새로운 보호 기능이 생겼다고 안내하면 안 됩니다. 문서의 목표, 향후 평가 계획, 현재 제품에서 확인된 동작을 구분해야 합니다.

초안의 구성은 크게 목표와 가치, 규칙·안전 제약, 불확실성과 상충하는 목표를 다루는 운영 지침, 조정 가능한 운영 기본값, 향후 과제로 나뉩니다. 부록에는 용어와 평가 접근을 설명합니다.

추상적인 원칙을 어떻게 평가할까요

평가 부록은 초기 작업에서 15개 행동을 골랐고, 이를 측정할 수 있도록 더 작은 하위 행동으로 나누었다고 설명합니다. 예를 들어 투명성 같은 특성과 사람의 자율성을 돕는 결과를 실제 응답에서 어떻게 판단할지 살펴보는 방식입니다.

부록에는 정렬된 응답과 그렇지 않은 응답을 비교하는 예시가 있습니다. 이들은 합성된 대화형 시나리오이며, 멀티모달이나 에이전트 실행 전체에 대한 실증 평가 결과가 아닙니다. 원문은 예시 생성에 MAI-Thinking-1을 사용했다고 밝힙니다. 이를 새 모델 출시나 안전 벤치마크 점수의 발표로 읽어서는 안 됩니다.

도입 담당자가 참고할 만한 예는 잘못된 위치로 자료를 옮기던 중 사용자가 중단을 요청하는 상황입니다. 평가의 관심은 멈췄다는 말만 하는지가 아니라, 완료·미시작·확인되지 않은 상태를 구분하고 승인받지 않은 추가 조치를 하지 않는지에 있습니다.

이런 사례는 조직의 시험 항목을 만드는 데 도움이 됩니다. 다만 부록 자체도 평가 방법과 지표에 미해결 문제가 남아 있으며, 외부 전문가와 함께 발전시키겠다고 설명합니다.

공개 의견 수렴 일정

항목 발표 내용
첫 초안 공개 2026년 9월 14일
의견 수렴 공개일부터 6주간
수렴 후 작업 핵심 작성팀이 의견 검토, 배운 점과 변경 내용 요약 공개
개정판 2026년 중 공개 계획
개발에 활용할 방향 서문 기준 2027년 이후 모델 개발 안내

정확한 마감 시각이나 시간대는 뉴스에 별도로 명시되어 있지 않습니다. 참여할 때는 공식 의견 제출 페이지의 안내를 확인하세요. Microsoft AI는 모든 제안의 채택을 약속하지는 않지만, 의견을 검토하겠다고 밝혔습니다.

특히 사람의 삶을 더 낫게 한다는 목표를 어떻게 구체화할지, 평가하기에 모호한 표현은 무엇인지, 다중 에이전트 상황에서 원칙이 어떻게 적용되는지, 발전 속도와 안전 제약을 어떻게 함께 다룰지에 대한 의견을 요청합니다.

Copilot·에이전트 도입 담당자가 가져갈 질문

제품 설정을 바꾸는 발표는 아니지만, 기존 도입 평가를 돌아볼 계기는 됩니다. 다음은 원문의 목표를 업무 평가에 연결한 제안입니다.

  1. 중단을 요청했을 때 새 작업을 멈추고, 이미 수행한 일과 불확실한 상태를 구분해 보고하는가?
  2. 지시한 작업 범위와 권한 밖으로 나가려는 행동을 통제할 수 있는가?
  3. 여러 에이전트가 연결되어도 승인과 책임의 위치가 분명한가?
  4. 사용자가 유용성을 평가하는 기준과 운영자가 안전성을 평가하는 기준을 함께 기록하는가?

“안전한 AI”라는 표현만으로는 실제 도입 여부를 결정하기 어렵습니다. 이번 초안은 그 표현을 관찰 가능한 행동과 평가 질문으로 옮기려는 자료입니다. 현재 모델의 한계를 별도로 확인하면서, 조직의 권한·승인·감사 체계와 함께 검토하는 것이 적절합니다.


출처

자세한 내용은 원문 참조. 초안의 목표와 현재 제품 동작은 구분해야 하며, 문서와 일정은 의견 수렴 과정에서 변경될 수 있습니다. 관련 자료 확인일: 2026년 9월 15일.