대표 작업으로 돌아가기DMS LABS / FIELD NOTES
Work / 실무 가이드11 min

AI 교육은 도구 설명보다 '이 일을 맡겨도 되나'에서 시작합니다

AI 교육을 도구 사용법으로만 채우면 현업에서 어디까지 믿어야 하는지는 남지 않습니다. 세 편의 연구를 바탕으로 업무 경계표를 만들고 2주 뒤까지 확인하는 교육 설계 가이드를 정리했습니다.

AI 교육 · Read in English

AI 교육을 기획하다 보면 커리큘럼이 금방 도구 목록이 됩니다. 계정을 만들고, 화면을 소개하고, 프롬프트 예시를 몇 개 따라 해 봅니다. 교육이 끝나는 시간에는 모두가 도구를 열어 본 상태가 됩니다. 문제는 그다음 주에 나옵니다. 월요일 업무에서 이 일을 AI에게 시켜도 되는지, 결과가 틀렸는지 어떻게 알아보는지는 교육에서 다루지 않았기 때문입니다.

이 글은 특정 고객사의 교육 결과를 보고하는 글이 아닙니다. DMS.Labs가 다루는 AI 교육과 업무 자동화 설계 가운데, 교육을 어떤 순서로 짜면 좋은지를 공개된 연구를 근거로 정리한 실무 가이드입니다. 핵심은 하나입니다. 교육의 중심을 도구 설명에서 업무별 경계로 옮깁니다. 경계란 AI에게 맡겨도 되는 일, 맡기되 사람이 반드시 확인할 일, 아직 맡기지 않을 일을 가르는 선입니다.

연구가 보여 주는 것: 효과는 고르지 않습니다

생성형 AI가 업무에 도움이 된다는 증거는 이미 꽤 쌓였습니다. 다만 그 증거를 자세히 읽으면 도움이 되는 정도가 일마다, 사람마다 다르다는 점이 눈에 들어옵니다. 세 연구를 살펴보겠습니다.

첫째는 Noy와 Zhang이 2023년 Science에 발표한 실험입니다. 대졸 전문직 453명에게 직무에 맞는 글쓰기 과제를 주고, 절반에게 ChatGPT를 쓰게 했습니다. 평균 작업 시간은 40% 줄었고 결과물의 품질 평가는 18% 올랐습니다. 눈여겨볼 대목이 하나 더 있습니다. 실험에 참여한 사람들 가운데 ChatGPT를 써 본 쪽은 실험 2주 뒤 실제 업무에서 쓰고 있다고 답한 비율이 2배, 2개월 뒤에는 1.6배였습니다. 한 번 써 본 경험이 현업 사용으로 이어진 것입니다. 또 같은 논문은 실력이 낮은 참가자가 더 큰 도움을 받아 사람 간 격차가 줄었다고 보고합니다.

둘째는 Brynjolfsson, Li, Raymond의 연구입니다. 고객 지원 상담원 5,179명에게 대화형 AI 보조 도구가 단계적으로 도입된 자료를 분석했는데, 시간당 해결한 문의 수가 평균 14% 늘었습니다. 신입이나 숙련도가 낮은 직원은 34% 개선됐고 경력이 많고 숙련도가 높은 직원에게는 영향이 거의 없었습니다. 같은 도구가 사람에 따라 전혀 다른 효과를 낸 셈입니다.

셋째는 Dell'Acqua 등이 보스턴컨설팅그룹(BCG)과 함께 진행한 사전 등록 실험입니다. 컨설턴트 758명이 참여해 AI를 쓰지 않는 조건, GPT-4를 쓰는 조건, GPT-4와 프롬프트 개요를 함께 받는 조건에 무작위로 배정됐습니다. 연구진이 AI의 능력 범위 안이라고 설계한 18개 과제에서 AI를 쓴 참가자는 평균적으로 과제를 12.2% 더 많이 끝냈고 25.1% 더 빨랐으며 결과물의 품질도 유의하게 좋았습니다. 그런데 능력 범위 밖이라고 설계한 복잡한 경영 과제에서는 AI를 쓴 참가자가 정답을 낼 확률이 AI 없이 일한 참가자보다 19% 낮았습니다. 연구진은 이 현상을 들쭉날쭉한 기술 경계(jagged technological frontier)라고 불렀습니다. 사람이 보기에는 난이도가 비슷한 일인데도, 어떤 일은 AI와 함께 하면 나아지고 어떤 일은 오히려 나빠진다는 뜻입니다.

세 연구는 설정이 다릅니다. 과제도 대상도 도구 버전도 같지 않으므로 숫자를 하나로 합치거나 다른 회사의 업무에 그대로 옮길 수는 없습니다. 여기서 가져올 것은 숫자가 아니라 방향입니다. AI가 돕는 정도는 일의 종류와 사람의 숙련도에 따라 갈리고, 틀린 답이 그럴듯하게 나오는 영역이 실제로 있다는 점입니다.

나무 탁자 위에 펼쳐 놓은 업무 카드 중 하나에 연필로 표시하려는 손.나무 탁자 위에 펼쳐 놓은 업무 카드 중 하나에 연필로 표시하려는 손.원본 전체 보기

도구 중심 교육이 남기는 빈틈

도구 사용법을 가르치는 일이 쓸모없다는 이야기가 아닙니다. 화면이 낯설면 시도 자체를 못 하니 기본 조작은 필요합니다. 그러나 사용법만으로 교육을 채우면 참가자는 두 가지 극단 중 하나로 흘러가기 쉽습니다.

하나는 과신입니다. 교육 시간에 본 시연이 잘 돌아갔으니 모든 일에 같은 방식이 통한다고 믿습니다. Dell'Acqua의 실험에서 능력 범위 밖 과제의 정답률이 AI를 쓴 쪽에서 낮아졌다는 결과는, 잘 통하던 도구가 어느 순간 틀릴 수 있다는 점을 보여 줍니다.

다른 하나는 포기입니다. 한두 번 이상한 답을 받고 나서 이 도구는 우리 일에 안 맞는다고 결론 내립니다. 어느 일에서 틀렸는지 구분하지 못하니 모든 일에서 쓰지 않게 됩니다.

두 극단은 같은 원인에서 나옵니다. 내 업무가 AI의 능력 범위 안인지 밖인지 가려 본 경험이 없다는 점입니다. 그래서 교육의 중심 과제는 이 경험을 교육 시간 안에서 만들어 주는 것입니다.

업무 경계표 만들기

교육에서 참가자가 직접 만드는 결과물로 업무 경계표를 제안합니다. 거창한 문서가 아닙니다. 표 한 장이면 됩니다. 만드는 순서는 다음과 같습니다.

1. 자기 업무를 잘게 나눕니다. 보고서 작성이라고 쓰지 말고 자료 모으기, 핵심 문장 고르기, 초안 쓰기, 수치 확인, 윗사람에게 설명하기처럼 쪼갭니다. 한 업무가 보통 여러 종류의 일로 이루어져 있고, 그중 일부만 AI에 맞습니다. 경계는 업무 이름이 아니라 이 잘게 나눈 조각 사이에 그어집니다.

2. 조각마다 네 가지를 적습니다. 얼마나 자주 하는 일인지, 틀렸을 때 비용이 얼마나 큰지, 정답을 내가 바로 알아볼 수 있는지, 입력할 자료에 외부에 내보내면 안 되는 정보가 있는지입니다. 이 네 칸에 점수를 매길 필요는 없습니다. 높음, 낮음 정도로 표시하면 충분합니다.

3. 세 칸으로 분류합니다. 자주 하고, 틀려도 피해가 작고, 결과를 내가 바로 판단할 수 있는 일은 맡겨 볼 일입니다. 틀렸을 때 비용이 크거나 결과를 알아보기 어려운 일은 맡기더라도 사람이 확인하는 일입니다. 입력 자료가 민감하거나 판단 기준이 말로 설명되지 않는 일은 아직 맡기지 않는 일입니다. 어디에 넣을지 모르는 조각은 모르겠음으로 두고, 시험할 목록으로 옮깁니다.

4. 모르겠음 칸을 직접 시험합니다. 교육 시간의 가장 값진 부분입니다. 참가자가 자기 업무에서 하나를 골라 실제 비식별 자료로 AI에게 시켜 보고, 결과를 자신이 아는 정답과 맞춰 봅니다. 틀린 부분은 어디였는지, 틀렸을 때 AI의 문장이 얼마나 자신 있어 보였는지를 표에 한 줄 적습니다. 이 한 줄이 쌓이면 참가자의 경계표가 점점 실제 업무에 맞춰집니다.

종이 노트 위에 연필로 그은 물결선과 양쪽에 놓인 빈 메모지들.종이 노트 위에 연필로 그은 물결선과 양쪽에 놓인 빈 메모지들.원본 전체 보기

시험할 때 확인할 것

시험은 가볍게 하되 방식은 일정하게 합니다. 사용한 지시문과 자료, 받은 결과, 사람이 고친 부분을 남겨 둡니다. 같은 일을 이틀에 걸쳐 두세 번 시켜 보면 결과가 얼마나 흔들리는지도 보입니다.

확인할 항목은 세 가지입니다. 먼저 정확성입니다. 수치, 날짜, 이름, 인용이 원본과 일치하는지 직접 대조합니다. 자료에 없는 내용을 지어내지 않았는지도 봅니다. 다음은 빠뜨림입니다. 틀린 말은 눈에 띄지만 빠진 내용은 눈에 띄지 않습니다. 정답을 아는 사람이라면 있어야 할 항목이 다 들어 있는지 따로 세어 봅니다. 마지막은 검수 시간입니다. AI가 초안을 5분에 쓰더라도 사람이 확인하고 고치는 데 30분이 걸리면 이 일은 맡길 만한 일이 아닐 수 있습니다. 성과 측정을 다룬 AI 도입 성과 측정 글에서 검수 시간을 함께 보는 이유를 자세히 풀었습니다.

시험 결과는 맞다, 틀리다의 이분법보다 어떤 조건에서 맞았는지로 기록합니다. 이 자료는 짧고 구조가 분명할 때는 정확했지만 표가 여러 개 섞이면 열을 틀렸다는 식입니다. 조건이 적혀 있어야 경계가 구체적으로 그어집니다.

숙련도에 따라 교육 방식을 나눕니다

Brynjolfsson 연구에서 효과가 숙련도에 따라 크게 갈렸다는 점은 교육 설계에 바로 쓸 만한 단서입니다. 숙련도가 낮은 구성원은 AI의 도움을 크게 받을 가능성이 있지만, 결과가 맞는지 판단할 기준을 아직 갖지 못했을 수 있습니다. 반대로 숙련도가 높은 구성원은 결과의 오류를 잘 알아보지만, 도움의 폭은 작을 수 있습니다. 같은 교육을 같은 방식으로 하면 한쪽에는 위험하고 한쪽에는 시시합니다.

그래서 한 교육 안에서도 역할을 나눠 볼 수 있습니다. 경력이 짧은 구성원은 AI 결과를 선배의 기준표와 맞춰 보게 하고, 경력이 긴 구성원은 자기 판단 기준을 말로 풀어 쓰게 합니다. 기준을 글로 적는 과정에서 숙련자의 암묵적인 노하우가 드러나고, 그 기준은 다시 AI에게 줄 지시문과 검수표의 재료가 됩니다. 이 방식이 실제로 팀의 성과를 높인다는 증거는 이 글에서 제시하지 않습니다. 설계의 가설로 읽어 주시기 바랍니다.

교육은 끝난 날이 아니라 2주 뒤까지 설계합니다

Noy와 Zhang의 실험에서 눈에 띄는 것은 실험 직후가 아니라 2주 뒤, 2개월 뒤의 사용 여부를 물었다는 점입니다. 교육의 결과도 교육 당일의 만족도만으로는 알 수 없습니다. 업무 현장에서 쓰고 있는지, 어느 일에서 멈췄는지를 일정 시간이 지난 뒤에 물어봐야 합니다.

이 글이 제안하는 사후 확인은 단순합니다. 교육 후 2주쯤 지났을 때 참가자가 경계표를 다시 꺼내게 합니다. 맡겨 볼 일 칸의 일 가운데 실제로 맡긴 것이 있는지, 사람이 확인하는 일은 확인 절차가 지켜졌는지, 아직 맡기지 않는 일에서 바꿀 만한 근거가 생겼는지를 점검합니다. 2주라는 간격은 제 제안일 뿐 연구가 권하는 기준은 아닙니다. 업무 주기가 월 단위인 팀이라면 한 달이 더 맞습니다.

경계표는 고정된 문서가 아닙니다. 모델이 바뀌고 업무가 바뀌면 칸 사이의 이동이 생깁니다. 오류가 한 번 크게 나온 일은 한 칸 내리고, 오래 안정적이었던 일은 한 칸 올립니다. 이때 권한을 어떻게 단계적으로 넓힐지는 AI 자동화, 권한을 세 단계로 나눠 주기에서 다뤘습니다. 경계표가 무엇을 맡길지를 정한다면, 그 글은 어떤 권한으로 맡길지를 정합니다.

교육을 기획하는 사람이 점검할 것

마지막으로 교육 설계 단계에서 스스로 던져 볼 질문을 모았습니다. 참가자가 교육 시간 안에 자기 업무 자료로 직접 시험해 보는 시간이 있는가. 틀린 결과를 일부러 보여 주는 사례가 들어 있는가. 외부에 내보내면 안 되는 정보를 다루는 기준을 먼저 알려 주는가. 교육이 끝난 뒤 업무 현장에서 확인할 일정과 담당이 정해져 있는가. 하나라도 비어 있다면 도구 설명 시간을 조금 줄여 그 자리를 채우는 편이 낫습니다.

AI 교육의 목표는 도구를 아는 사람을 늘리는 일이 아닙니다. 자기 일에서 어디까지 맡기고 어디부터 직접 볼지를 스스로 정할 수 있는 사람을 늘리는 일입니다. 이 글의 내용은 공개된 연구와 교육 설계 원칙에 바탕을 둔 일반 가이드이며, 특정 조직에서 얻은 결과가 아닙니다.

참고 자료

리도 프로필

리도 인사이트

기술을 현장 언어로 다시 풀어 쓰는 사람

3D 설계, 광통신 인프라 장비 개발, 글로벌 현장 교육을 19년 넘게 다뤄왔고, 요즘은 AI 자동화, 꿈꾸는 카메라, 실무 채널 운영을 연결해 복잡한 일을 더 쉽게 만드는 방법을 기록하고 있습니다.

다음 대화

읽고 끝내지 말고, 실제 문제로 이어가도 좋습니다.

자동화, 설계, 교육, 콘텐츠 중 무엇이든 지금 필요한 문제부터 같이 정리해볼 수 있습니다.

편하게 문의하기