AI 제품 기획은 기능 정의만으로 끝나지 않습니다. 사용자 문제 선정부터 평가 지표, 데이터, 비용, 안전장치와 출시 전략까지 실무 기준으로 설명합니다.
기존 소프트웨어는 사용자가 버튼을 누르면 기획자가 정한 결과를 비교적 일정하게 보여줍니다. 반면 AI 제품은 같은 질문에도 답변이 달라질 수 있고, 그럴듯하지만 잘못된 결과를 만들기도 합니다.
따라서 AI 시대의 제품 기획은 ‘어떤 기능을 제공할까’보다 ‘어떤 업무를 어느 수준까지 맡길 것인가’에서 시작해야 합니다. 정확도뿐 아니라 처리 시간, 모델 비용, 사용자의 검토 부담과 실패했을 때의 위험도 함께 설계해야 합니다.
화면에 챗봇을 추가하는 것만으로는 좋은 AI 제품이 되기 어렵습니다. 사용자가 실제로 완료하려는 업무를 기준으로 제품 구조 자체를 다시 만들어야 합니다.
AI 제품은 기능이 아니라 완료할 업무부터 정해야 한다
기존 제품 기획에서는 회원가입, 검색, 결제처럼 구현할 기능을 정리하는 방식이 익숙합니다. AI 제품에서도 기능 정의는 필요하지만, 그보다 먼저 사용자가 완료하려는 업무를 구체적으로 정해야 합니다.
예를 들어 ‘AI 글쓰기 기능’은 지나치게 넓은 정의입니다. 다음과 같이 바꾸면 제품의 목적과 평가 기준이 분명해집니다.
- 상품 정보로 쇼핑몰 상세 설명 초안 만들기
- 회의 녹취에서 결정 사항과 담당자 추출하기
- 고객 문의를 유형별로 분류하고 답변 초안 작성하기
- 계약서에서 불리한 조항과 검토가 필요한 부분 찾기
‘무엇이든 물어보는 AI’는 만들기 쉬워 보여도 사용자가 왜 비용을 지불해야 하는지 설명하기 어렵습니다. 반면 특정 업무의 처리 시간을 30분에서 5분으로 줄여주는 제품은 가치가 명확합니다.
기업의 AI 활용이 빠르게 늘고 있지만 실제 가치를 만드는 조직은 단순한 도구 배포보다 업무 흐름을 다시 설계하는 데 집중하고 있습니다. 맥킨지 조사에서도 AI로 성과를 내는 기업의 주요 특징으로 워크플로 재설계, 책임 구조와 거버넌스 강화가 제시됐습니다.
기존 제품 기획과 AI 제품 기획은 무엇이 다를까?
가장 큰 차이는 결과를 완전히 예측하기 어렵다는 점입니다.
일반적인 계산기 기능은 같은 값을 입력하면 항상 같은 답을 냅니다. 생성형 AI는 모델 버전, 입력 문장, 제공된 문서와 대화 맥락에 따라 결과가 달라질 수 있습니다. 정상적으로 작동하는 상황에서도 품질 편차가 생길 수 있다는 뜻입니다.
| 구분 | 기존 소프트웨어 | AI 제품 |
|---|---|---|
| 결과 | 규칙에 따라 일정함 | 확률적으로 달라질 수 있음 |
| 기획 중심 | 기능과 화면 | 업무 결과와 품질 기준 |
| 테스트 | 정답·오답 확인 | 다수 사례를 통한 평가 |
| 오류 대응 | 버그 수정 | 모델·프롬프트·데이터·흐름 점검 |
| 비용 구조 | 사용자 증가 시 비교적 예측 가능 | 입력·출력·도구 호출량에 따라 변동 |
| 사용자 역할 | 기능 직접 조작 | 지시, 검토, 승인 |
| 출시 이후 | 기능 개선 중심 | 평가 데이터와 실패 사례 지속 수집 |
| 위험 관리 | 장애와 보안 중심 | 오류 정보, 편향, 권한 오용까지 포함 |
AI 제품의 요구사항 문서에는 정상 작동 조건만 적어서는 부족합니다. 답을 모르는 경우, 자료가 부족한 경우, 서로 충돌하는 정보를 발견한 경우처럼 불확실한 상황에서 어떻게 행동할지도 정의해야 합니다.
AI가 꼭 필요한 문제인지 먼저 판단해야 한다
AI가 유행한다고 모든 제품에 생성형 AI를 넣을 필요는 없습니다. 정해진 규칙만으로 정확히 해결할 수 있는 문제라면 기존 방식이 더 저렴하고 안정적일 수 있습니다.
AI가 적합한 업무는 대체로 다음 특성을 가집니다.
- 문서·음성·이미지처럼 비정형 데이터를 다룬다.
- 사람마다 표현 방식이 다른 요청을 이해해야 한다.
- 경우의 수가 많아 모든 규칙을 미리 작성하기 어렵다.
- 초안 작성, 분류, 요약, 정보 추출이 필요하다.
- 어느 정도의 검토 절차를 둘 수 있다.
반대로 세금 계산, 잔액 확인, 권한 판정처럼 결과가 반드시 정확해야 하고 규칙이 명확한 업무는 일반 프로그램으로 처리하는 편이 낫습니다. AI를 사용하더라도 자연어 입력을 해석하는 부분에만 활용하고, 최종 계산과 결정은 검증된 규칙 엔진에 맡길 수 있습니다.
좋은 AI 제품은 모든 과정을 AI로 처리하지 않습니다. AI가 잘하는 일과 기존 소프트웨어가 더 잘하는 일을 구분합니다.
정확도보다 ‘허용 가능한 실패’를 먼저 정해야 한다
AI 제품 기획에서 “정확도를 높인다”는 목표만으로는 부족합니다. 어떤 오류가 얼마나 치명적인지 구분해야 합니다.
회의 내용을 한 문장 빠뜨리는 오류와 환자의 복용량을 잘못 안내하는 오류는 같은 기준으로 평가할 수 없습니다. 상품 설명의 문체가 어색한 문제와 고객의 환불을 잘못 승인하는 문제도 위험 수준이 다릅니다.
기획 단계에서는 최소한 다음 세 가지를 결정해야 합니다.
첫째, AI가 틀려도 쉽게 되돌릴 수 있는지 확인합니다. 이메일 초안은 발송 전에 수정할 수 있지만 자동 송금은 되돌리기 어렵습니다.
둘째, 사용자가 오류를 발견할 수 있는지 살펴봅니다. 원문과 요약을 함께 보여주면 누락을 확인할 수 있지만, 근거 없이 답만 제시하면 검증하기 어렵습니다.
셋째, 오류가 발생했을 때 피해 규모를 판단합니다. 위험이 큰 업무일수록 사람의 승인, 금액 제한, 접근 권한과 실행 기록이 필요합니다.
NIST의 생성형 AI 위험관리 지침은 제품의 목적과 사용 환경을 파악하고, 위험을 측정한 뒤 지속해서 관리하는 접근을 제시합니다. AI 위험 관리는 출시 직전의 보안 점검이 아니라 기획부터 운영까지 이어지는 과정으로 보는 것이 적절합니다.
PRD에 평가 기준과 테스트 사례를 함께 작성해야 한다
일반적인 제품 요구사항 문서에는 기능, 사용자 흐름, 예외 상황과 완료 조건이 포함됩니다. AI 제품의 PRD에는 여기에 평가 데이터와 품질 기준을 추가해야 합니다.
예를 들어 고객 문의 답변 AI를 기획한다면 “문의에 답변한다”가 아니라 다음과 같이 정의할 수 있습니다.
- 회사 정책에 없는 내용을 임의로 만들지 않는다.
- 환불 가능 여부를 근거 문서와 함께 제시한다.
- 고객의 개인정보를 답변에 불필요하게 노출하지 않는다.
- 정책이 모호한 경우 상담원에게 전달한다.
- 답변 작성에 걸리는 시간이 목표 범위를 넘지 않는다.
- 한 건을 처리하는 평균 모델 비용이 기준을 초과하지 않는다.
평가 사례도 정상적인 질문만으로 구성하면 안 됩니다. 오타가 많은 질문, 앞뒤가 모순되는 요청, 필요한 정보가 없는 상황, 규정을 우회하려는 요청도 포함해야 합니다.
AI 에이전트처럼 외부 도구를 사용하는 제품은 답변 품질 외에도 도구 선택, API 호출의 일관성, 작업 완료 여부, 지연 시간까지 평가해야 합니다. 실제 운영 환경과 유사한 사례를 반복 테스트하는 평가 체계가 제품의 안정성을 판단하는 핵심 수단이 됩니다.
평균 정확도보다 실패 사례의 분포가 중요하다
제품팀은 하나의 정확도 수치만 보고 출시 여부를 결정하기 쉽습니다. 그러나 평균 점수가 높더라도 특정 고객군이나 문서 유형에서 반복적으로 실패한다면 실제 제품 품질은 낮을 수 있습니다.
예를 들어 전체 답변의 92%가 적절하더라도 다음 문제가 숨어 있을 수 있습니다.
- 긴 문서를 입력하면 핵심 조항을 자주 누락한다.
- 표가 포함된 문서에서 숫자를 잘못 읽는다.
- 한국어와 영어가 섞인 문의에서 분류 성능이 낮다.
- 새로운 정책이 추가된 뒤 과거 정보를 계속 답한다.
- 권한이 없는 자료를 답변 근거로 사용한다.
따라서 평가 결과는 고객 유형, 입력 길이, 언어, 업무 난이도, 사용 모델과 기능별로 나눠 확인해야 합니다. 실패 사례를 분류하면 모델을 바꿔야 하는지, 검색 데이터를 보완해야 하는지, 화면에서 추가 정보를 받아야 하는지 판단할 수 있습니다.
단순히 “모델 성능이 부족하다”고 결론 내리면 해결책도 불분명해집니다. 좋은 제품팀은 실패를 재현 가능한 유형으로 바꿉니다.
사용자는 프롬프트를 잘 쓰지 않아도 되어야 한다
초기 AI 서비스는 사용자가 긴 프롬프트를 직접 작성하도록 요구하는 경우가 많았습니다. 하지만 일반 사용자는 모델을 조정하는 방법보다 자신의 업무를 빠르게 끝내는 데 관심이 있습니다.
사용자가 매번 역할, 문체, 출력 형식과 제한 조건을 상세하게 입력해야 한다면 제품이 해결해야 할 기획 부담을 사용자에게 넘긴 셈입니다.
좋은 AI 제품은 다음과 같이 입력 부담을 줄입니다.
- 필요한 정보를 단계별 질문으로 받는다.
- 목적에 맞는 기본 형식과 예시를 제공한다.
- 사용자의 업무 데이터에서 반복 설정을 불러온다.
- 선택지와 자연어 입력을 적절히 결합한다.
- 결과를 바로 수정하거나 다시 생성할 수 있게 한다.
- 자주 쓰는 작업을 템플릿으로 저장한다.
예를 들어 ‘보도자료를 작성해 주세요’라는 빈 입력창만 제공하기보다 발표 대상, 핵심 내용, 공개 일자, 인용문과 금지 표현을 각각 입력받는 편이 결과를 안정적으로 만들 수 있습니다.
AI 제품의 차별화는 모델 호출 창을 제공하는 데 있지 않습니다. 사용자가 좋은 결과를 얻는 데 필요한 맥락을 제품이 얼마나 자연스럽게 수집하고 관리하는지가 중요합니다.
AI의 답보다 근거와 수정 가능성을 함께 보여줘야 한다
AI 결과를 그대로 믿기 어려운 업무에서는 답변만 보여주는 인터페이스가 적합하지 않습니다. 사용자가 결과를 검토하고 수정할 수 있는 구조가 필요합니다.
사내 문서 검색 AI라면 답변과 함께 참고한 문서, 작성일과 해당 문장을 표시해야 합니다. 계약서 분석이라면 위험 조항만 설명할 것이 아니라 원문의 위치를 바로 확인할 수 있게 해야 합니다.
편집이 필요한 결과는 완성본처럼 고정해서 보여주기보다 수정 가능한 초안으로 제공하는 편이 좋습니다. 사용자가 일부 문장만 다시 생성하거나 원문과 비교하고, 잘못된 부분을 피드백할 수 있어야 합니다.
여기서 중요한 것은 AI가 틀릴 수 있다는 경고 문구를 붙이는 것만으로 책임을 다했다고 생각하지 않는 것입니다. 작은 안내문보다 오류를 쉽게 발견하고 복구할 수 있는 제품 구조가 더 효과적입니다.
AI 에이전트는 자율성보다 통제 범위를 먼저 설계해야 한다
AI 에이전트는 답변 생성에 그치지 않고 검색, 파일 수정, 메시지 발송과 시스템 입력 같은 작업을 수행할 수 있습니다. 에이전트의 가치가 커질수록 잘못된 행동이 발생했을 때의 위험도 함께 커집니다.
따라서 처음부터 모든 권한을 제공하기보다 단계적으로 자율성을 넓히는 방식이 안전합니다.
| 단계 | AI가 수행하는 일 | 권장 통제 방식 |
|---|---|---|
| 1단계 | 정보 조회와 답변 | 출처 표시와 피드백 |
| 2단계 | 초안·작업 계획 작성 | 사용자가 검토 후 실행 |
| 3단계 | 제한된 도구 실행 | 권한·횟수·금액 제한 |
| 4단계 | 여러 작업 연속 처리 | 중간 확인과 전체 실행 기록 |
| 5단계 | 조건에 따라 자동 실행 | 승인 규칙, 감시와 즉시 중단 기능 |
처음에는 AI가 주문 취소 방법을 안내하게 하고, 다음 단계에서는 취소 요청서를 작성하게 할 수 있습니다. 충분한 검증을 거친 뒤에야 일정 금액 이하의 주문을 직접 취소하도록 권한을 확대하는 방식입니다.
에이전트는 여러 도구를 연결한다고 무조건 좋아지지 않습니다. 도구와 에이전트 수가 늘어나면 오류 원인과 비용을 추적하기 어려워집니다. 가능한 한 단순한 구조로 시작하고, 정확도 목표를 충족한 뒤 작은 모델이나 효율적인 작업 흐름으로 비용과 속도를 최적화하는 접근이 현실적입니다.
추론 비용과 응답 속도도 제품 요구사항이다
기존 SaaS에서는 기능을 먼저 완성한 뒤 서버 비용을 최적화하는 경우가 많았습니다. AI 제품은 비용 구조가 사용자 경험과 요금제에 직접 연결되므로 기획 초기부터 계산해야 합니다.
고성능 모델을 사용하면 결과가 좋아질 수 있지만 응답이 느려지고 원가가 높아질 수 있습니다. 반대로 저렴한 모델만 사용하면 수익성은 좋아져도 사용자가 원하는 품질을 충족하지 못할 수 있습니다.
모든 요청을 같은 모델로 처리할 필요는 없습니다.
- 간단한 분류와 정보 추출은 작은 모델로 처리한다.
- 복잡한 판단이 필요한 요청만 고성능 모델로 보낸다.
- 반복 질문은 결과를 저장해 다시 활용한다.
- 긴 문서 전체보다 관련 구간만 찾아 모델에 전달한다.
- 실시간 처리가 필요 없는 작업은 비동기 작업 흐름으로 분리한다.
- 무료와 유료 요금제에서 사용할 수 있는 모델과 한도를 구분한다.
제품 지표에도 평균 응답 시간, 요청당 비용, 작업 완료당 비용을 포함해야 합니다. 요청 한 번의 비용이 낮아도 하나의 업무를 끝내기 위해 여러 번 다시 생성해야 한다면 실제 비용은 높습니다.
따라서 ‘API 호출당 비용’보다 ‘성공적으로 완료된 업무 한 건당 비용’을 보는 편이 정확합니다.
출시 후에는 사용자 수보다 업무 성공률을 봐야 한다
AI 기능을 출시하면 사용 횟수와 대화 수가 빠르게 늘 수 있습니다. 하지만 많은 대화가 제품 가치를 의미하지는 않습니다. 첫 답변이 좋지 않아 사용자가 반복 질문했을 가능성도 있기 때문입니다.
AI 제품에서는 다음 지표가 더 중요할 수 있습니다.
| 지표 | 확인할 내용 |
|---|---|
| 업무 완료율 | 사용자가 원하는 결과까지 도달했는가 |
| 첫 결과 채택률 | 첫 번째 결과를 그대로 사용했는가 |
| 수정 비율 | 결과를 얼마나 많이 고쳤는가 |
| 재시도 횟수 | 원하는 결과를 얻기 위해 몇 번 요청했는가 |
| 사람 전환율 | AI가 해결하지 못해 담당자에게 넘어갔는가 |
| 작업당 비용 | 한 업무를 완료하는 데 얼마가 들었는가 |
| 검토 시간 | 사용자가 결과 확인에 얼마나 시간을 썼는가 |
| 치명적 오류율 | 업무상 허용하기 어려운 오류가 있었는가 |
예를 들어 AI가 보고서 작성 시간을 60분에서 20분으로 줄였다면 결과를 일부 수정했더라도 가치가 있습니다. 반대로 초안은 10초 만에 생성되지만 검증과 수정에 70분이 필요하다면 좋은 제품이라고 보기 어렵습니다.
클릭률이나 대화량만 측정하면 AI가 실제 업무를 개선했는지 판단하기 어렵습니다.
모델보다 데이터와 업무 흐름이 차별화를 만든다
비슷한 성능의 모델을 여러 기업이 사용할 수 있는 환경에서는 모델 선택만으로 제품을 오래 차별화하기 어렵습니다. 특정 업무에 필요한 데이터와 사용 흐름이 더 중요한 경쟁력이 될 수 있습니다.
예를 들어 법률 AI 제품의 가치는 법률 용어를 사용한다는 데 있지 않습니다. 최신 법령과 판례를 정확히 찾고, 근거를 표시하며, 변호사의 검토 방식에 맞게 결과를 구성하는 데 있습니다.
제품팀은 다음 자산을 축적해야 합니다.
- 실제 사용 환경을 반영한 평가 사례
- 사용자가 채택하거나 수정한 결과 데이터
- 산업별 용어와 업무 규칙
- 외부 시스템과의 연동 구조
- 반복적으로 발생하는 실패 유형
- 사용자의 승인과 책임이 필요한 지점
AI 도입이 넓어질수록 단순한 생성 기능은 흔해집니다. 스탠퍼드 AI 인덱스는 기업의 AI 활용이 빠르게 확산되고 있으며, 동시에 기술 활용을 평가하고 관리하는 체계의 중요성도 커지고 있다고 분석합니다. 이는 제품 경쟁이 모델 보유 여부보다 실제 적용 능력으로 이동하고 있음을 보여줍니다.
AI 제품 기획자는 무엇을 더 알아야 할까?
AI 제품 기획자가 직접 모델을 개발할 필요는 없습니다. 다만 제품 의사결정에 필요한 기본 구조는 이해해야 합니다.
프롬프트만 수정하면 해결되는 문제인지, 외부 문서를 검색해 제공해야 하는지, 별도 학습이 필요한지 구분할 수 있어야 합니다. 모델의 입력 한계, 지연 시간, 사용 비용과 개인정보 처리 방식도 알아야 합니다.
특히 다음 질문에 답할 수 있어야 합니다.
- AI가 답변에 사용할 정보는 어디에서 가져오는가?
- 해당 정보는 언제 갱신되는가?
- 사용자가 볼 수 없는 자료에 접근할 가능성은 없는가?
- 답변이 틀렸는지 어떤 기준으로 측정하는가?
- 모델이나 프롬프트가 바뀌면 기존 품질을 어떻게 확인하는가?
- 실패했을 때 사용자에게 어떤 대안을 제공하는가?
- 실행 권한은 어디까지 허용하는가?
- 작업 한 건을 처리하는 실제 원가는 얼마인가?
AI 제품 기획자의 역할은 모델의 능력을 과장하는 것이 아닙니다. 불확실한 기술을 사용자가 신뢰할 수 있는 제품으로 바꾸는 일에 가깝습니다.
AI 시대의 제품 기획은 이렇게 달라져야 한다
AI 제품은 요구사항을 작성하고 개발한 뒤 출시하는 일회성 과정으로 완성되지 않습니다. 실제 사용자 사례를 모으고, 실패를 평가 데이터에 추가하며, 모델과 업무 흐름을 계속 개선해야 합니다.
기획의 출발점도 기능에서 업무 결과로 바뀌어야 합니다. AI가 무엇을 생성할 수 있는지가 아니라 사용자의 시간과 비용을 얼마나 줄이고, 결과의 품질을 얼마나 높이는지 확인해야 합니다.
무엇보다 AI가 잘했을 때의 모습만 설계해서는 안 됩니다. 자료가 없을 때, 답을 확신하지 못할 때, 잘못된 작업을 실행하려 할 때 제품이 어떻게 멈추고 도움을 요청할지까지 정해야 합니다.
AI 시대에 좋은 제품은 가장 많은 기능을 가진 제품이 아닙니다. 사용자가 원하는 업무를 예측 가능한 품질과 비용으로 끝낼 수 있게 만드는 제품입니다.
자주 묻는 질문(FAQ)
Q1. 기존 제품에 챗봇을 추가하면 AI 제품이 되나요?
기술적으로 AI 기능이 포함된 제품은 될 수 있지만, 사용자 가치가 생긴다고 보기는 어렵습니다. 챗봇 자체보다 사용자의 특정 업무를 얼마나 빠르고 정확하게 완료하는지가 중요합니다.
Q2. AI 제품의 정확도는 몇 퍼센트가 되어야 출시할 수 있나요?
정해진 기준은 없습니다. 오류의 피해가 작고 사용자가 쉽게 수정할 수 있는 업무는 비교적 낮은 정확도에서도 출시할 수 있지만, 의료·금융·결제처럼 위험이 큰 업무는 훨씬 높은 신뢰성과 승인 절차가 필요합니다.
Q3. AI 제품 MVP에는 어떤 기능을 넣어야 하나요?
하나의 명확한 업무, 최소한의 입력 과정, 결과 수정 기능과 기본 평가 체계를 우선하는 것이 좋습니다. 여러 기능을 추가하기보다 특정 사용자의 반복 업무 하나를 제대로 해결하는 편이 검증에 유리합니다.
Q4. AI 결과에 항상 출처를 표시해야 하나요?
모든 창작 결과에 출처가 필요한 것은 아닙니다. 다만 사내 정보 검색, 법률, 의료, 금융처럼 사실 확인이 중요한 업무에서는 근거 자료와 해당 위치를 함께 제공하는 것이 바람직합니다.
Q5. AI 제품의 핵심 성과 지표는 무엇인가요?
대화 수보다 업무 완료율, 결과 채택률, 수정 시간, 치명적 오류율과 완료된 작업당 비용이 중요합니다. 제품 목적에 따라 사람에게 전달되는 비율과 고객이 절약한 시간도 함께 측정할 수 있습니다.