AI는 왜 자신있게 거짓말을 할까? 클로드를 '잔인할 정도로 정직하게' 만드는 방법
요즘 AI를 쓰다보면 이런 경험, 한 번쯤 해보셨을 거예요.
"2024년 노벨 물리학상 수상 논문 링크 좀 줘"라고 물었는데, 그럴듯한 제목, 저자, URL까지 완벽하게 만들어서 내놓는다. 클릭하면? 404 에러.
AI가 무능해서가 아닙니다. 너무 친절해서, 너무 자신감 있어 보이고 싶어서 생기는 일입니다.

1. 핵심은 '자신감'이 아니라 '정확성'이다
이프롬프트는 아주 간단한 철학에서 시작합니다.
너의 최우선 순위는 자신감 있어 보이는 것이 아니다. 너의 최우선 순위는 정확하고, 명확하며, 네가 무엇을 알고 무엇을 모르는지 투명하게 밝히는 것이다.
이 문장 하나가 AI의 행동을 완전히 바꿉니다. 대부분의 AI 모델은 학습 과정에서 "모른다"고 말하면 벌점을 받도록 설계되어 있습니다. 그래서 모르면 지어냅니다. 이를 할루시네이션(Hallucination)이라고 부르죠.
Anthropic(클로드를 만든 회사)은 이 문제를 정면으로 인정했습니다. 최신 모델인 Claude Opus 4.7은 92%의 정직도(honesty rate)를 기록했다고 발표했습니다. 없는 도구를 요청하거나 없는 문맥을 참조했을 때, 환각을 일으키지 않고 거절하거나 불확실성을 인정하는 비율을 측정한 겁니다. 이전 모델보다 훨씬 높은 수치입니다.
개발자들의 체감도 비슷합니다. 한 개발자는 자신의 React 코드에서 AI가 생성한 코드의 42%에서 존재하지 않는 import나 함수를 만들어냈다고 고백했습니다. 이게 바로 우리가 매일 겪는 AI의 '친절한 거짓말'입니다.
2. 프롬프트 완벽 해부
이미지에 나온 프롬프트는 2가지 원칙으로 나뉩니다. 그대로 복사해서 쓰면 됩니다.
원칙 1: UNCERTAINTY - 불확실성을 숨기지 마라
확실하지 않으면, 확실하지 않다고 명확하게 말해.
AI에게 아래 문구를 쓰도록 강제합니다.
- "I'm not certain, but..."
- "You should verify this..."
- "I may be wrong here, but..."
- "Based on the information available to me..."
- "This is my best estimate, not a confirmed fact."
그리고 가장 중요한 규칙: "확실하지 않은 주장을 사실처럼 말하지 마라. 맥락이 부족하면 무엇이 부족한지 말하고, 여러 가능성이 있으면 하나인 척하지 말고 모두 설명해라."
원칙 2: SOURCES - 출처를 지어내지 마라
출처를 발명하지 마라.
절대 지어내면 안 되는 것들:
- 논문 제목, URL, 저자, 연구 결과, 통계, 책, 판례, 인용문, 기업 보고서, 역사적 참조
이걸 금지하는 것만으로도 AI 답변의 90% 환각이 사라집니다.
3. 어떻게 적용해야 진짜 효과가 날까?
이 프롬프트는 일회성 질문에 붙이는 것보다, 클로드의 시스템 설정에 박아두면 효과가 200%입니다.
[실전 적용법]
- Claude.ai 접속 > 왼쪽 하단 프로필 사진 클릭 > Settings
- General > Instructions for Claude 또는 Custom Instructions 필드 찾기
- 이미지의 전문을 그대로 붙여넣기
- 맨 위에 이 문장 추가: "You are committed to honesty, accuracy, and epistemic humility above all else."
이제부터 당신이 무엇을 물어봐도, 클로드는 이렇게 답하기 시작합니다.
"이 부분은 제가 확신할 수 없습니다. 2024년 이후 데이터는 제 학습 데이터에 없으니, 공식 사이트에서 한번 더 확인해보시는 걸 추천합니다. 하지만 현재까지 알려진 정보로는..."
이게 바로 우리가 원하는 모습입니다. 가짜 자신감보다, 약간 망설이는 진짜 정직함이 훨씬 더 유용합니다.
4. 정직한 AI가 더 유능한 AI다
Anthropic의 최근 연구 방향은 명확합니다. 더 똑똑하게 만드는 것보다, "모른다고 말할 줄 아는" AI를 만드는 것. 실제로 Opus 4.8 업데이트의 핵심 메시지도 "I'm not sure"라고 말할 수 있는 능력이라고 강조하고 있습니다.
AI를 쓰는 우리의 자세도 바뀌어야 합니다. AI를 '모든 걸 아는 만능 비서'로 대하면 실망합니다. '불확실성을 솔직하게 인정하고 나와 함께 추론하는 동료'로 대하면, 생산성은 오히려 3배가 됩니다.
당신의 클로드는 지금도 너무 착해서 거짓말을 하고 있을지 모릅니다. 오늘, 그 착한 거짓말을 멈추게 해주세요. 정직함이 최고의 프롬프트 엔지니어링입니다.
[보너스] 복사해서 바로 쓰는 최종 프롬프트
You are committed to honesty, accuracy, and epistemic humility above all else.
Your priority is not to sound confident. Your priority is to be correct, clear, and transparent about what you know, what you do not know, and what you are inferring.
Follow these rules in every response:
1. UNCERTAINTY
If you are not fully certain about a fact, say so clearly.
Use phrases like: "I'm not certain, but..." / "You should verify this..." / "I may be wrong here, but..."
Never state uncertain claims as facts. If context is missing, say what is missing. If there are multiple plausible answers, explain them all.
2. SOURCES
Do not invent sources. Never fabricate: paper titles, URLs, authors, studies, statistics, books, legal cases, quotes, company reports, historical references.
If you cannot find a real source, say you cannot find it.

와인병다육이세상사는이야기
창조적이고 유니크한 와인병다육이의 세상사는 이야기
kenny762.tistory.com
'컴퓨터,AI' 카테고리의 다른 글
| 노트북LM이 바로 그 두번째 뇌가 되어주고 있습니다. (0) | 2026.08.05 |
|---|---|
| 30 아름다운 색상 왜 이렇게 예쁠까? (0) | 2026.08.05 |
| 모든 것의 시작 프리랜서 내 스킬을 세계에 팔다 (0) | 2026.08.05 |
| 낡은 사진 속 할아버지의 미소를 다시 살리는 법 (0) | 2026.08.04 |
| 세련된 취향의 완성, 버머스의 초록 (0) | 2026.08.04 |
댓글