뉴스로 돌아가기
혁신AI Understanding 브리핑

연구에 따르면 LLM은 불가능한 질문을 인식할 수 있지만 종종 기권하지 못하는 경우가 많습니다.

EMNLP 2026에 승인된 논문에 따르면 언어 모델은 일부 수학 및 코드 질문이 구조적으로 대답할 수 있는지 여부를 나타내지만 해당 신호를 거부 행동으로 전달하지 못한다고 보고합니다.

5 min readRead the primary source
Source-provided image accompanying Study finds LLMs can recognize impossible questions but often fail to abstain
기본 소스 문서녹음된 소스
출판사
arxiv.org
소스 링크
arxiv.orghttps://arxiv.org/abs/2608.29109
소스 유형
기본 문서 — 우리가 직접 읽는 공식 발표, 논문, 서류 또는 자사 페이지입니다.
맥락60초 안에 이해하세요

여기서 시작하세요

주요 용어

API(애플리케이션 프로그래밍 인터페이스)
한 소프트웨어 시스템이 다른 시스템에 요청을 보내고 응답을 받는 구조화된 방식입니다.
훈련 후
명령어 튜닝, 선호도 최적화, 안전 튜닝 등 사전 학습 이후 적용되는 학습 단계입니다.
교정
모델의 신뢰도 점수가 실제 정확성 확률과 얼마나 일치하는지입니다.
자신을 테스트해 보세요AI 모델 설명 퀴즈

무슨 일이 일어났나요?

연구원 Yucheng Du와 Xiyang Hu는 왜 명령 조정 언어 모델이 cot(-540°) 계산 또는 (1).startswith("1") 평가와 같이 유효한 대답이 없는 질문에 대답하는 이유를 조사했습니다. 17억에서 700억 개의 매개변수에 이르는 모델 전체에서 응답 가능한 프롬프트와 구조적으로 불가능한 프롬프트를 구분하는 숨겨진 상태 방향을 찾았다고 보고합니다. 이 논문은 이것이 인정이 있음을 의미하지만 기권과 확실하게 연결되어 있지는 않다고 주장합니다.

이 논문은 특정 신뢰성 실패에 초점을 맞추고 있습니다. 대규모 언어 모델은 답변을 거부하는 대신 구조적으로 답변할 수 없는 프롬프트에 답변합니다. 그 예로는 삼각 표현식 cot(-540°) 및 코드 표현식 (1).startswith("1")이 있습니다. 저자는 이러한 실패를 일반적인 사실 오류와 구별합니다. 문제는 질문의 구조에 유효한 답변이 존재하는지 여부입니다.

Du와 Hu는 17억에서 700억 개의 매개변수에 걸쳐 명령 조정 모델에 대한 실험을 보고합니다. 그들은 모델의 숨겨진 상태에서 단일 선형 방향이 응답 가능한 프롬프트와 구조적으로 불가능한 수학 및 코드 프롬프트를 분리한다고 말합니다. 저자의 해석에서 이러한 분리는 모델이 응답을 생성하기 전에 불가능함을 나타냄을 보여줍니다.

보고된 인식 방향은 논문에서 저자가 훈련된 유해 콘텐츠 거부와 연관시키는 정식 안전 거부 방향이라고 부르는 것과 거의 직교했습니다. 도메인 내 행동에서 정의된 무효성 인식 방향은 인식 방향에 더 가깝지만 부분적으로만 정렬되어 안전 거부 방향과 거의 직교합니다.

저자는 또한 인식 방향에 따른 세대 시간 조정이 구조적 수학 및 코드 셀에 대한 양 방향 및 용량 반응 방식으로 무효 인식 동작을 변경했다고 보고합니다. 무작위 방향은 보고된 것과 동일한 효과를 생성하지 않았습니다. 기본 모델과 명령 조정 모델 간의 비교는 낮은 코사인 기하학이 사전 훈련 끝점에 이미 존재한다는 것을 추가로 시사했습니다. 이 논문에서는 실패가 인코딩 실패보다 라우팅 실패로 더 잘 설명된다는 결론을 내렸습니다. 모델에는 허용 가능한 답변이 없다는 사용 가능한 신호가 있지만 거부 경로가 이를 사용하도록 정렬되지 않았습니다.

소스 세부정보: arxiv.org ↗

왜 중요한가요?

결과는 모델이 문제를 인식할 수 없기 때문에 불가능한 질문에 답한다는 단순한 설명에 도전합니다. 논문의 해석이 유효한 경우 신뢰성을 향상하려면 내부 불가능 신호를 명시적인 거부 또는 설명으로 변환하는 라우팅 또는 의사 결정 메커니즘이 필요할 수 있습니다. 그러나 이 연구는 인쇄 전 수준의 연구 보고서이며 해당 보고서의 초록에서는 테스트된 수학과 코드 프롬프트 또는 모델을 넘어 결과가 얼마나 광범위하게 일반화되는지 입증하지 않습니다.

논문 주장의 실질적인 중요성은 제안된 진단입니다. 모델이 프롬프트가 불가능하다는 것을 표현할 수 없는 경우 개발자는 더 나은 훈련 데이터나 표현이 필요할 수 있습니다. 그러나 모델이 이미 해당 신호를 전달하고 이에 따라 조치를 취하지 못하는 경우 개입 지점은 대신 내부 인식, 응답 선택 및 기권 간의 연결이 될 수 있습니다.

불가능한 질문에 대한 유창한 대답은 근본적으로 유효하지 않지만 거절하는 것보다 더 유용해 보일 수 있기 때문에 이러한 구별이 중요합니다. 구조적 불가능성을 인식하는 시스템은 대신 프롬프트에 허용 가능한 답변이 없다고 명시하거나, 관련 제한 사항을 설명하거나, 사용자에게 입력 내용을 수정하도록 요청할 수 있습니다. 소스는 배포된 제품이나 사용자 결과의 입증된 개선 사항을 보고하지 않으므로 해당 응용 프로그램은 확립된 결과가 아닌 암시로 남아 있습니다.

안전 거부와의 비교도 결과적입니다. 논문에서는 불가능한 프롬프트를 인식하는 것과 관련된 내부 방향이 유해 콘텐츠 거부와 관련된 방향과 거의 직교한다고 보고합니다. 이는 모든 거부를 하나의 일반적인 기능으로 처리하면 콘텐츠가 안전하지 않기 때문에 거부하는 것과 질문의 형식이 잘못되었거나 유효한 해결책이 없기 때문에 기권하는 것 사이의 중요한 구별을 놓칠 수 있음을 의미합니다.

결과는 명확한 한계를 가지고 읽어야 합니다. 소스는 모델 이름, 벤치마크 크기, 정확도 테이블, 오류율, 조정 비용 또는 독립적 복제를 제공하지 않습니다. 모든 모델이 동일한 기하학적 구조를 가지고 있다는 점, 보고된 방향이 언어나 양식에 관계없이 안정적이라는 점, 스티어링이 유용성의 원치 않는 변화를 방지한다는 점을 보여주지는 않습니다. 이 논문은 EMNLP 2026에 승인된 것으로 확인되었지만 제공된 자료는 arXiv 초록으로 남아 있으며 그 자체로 주장의 전체 강점을 확립하지 못합니다.

Interactive Mechanism

대화형 메커니즘: 실제로 작동하는 방식

이 개발의 이면에 있는 기본 기술을 대화식으로 살펴보세요.

Agent Lifecycle Stage:
1
User Intent & Planning: "Audit customer refund request #4092 and settle payment."
2
Tool Calling: Emits structured JSON call crm_get_transaction(id='4092').
3
Guardrail & Verification:🛡️ Paused: High-value action requires human operator sign-off.
4
Final Settlement: Refund recorded, email receipt dispatched, and audit log stored.
Core takeaway: An AI agent is not just a language model—it is a closed loop of planning, tool invocation, and environment feedback. Production systems require self-healing retries and strict human approval guardrails.
대화형 개념 확인+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

다음에 무엇을 볼 것인가

주요 후속 조치는 보고된 인식 신호가 광범위한 테스트를 통과하고 합법적인 답변을 억제하지 않고 배포된 시스템에서 사용될 수 있는지 여부입니다. 이 논문은 방향을 따라 조향하면 양 방향 및 용량 반응 방식으로 행동이 변경되는 반면 무작위 방향은 그렇지 않다고 보고합니다. 이 개입이 실제 보정을 향상하는지, 불필요한 거부가 얼마나 자주 발생하는지, 나중에 훈련 후 형상이 변경되는지 여부를 테스트하는 추가 작업이 필요합니다.

핵심 질문은 범위입니다. 보고된 실험은 구조적 수학 및 코드 프롬프트를 다루지만 초록에서는 동일한 인식 및 라우팅 패턴이 일상적인 사실 질문, 모호한 지침, 도구 사용 또는 다중 모드 시스템에 나타나는지 여부를 밝히지 않습니다. 이러한 설정을 테스트하면 제안된 진단이 선택된 프롬프트의 좁은 속성인지 아니면 더 넓은 모델 동작인지 여부가 표시됩니다.

조정 결과는 신중하게 복제할 가치가 있습니다. 저자는 인식 방향을 따라 조종할 때 양방향, 용량 반응 동작을 보고하고 무작위 방향에서는 비슷한 효과가 없다고 보고합니다. 후속 연구에서는 이러한 조정이 유용한 작동 지점에서 기권을 향상하는지, 아니면 허위 거부를 생성하는지, 답변 스타일을 변경하는지, 모델 버전 및 디코딩 설정 전반에 걸쳐 취약해지는지 여부를 측정해야 합니다.

개발자와 평가자는 또한 인정과 행동을 구분하는 더 나은 측정 기준을 관찰해야 합니다. 모델은 내부적으로 불가능한 프롬프트를 감지했지만 계속 응답하거나 이유를 정확하게 식별하지 않고 거부할 수 있습니다. 모델의 인식 신호와 최종 동작을 모두 기록하는 평가는 논문의 라우팅 실패 가설을 보다 직접적으로 테스트할 수 있습니다.

훈련 및 배포에 관해 중요한 미지수가 남아 있습니다. 소스는 사후 훈련이 인식 및 거부 경로를 안정적으로 정렬할 수 있는지 여부, 개입에 API를 통해 사용할 수 없는 숨겨진 상태에 대한 액세스가 필요한지 여부 또는 접근 방식이 안전 보호 장치와 어떻게 상호 작용하는지 설정하지 않습니다. 이러한 질문은 결과가 실제적인 신뢰성 기술이 되는지 아니면 모델 내부에 대한 설명적 결과로 남아 있는지를 결정합니다.

관련 가이드 및 퀴즈

AI 모델 설명ChatGPT와 LLMAI 윤리AI 트레이닝알고 있는 내용을 테스트해 보세요. 무료 AI 퀴즈를 시도해 보세요.용어집에서 AI 용어를 찾아보세요.AI 모델 출시 추적기를 따르세요.
이것이 유용하다고 생각하시나요?