무슨 일이 일어났나요?
2026년 8월 19일 arXiv에 게시된 단일 저자 사전 인쇄에서는 기계적 해석 방법(패칭, 그라데이션 속성, 헤시안 벡터 곱 및 하위 집합 개입)을 하나의 설계 측정 문제의 사례로 처리할 것을 제안하고 장난감 제어 시스템인 Tracr, GPT-2-small 및 Qwen-2.5-7B에 대한 테스트를 보고합니다.
"Mechanistic Tomography: Designed Measurement for Control-Oriented Interpretability"라는 논문은 Vijay Erramilli의 공로를 인정받았으며 13개의 그림과 함께 24페이지에 기계 학습 및 인공 지능 항목에 나열되어 있습니다. 그것의 시작 관찰은 해석 가능성 연구자들이 수량 모델이 표현된 상태, 구성 요소 효과, 구성 요소 간의 상호 작용 및 개입에 대한 반응을 직접 노출하지 않기를 원하며 기존 기술은 다양한 액세스 가정 하에서 이러한 수량을 측정하고 동일한 것을 목표로 하지 않을 수 있다는 것입니다. 저자는 활성화 패칭, 그래디언트 귀속, 헤센 벡터 곱 및 하위 집합 개입을 경쟁 방법으로 처리하는 대신 측정 구조를 공유하고 공통 형식으로 작성될 수 있다고 주장합니다.
그 일반적인 형태는 선형 모델 y = Ax + w입니다. 선택된 기반과 일련의 개입이 주어지면 A는 실행된 개입을 인코딩하고 x는 연구원이 복구하려는 목표 맵이며 w는 선형 형식이 포착하지 못하는 것(비선형 응답, 샘플링 오류 및 기반의 잘못된 지정)을 흡수합니다. 프레이밍은 단일 알고리즘이 아닌 절차를 생성합니다. 액세스 수준에서 사용할 수 있는 가장 저렴한 측정으로 시작하고 실제로 작동하려는 규모에서 보류된 개입을 평가하고 단순한 불일치를 보정한 다음 구조화된 잔차가 남아 있는 경우에만 측정 제품군을 확대합니다.
제어는 모델을 조종하는 데 사용되는 추정치가 피드백 루프 내부의 관찰자가 된다는 주장에 대한 논문의 검증 설정입니다. 두 개의 숨겨진 마르코프 모델로 구축된 시스템에서 추상 보고서는 관찰자 오류가 증가함에 따라 증가하는 오류를 제어하고, 방해 상태가 이동하는 동안 목표 수량이 향상되는 실패 모드를 표시합니다. 순방향 액세스에서는 희소 집계 측정이 좌표별 패치보다 개입이 적고 유한 효과 맵을 복구했다고 말합니다. 그래디언트 액세스를 통해 유한 프로브는 로컬 속성 맵을 개선했으며, 리프팅 측정 및 헤시안 벡터 제품은 1차 맵이 놓친 상호 작용을 복구했습니다. Tracr(알려진 실제값을 사용하여 컴파일된 변압기)을 사용한 실험은 필요한 측정 제품군이 선택한 기준에 따라 다르다는 것을 나타냅니다.
두 가지 언어 모델 결과가 명시되어 있습니다. 이 문헌에서 오랫동안 연구된 회로인 GPT-2-small의 간접 개체 식별 작업에서 Name Mover와 Negative Name Mover 헤드 간의 상호 작용은 테스트된 세 가지 교차 그룹 쌍 중에서 가장 큰 유지 예측 용어였습니다. Qwen-2.5-7B에서 유한 보정은 거부 응답의 추가 맵을 적절하게 만들었으므로 유지 오류는 쌍별 상호 작용 항 추가를 지원하지 않았습니다. 초록에서는 효과 크기, 스파스 접근 방식으로 절약된 개입 수, 사용된 프롬프트 세트 또는 샘플 크기 또는 좌표 패치 이외의 기준선을 보고하지 않습니다. 관련 Zenodo 레코드는 arXiv 항목과 함께 나열됩니다. 그 내용은 초록 페이지에 설명되어 있지 않습니다.
왜 중요한가요?
해석 가능성 결과는 모델 동작을 설명하는 것뿐만 아니라 모델 동작을 조종하는 데 점점 더 많이 사용되고 있습니다. 이 논문의 기여는 내부 지도가 해당 용도에 충분히 정확한지 여부에 대한 테스트와 다른 것이 바뀌는 동안 조향 개입이 성공적으로 보일 수 있다는 경고입니다.
많은 해석 가능성 작업은 모델에 대한 결과로 보고됩니다. 이 어텐션 헤드가 그렇게 하고, 이 기능이 그것을 인코딩합니다. 배포 압력으로 인해 질문이 바뀌었습니다. 거부 조정, 활성화 편집 및 회로 수준 모니터링은 모두 내부 추정을 사용하여 동작을 변경하므로 해당 추정의 정확성은 학문적 정교함보다는 엔지니어링 요구 사항이 됩니다. 설계된 측정에 따라 방법을 캐스팅하면 그 위에 구축된 개입을 신뢰할 수 있기 전에 어느 정도의 측정이 필요한지, 어떤 액세스 수준에서 필요한지 묻는 어휘가 제공됩니다.
지속 개입 테스트는 논문에서 가장 이식성이 뛰어난 아이디어입니다. 해석 가능성 주장은 이를 적합하게 하는 데 사용된 것과 동일한 개입을 사용하여 검증되는 경우가 많으며, 이로 인해 적합해진 곡선과 실제 메커니즘을 구별하기가 어렵습니다. 피팅에서 보류된 개입을 유지하고 사용하려는 규모에서 예측을 요구하는 것은 해석 가능성이 고르지 않게 적용되는 통계 및 제어 분야의 친숙한 분야입니다. 이는 또한 실무자가 논문의 광범위한 형식을 수용하지 않고도 채택할 수 있는 기준이기도 합니다.
성가신 상태 결과는 안전과 관련된 주의 사항이지만 장난감 설정에 명시되어 있습니다. 개입이 목표 수량을 이동하면서 다른 것을 조용히 이동하는 경우 목표만 추적하는 평가는 성공을 보고합니다. 이 패턴은 관련 없는 동작을 전환하면서 원치 않는 출력에서 모델을 멀어지게 하는 것에 대한 실제 우려 사항에 매핑됩니다. 논문에서는 이를 언어 모델이 아닌 two-HMM 시스템에서 설명하고 있으며 초록에서는 달리 주장하지 않습니다.
Qwen-2.5-7B 결과는 추가된 복잡성을 줄여 주는데, 이는 해석 가능성 도구가 증가하는 경향이 있기 때문에 주목할 가치가 있습니다. 거부 응답에 대한 더 간단한 추가 설명은 보류 테스트에서 살아남았으며 데이터는 상호 작용 조건을 정당화하지 못했습니다. 상호 작용 항이 예측 가중치를 전달한 GPT-2-small 결과와 함께 읽으면 적절한 양의 기계가 고정된 방법론적 선택이 아니라 모델, 작업 및 기반별 실증적 질문이라는 의미입니다.
대화형 메커니즘: 실제로 작동하는 방식
이 개발의 이면에 있는 기본 기술을 대화식으로 살펴보세요.
In AI, what are a model's "parameters"?
다음에 무엇을 볼 것인가
보류된 테스트가 더 큰 모델과 독립 팀에 의해 복제되는지 여부, 코드 및 개입 세트를 사용할 수 있는지 여부, 결과가 동료 검토를 통과하는지 여부.
즉각적인 공개 질문은 규모입니다. 보고된 언어 모델 증거는 2019년에 출시된 1억 2400만 매개변수 모델인 GPT-2-small에 대한 하나의 작업과 70억 매개변수 Qwen 모델에 대한 하나의 거부-응답 맵입니다. 희소 집계 측정이 순방향 전달에 비용이 많이 들고 액세스가 종종 API로 제한되는 현재 프런티어 규모 시스템에서 개입 수 이점을 유지하는지 여부는 추상에서 언급된 내용에서 다루어지지 않습니다. 다른 모델군에 대한 독립적 복제는 절차가 일반화되는지 또는 이러한 경우에 맞게 조정되는지를 보여줍니다.
해당 수표의 가용성이 중요합니다. 목록에는 관련 Zenodo DOI 및 TeX 소스가 포함되어 있지만 추상 페이지에는 릴리스된 코드, 개입 세트 또는 기록된 측정값이 설명되어 있지 않습니다. 측정 설계 주장을 재현하려면 정확한 개입 패밀리와 기반이 필요합니다. 논문 자체 Tracr 결과에 따르면 필요한 패밀리는 기반에 따라 달라지기 때문입니다. 독자들은 또한 이 책이 저자가 한 명만 기재되어 있고 초록 페이지에 소속이 명시되어 있지 않으며 저널이나 컨퍼런스 장소가 없는 버전 1의 사전 인쇄라는 점에 유의해야 합니다. 동료 검토를 거치지 않았습니다.
마지막으로, 유지 예측 표준이 이 문서 외부에서 채택되는지 살펴보세요. 해석 가능성은 채택률이 고르지 않은 여러 가지 제안된 평가 원칙(충실성 측정항목, 인과관계 스크러빙, 절제 기준선)을 축적했습니다. 조정 및 모니터링 작업을 수행하는 그룹이 회로 주장과 함께 보류된 개입 오류를 보고하기 시작하면 단층촬영 형식 자체가 인기를 얻든 안 받든 이는 구체적인 효과가 될 것입니다. 똑같이 관찰할 가치가 있는 것은 성가신 상태 실패 모드가 실제 언어 모델에서 시연되는지 여부입니다. 이를 통해 장난감 주의 사항을 평가 요구 사항으로 바꿀 수 있습니다.