Toolformer 및 독학 도구 사용
Toolformer는 언어 모델이 계산기, 검색 엔진, 번역기와 같은 외부 도구를 호출하는 시기와 방법을 스스로 학습할 수 있는 2023년 Meta AI 방법입니다.
개요
Instead of humans labeling tool calls, the model generates and filters its own training examples, then fine-tunes on the ones that actually help.
심층 분석
Schick 외의 Toolformer. Meta AI에서는 역설을 다룹니다. 대형 모델은 언어에는 뛰어나지만 산술, 새로운 사실 및 정확한 조회에는 좋지 않습니다. 훈련 루프는 자체 감독됩니다. 모델에는 API 호출 구문을 보여주는 사람이 작성한 몇 가지 예가 제공되며, 큰 텍스트 코퍼스의 여러 위치에 후보 호출(특수 토큰으로 포장됨)을 삽입하라는 메시지가 표시됩니다. 각 후보 호출이 실제로 실행되고 결과가 이어집니다. 주요 필터링 단계는 API 결과가 호출하지 않거나 다르게 호출하는 것보다 다가오는 실제 텍스트에 대한 모델의 복잡성을 낮추는 경우에만 도구 호출을 유지합니다. 그런 다음 필터링된 자체 생성 데이터 세트를 기반으로 모델을 미세 조정하여 계산기, QA 시스템, 검색 엔진, 번역기, 달력 등 5가지 도구를 호출하는 방법을 학습합니다.
기술적 통찰력
결정적인 아이디어는 자기 감독 필터링 목표입니다. 각 후보 위치에 대해 Toolformer는 삽입된 API 결과와 API 결과가 없는 다음 토큰 예측의 손실을 비교합니다. 손실을 임계값 이상으로 줄이는 통화는 유지됩니다. 쓸모없거나 시끄러운 전화는 무시됩니다. 즉, '올바른' 도구 사용에 대해 사람이 주석을 달 필요가 없으며 모델 자체가 어떤 호출이 실제로 유익한지 결정하고 배치와 인수를 공동으로 학습한다는 의미입니다.
전략적 영향
비용 및 예산
아키텍처 결정은 수년 동안 성능과 운영 비용을 결정합니다.
더 명확한 결정들
기술 교육은 팀이 최신 스택뿐만 아니라 올바른 스택을 선택하는 데 도움이 됩니다.
품질 관리
더 나은 엔지니어링 선택은 생산 시 신뢰성 사고를 줄입니다.
Toolformer의 미래와 독학 도구 사용
Toolformer는 오늘날의 도구 사용 및 함수 호출 에이전트를 시드했습니다. 프론티어는 고정된 소수의 도구에서 런타임 시 발견되는 수십 또는 수백 개의 도구로 이동하고 있으며 모델은 어떤 도구를 호출할지 추론하고 호출을 연결하며 오류를 처리합니다. 강화 학습 및 에이전트 루프와 더 긴밀하게 통합되고 새로운 API에 대한 즉석 학습이 가능해 독학 도구 사용이 전문화된 미세 조정이 아닌 표준 기능이 될 수 있습니다.
실제 구현
숫자 답을 추측하는 대신 정확한 산술 계산을 얻기 위해 문장 중간에 계산기 API를 호출합니다.
최신 정보 또는 거의 볼 수 없는 사실 정보를 가져오기 위해 검색 또는 QA 시스템을 쿼리합니다.
생성된 텍스트 내에서 문구를 다른 언어로 렌더링하기 위해 기계 번역 도구를 호출합니다.
달력/날짜 도구를 사용하여 '다음 금요일'과 같은 상대 참조를 구체적인 날짜로 확인합니다.
위험 및 가드레일
하나의 벤치마크를 최적화하면 더 광범위한 시스템 약점을 숨길 수 있습니다.
인프라 및 유지 관리 비용은 종종 과소평가됩니다.
시스템이 더욱 복잡해짐에 따라 보안 및 관찰 가능성의 격차가 커질 수 있습니다.
구현 로드맵
구현하기 전에 지연 시간, 품질, 비용 목표를 정의하세요.
현실적인 로드 및 데이터 조건에서 벤치마킹합니다.
오류, 드리프트 및 사용자 영향에 대한 계측기 모니터링.
확장하기 전에 롤백 및 사고 대응 경로를 준비하세요.
계속 탐색하세요
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Toolformer and Self-Taught Tool Use quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
다음 가이드
에이전트 루프의 자기 성찰
자주 묻는 질문
What is Toolformer and Self-Taught Tool Use?
Toolformer는 언어 모델이 계산기, 검색 엔진, 번역기와 같은 외부 도구를 호출하는 시기와 방법을 스스로 학습할 수 있는 2023년 Meta AI 방법입니다. 사람이 도구 호출에 라벨을 붙이는 대신 모델은 자체 교육 예제를 생성하고 필터링한 다음 실제로 도움이 되는 예제를 미세 조정합니다.
학습 도구 사용에 대한 Toolformer의 접근 방식이 독특한 이유는 무엇입니까?
Toolformer는 자체 감독됩니다. 모델은 후보 API 호출을 제안하고 실행하며 올바른 사용법에 대한 사람의 주석 없이 유용한 호출만 유지합니다.
Toolformer는 후보 API 호출을 유지할지 여부를 결정하기 위해 어떤 기준을 사용합니까?
결과를 삽입하면 다가오는 실제 텍스트에 대한 모델의 혼란/손실이 임계값 이상으로 낮아져 실제로 유용했음을 나타내는 경우에만 호출이 유지됩니다.
원래 Toolformer는 어떤 도구 세트를 사용하도록 배웠습니까?
Toolformer는 계산기, 질문 답변 시스템, 검색 엔진, 기계 번역기, 달력 등 5가지 API를 호출하도록 훈련되었습니다.
Toolformer 프로세스 중 도구 호출은 텍스트에 어떻게 표시됩니까?
후보 호출과 반환된 결과는 특수 토큰을 사용하여 텍스트에 인라인으로 삽입되므로 모델은 배치와 인수를 함께 학습합니다.
Toolformer에 동기를 부여한 대규모 언어 모델의 근본적인 약점은 무엇입니까?
강력한 언어 능력에도 불구하고 LLM은 외부 도구가 제공할 수 있는 정확한 산술, 최신 사실 및 정확한 정보 검색에 어려움을 겪습니다.