무슨 일이 일어났나요?
Blockchain.News는 GitHub가 코딩 작업을 평가하고 직접 해결, 에스컬레이션 및 비평 워크플로 중에서 선택하는 연구 미리 보기인 프로젝트 HydraFusion을 도입했다고 보고합니다. 보고서에 따르면 개발자가 수동으로 모델을 선택하지 않고도 시스템이 여러 AI 모델을 조정할 수 있다고 합니다. Blockchain.News에 따르면 HydraFusion은 GitHub 커뮤니티 토론 포럼을 통해 피드백을 제공할 수 있는 미리 보기 참가자를 위해 Copilot CLI를 통해 사용할 수 있습니다. 소스는 자격 요구 사항, 가격, 계획 가용성 또는 일반 릴리스 상태를 지정하지 않습니다.
Blockchain.News는 GitHub가 AI 지원 코딩을 위한 연구 미리보기로 Project HydraFusion을 도입했다고 보고했습니다. 시스템은 각 코딩 작업을 평가하고 세 가지 작업 흐름 패턴 중에서 선택합니다. 단일 모델에서는 하나의 모델이 솔루션을 생성합니다. 품질 검사 후 초안을 더 강력한 모델로 확대할 수 있는 캐스케이드 별도의 모델이 답변 초안을 작성하고 검토하는 비평(Critique).
보고서에 따르면 HydraFusion은 통제된 벤치마크에서 비용 절감을 달성했다고 합니다. Claude Opus 5 기준과 비교하여 Blockchain.News는 TerminalBench 2.1에서 4.9% 포인트 품질 개선 및 67% 낮은 비용, DeepSWE에서 1.5포인트 품질 저하로 36% 비용 절감, CheckpointBench에서 65% 더 낮은 비용으로 거의 동등한 품질을 보고합니다. 소식통에 따르면 개발자는 Copilot CLI를 통해 미리 보기에 액세스할 수 있지만 해당 기능이 일반적으로 사용 가능하다는 사실은 확인되지 않았습니다.
왜 중요한가요?
보고된 결과가 통제된 테스트 범위를 넘어서는 경우 자동 모델 선택을 통해 일부 작업의 품질을 유지하면서 AI 지원 소프트웨어 개발 비용을 줄일 수 있습니다. 코딩 에이전트는 종종 추론 비용 및 대기 시간을 고려하여 더 강력한 모델을 선택하기 때문에 이는 중요합니다. HydraFusion은 또한 모든 작업에 대해 하나의 모델을 선택하는 것에서 작업 난이도를 중심으로 작업 흐름을 구성하는 것으로의 전환을 강조합니다. 증거는 독립적인 평가가 아닌 Blockchain.News에서 전달한 GitHub가 보고한 연구 미리보기 결과로 남아 있습니다. 결과는 엇갈립니다. 소스에서는 TerminalBench 2.1의 향상, CheckpointBench의 거의 패리티, DeepSWE의 품질 저하를 보고했습니다. 이 기사에서는 Claude Opus 5와의 비교 외에 사용된 모델을 식별하지 않거나 재현성을 평가할 수 있는 충분한 방법론을 제공하지 않습니다.
보고된 접근 방식은 AI 코딩이 필요한 작업을 위해 더 유능한 모델을 예약하고 간단한 작업을 위해 저렴한 모델을 사용함으로써 AI 코딩을 더욱 경제적으로 만들 수 있습니다. 모델 선택이 지출과 응답 시간 모두에 영향을 미치는 대량의 코딩 에이전트 요청을 관리하는 팀과 특히 관련이 있을 수 있습니다.
실제 가치는 보고된 테스트 외에는 아직 확립되지 않았습니다. Blockchain.News는 독립적인 벤치마크 검증, 세부 테스트 방법론, 모델 가격 가정, 샘플 크기 또는 프로덕션 저장소의 증거를 제공하지 않습니다. DeepSWE 결과는 또한 비용 절감에는 복잡한 저장소 수준 작업에 대한 측정 가능한 품질 균형이 포함될 수 있음을 나타냅니다.
대화형 메커니즘: 실제로 작동하는 방식
이 개발의 이면에 있는 기본 기술을 대화식으로 살펴보세요.
crm_get_transaction(id='4092').An agent must create a draft calendar event for Tuesday at 2 p.m. Which evidence would establish the requested result?
다음에 무엇을 볼 것인가
가장 중요한 다음 단계는 HydraFusion을 미리 보기 이후에도 사용할 수 있는지 여부와 실제 리포지토리 및 다중 턴 개발 세션에서 절감 효과가 지속되는지 여부입니다. Blockchain.News에 따르면 초기 테스트는 단일 프롬프트 작업에 중점을 두고 있으며 반복 세션을 지원할 계획입니다. 개발자는 비용, 대기 시간 및 품질 간의 균형도 관찰해야 합니다. 소식통은 DeepSWE에서 1.5포인트 품질 저하와 함께 36% 비용 절감을 보고했는데, 이는 자동화된 오케스트레이션에 작업별 품질 임계값과 인적 검토가 필요할 수 있음을 시사합니다.
자격을 갖춘 Copilot 사용자 또는 요금제, 미리 보기에 사용 제한이 있는지 여부, GitHub가 가격이나 문서를 게시하는지 여부 등 더 광범위한 액세스 세부 정보를 확인하세요. 해당 조건 중 어느 것도 소스에 지정되어 있지 않습니다.
Blockchain.News에서 보고한 GitHub의 명시된 방향에는 다중 턴 및 반복 세션에 대한 지원과 대기 시간, 안정성 및 비용 효율성에 대한 추가 작업이 포함됩니다. 이러한 업데이트는 HydraFusion이 제한된 실험인지 아니면 내구성 있는 Copilot 기능인지를 결정합니다.