autonomous-agents

3 개의 포스트

google4분 읽기큐레이션 요약

Science One 프레임워크: 증거 사슬을 통한 검증 가능한 자율 연구 프레임워크

Science One Framework는 AI가 생성한 연구 결과의 모든 주장에 실제 근거를 연결하는 Chain-of-Evidence(CoE) 방식으로 환각과 재현성 문제를 줄이는 자율 연구 프레임워크다. 문헌 검색, 실험 탐색, 논문 작성 전 과정에서 증거 사슬을 구축하고, CoE Audit로 인용·점수·코드·방법의 일치 여부를 독립 검증한다. 실험 결과, 기존 시스템의 참고문헌 환각률이 최대 21%에 달한 반면 Science One Framework는 유령 참고문헌 없이 높은 재현성과 성능을 달성했다. ## 자율 연구 시스템에서 검증 가능성이 중요한 이유 - LLM 기반 연구 에이전트는 문헌 조사, 가설 수립, 실험 실행, 논문 작성까지 자동화하고 있다. - 그러나 생성 과정에서 발생한 오류가 다음 단계로 누적·증폭될 수 있다. - 대표적인 문제는 다음과 같다. - 존재하지 않는 논문을 참고문헌으로 생성 - 논문에 설명한 방법과 실제 실행 코드가 불일치 - 논문에 보고된 실험 점수가 코드를 다시 실행했을 때 재현되지 않음 - 따라서 논문의 문장 품질만이 아니라, 각 주장과 근거 사이의 연결을 검증해야 한다. ## Chain-of-Evidence(CoE)의 원칙 - CoE는 데이터베이스 트랜잭션의 ACID처럼 신뢰할 수 있는 연구 산출물이 갖춰야 할 속성을 정의하는 개념적 프레임워크다. - 핵심은 두 가지다. - **완전성**: 연구 산출물의 모든 주장에 기록된 증거 사슬이 있어야 한다. - **정확성**: 연결된 증거가 실제로 해당 주장을 뒷받침해야 한다. - 검증 대상이 되는 주장은 다음과 같다. - 참고문헌의 존재 여부 - 논문에 보고된 실험 수치 - 연구 방법 설명 - 최종 결론 - 증거는 학술 논문, 실험 로그, 실제 실행된 코드, 결과 테이블 등으로 연결된다. - 존재하지 않는 참고문헌, 재현되지 않는 점수, 코드와 다른 방법 설명은 모두 증거 사슬이 끊어진 사례다. ## 문헌을 근거로 고정하는 Problem Investigator - Semantic Scholar API를 사용해 주제별 인용 그래프를 구축한다. - 최대 100개의 전문 PDF를 읽어 구조화된 연구 브리프를 만든다. - 최종 논문의 참고문헌은 모델의 기억에서 생성하지 않고, API를 통해 실제로 검색·확인된 자료에서 가져온다. - 이 방식으로 존재하지 않는 참고문헌이 논문에 포함되는 문제를 방지한다. ## 병렬 탐색을 수행하는 Discovery Engine - 여러 탐색 브랜치를 병렬로 운영해 새로운 아이디어를 탐색하고 성능이 좋은 아이디어를 개선한다. - 각 독립 사이클에서 다음 작업이 수행된다. - Solver 에이전트가 해결책을 구현 - 문제별 evaluator가 결과를 평가 - 성능이 높은 브랜치를 반복적으로 개선 - 모든 evaluator의 원시 출력은 엄격한 읽기 전용 기록으로 저장된다. - 따라서 논문에 기재된 점수를 실제 평가 결과와 대조할 수 있다. ## 주장과 근거를 연결하는 Paper Writer와 Claim Verifier - 논문을 렌더링하기 전에 모든 사실 주장을 구조화하고, 각 주장에 인라인 증거 태그를 붙인다. - 증거 태그는 해당 주장을 뒷받침하는 특정 작업 공간 산출물에 연결된다. - Claim Verifier는 각 주장을 선언된 출처와 대조한다. - 주장이 근거보다 과장된 경우 삭제하기보다 근거가 뒷받침하는 수준으로 보수적으로 다시 작성한다. - 이를 통해 논문 내용이 실제 수행된 연구와 일치하도록 유지한다. ## CoE Audit의 네 가지 검증 CoE Audit는 생성된 논문, 코드, 해결책, 참고문헌을 대상으로 수행하는 사후 자동 감사 프로토콜이다. - **점수 검증** - 논문에서 보고된 점수를 추출한다. - 제출된 코드를 완전히 독립적으로 다시 실행해 결과를 비교한다. - **명세 위반 검사** - 코드가 실제 문제를 해결하는지 확인한다. - 평가 지표를 악용하거나 정답 파일을 직접 읽는 등의 부정한 구현을 검사한다. - **참고문헌 검증** - 모든 참고문헌을 학술 API와 대조한다. - 존재하지 않는 유령 참고문헌을 식별한다. - **방법-코드 정렬 검사** - LLM 심사자가 논문의 방법론 설명과 코드를 나란히 비교한다. - 논문이 실제 구현보다 복잡하거나 다른 알고리즘을 설명하는지 확인한다. ## 실험 결과 - ADRS 벤치마크의 5개 시스템 최적화 과제(Prism, Cloudcast, EPLB, LLM-SQL, transaction scheduling)에서 5개 시스템이 생성한 총 75편의 논문을 평가했다. - Science One Framework는 네 가지 무결성 검사 모두에서 기존 기준 시스템보다 우수했다. - 참고문헌 환각률은 0%였다. - 반면 기존 시스템에서는 최대 21%의 참고문헌이 존재하지 않았다. - 제출 코드의 독립 재실행을 통한 점수 검증에서 완벽한 결과를 보였다. - 방법 설명과 실제 코드의 일치도 역시 가장 높았다. - 일부 기준 시스템은 실제 코드가 단순한 결정론적 휴리스틱임에도 “하이브리드 뉴로-심볼릭 솔버”처럼 과장된 방법을 기술했다. - 검증 절차를 강화했음에도 연구 성능이 저하되지 않았다. - 5개 ADRS 과제에서 인간 전문가 수준 이상을 기록했다. - Cloudcast와 EPLB에서는 전체 시스템 중 최고 성능을 달성했다. - 외부 일반화 평가에서도 MLE-Bench의 의료 영상, 세밀한 이미지 인식, 3D 인식 관련 대회에 적용되었으며, 일부 과제에서 Gold Medal 성과를 기록했다. ## 실용적인 시사점 자율 연구 시스템은 논문을 완성한 뒤 사실을 확인하는 방식보다, 문헌·코드·실험 로그·결과를 생성 시점부터 연결하는 구조가 바람직하다. 특히 자동화된 연구 결과를 실제 의사결정이나 후속 연구에 사용하려면, 논문 자체뿐 아니라 독립적인 코드 재실행, 참고문헌 확인, 방법-코드 비교를 포함한 CoE Audit 같은 검증 절차를 함께 운영해야 한다.

원문 읽기(새 탭에서 열림)
meta원문

랭킹 엔지니어 에이전트(REA): 메타의 광고 랭킹 혁신을 가속화하는 자율형 AI 에이전트 (새 탭에서 열림)

Meta는 광고 랭킹 모델의 머신러닝(ML) 생태 주기를 자율적으로 수행하는 '랭킹 엔지니어 에이전트(REA)'를 개발하여 모델 최적화 과정을 혁신했습니다. REA는 가설 생성부터 학습 실행, 오류 디버깅, 결과 분석에 이르는 전 과정을 수동 개입 없이 관리하며, 기존 엔지니어링 방식 대비 모델 정확도를 2배 높이고 업무 효율을 5배 향상시키는 성과를 거두었습니다. 이는 단순 보조 도구를 넘어 복잡하고 긴 시간이 소요되는 ML 실험 과정을 독립적으로 주도할 수 있는 자율형 AI 에이전트의 가능성을 증명한 사례입니다. **장기 워크플로우를 위한 동면 및 깨우기(Hibernate-and-Wake) 메커니즘** * ML 모델 학습은 수 시간에서 수일이 소요되므로, 세션 기반의 일반 AI 비서로는 전체 과정을 관리하기 어렵습니다. * REA는 학습 작업을 실행한 후 대기 상태(동면)로 전환하여 자원을 보존하고, 작업이 완료되면 자동으로 복귀하여 다음 단계를 진행합니다. * 내부 AI 에이전트 프레임워크인 'Confucius'를 기반으로 구축되어 코드 생성, 내부 도구 통합, 실험 추적 인프라와의 유기적인 연결을 지원합니다. * 이를 통해 며칠에서 몇 주에 걸친 긴 실험 과정에서도 일관된 상태와 메모리를 유지하며 자율적으로 업무를 지속합니다. **데이터 기반의 하이브리드 가설 생성 엔진** * REA는 단순히 임의의 실험을 반복하는 것이 아니라, 두 가지 핵심 소스를 통해 고품질의 가설을 수립합니다. * **과거 통찰 데이터베이스:** 이전의 실험 성공 및 실패 패턴을 학습하여 맥락에 맞는 최적화 방향을 제시합니다. * **ML 리서치 에이전트:** 기준 모델의 설정을 조사하고 최신 ML 연구 트렌드를 반영하여 혁신적인 전략을 제안합니다. * 두 소스의 결합을 통해 모델 구조 최적화와 학습 효율성 개선이 결합된, 엔지니어가 단독으로 생각하기 어려운 독창적이고 효과적인 실험 구성을 도출합니다. **3단계 계획 프레임워크와 자율적 복원력** * REA는 엔지니어가 승인한 예산 범위 내에서 효율적으로 자원을 배분하기 위해 '검증(Validation) → 조합(Combination) → 활용(Exploitation)'의 3단계 전략을 사용합니다. * 먼저 개별 가설의 성능을 병렬로 검증한 뒤, 유망한 가설들을 조합하여 시너지 효과를 탐색하고, 최종적으로 가장 가능성 높은 후보에 자원을 집중 투입합니다. * 인프라 장애나 메모리 부족(OOM), 손실 발산(Loss Explosion) 같은 기술적 오류 발생 시, 미리 정의된 가이드라인과 원천 원리(First Principles)를 바탕으로 스스로 디버깅을 수행합니다. * 엔지니어는 매 순간을 감시하는 대신 전략적 결정 지점에서만 검토를 수행하므로, 적은 인원으로도 다수의 모델을 동시에 개선할 수 있습니다. REA의 사례는 AI 에이전트가 단순한 코딩 보조 도구를 넘어, 도메인 지식과 인프라 제어 능력을 갖춘 '자율적인 동료'로 진화하고 있음을 보여줍니다. 대규모 ML 시스템을 운영하는 조직이라면 REA와 같이 과거 데이터를 자산화하고 장기적인 실험 로드맵을 스스로 실행할 수 있는 에이전트 도입을 검토해야 합니다. 이는 반복적인 디버깅과 모니터링 작업에서 엔지니어를 해방시켜 더 고차원적인 전략 수립에 집중할 수 있는 환경을 제공할 것입니다.

google원문

DS-STAR: 최첨 (새 탭에서 열림)

DS-STAR는 통계 분석부터 시각화, 데이터 가공에 이르는 방대한 작업을 자동화하는 최첨단 데이터 과학 에이전트로, 특히 구조화되지 않은 다양한 형식의 데이터를 처리하는 데 탁월한 성능을 보입니다. 이 에이전트는 데이터 파일의 맥락을 자동으로 추출하고, 생성된 계획을 검증하며, 피드백에 따라 계획을 반복적으로 수정하는 세 가지 핵심 혁신을 통해 기존 모델의 한계를 극복했습니다. 결과적으로 DABStep을 포함한 주요 데이터 과학 벤치마크에서 기존의 최첨단 모델들을 제치고 1위를 차지하며 그 실효성을 입증했습니다. **다양한 데이터 형식의 자동 분석 및 맥락 추출** * 기존 데이터 과학 에이전트들이 CSV와 같은 정형 데이터에 의존했던 것과 달리, DS-STAR는 JSON, 비구조화 텍스트, 마크다운 등 현실 세계의 다양한 데이터 형식을 처리할 수 있습니다. * 워크플로의 첫 단계에서 디렉토리 내의 모든 파일을 자동으로 조사하여 데이터의 구조와 내용을 텍스트 요약 형태로 추출합니다. * 이 요약 정보는 에이전트가 당면한 과제를 해결하는 데 필요한 필수적인 맥락 데이터로 활용됩니다. **반복적 계획 수립 및 검증 프레임워크** * DS-STAR는 계획(Planner), 구현(Coder), 검증(Verifier), 라우팅(Router) 단계로 구성된 반복 루프를 통해 작동합니다. * LLM 기반의 검증 에이전트(Verifier)가 각 단계에서 수립된 계획의 충분성을 평가하며, 만약 미흡하다고 판단될 경우 라우터(Router)가 단계를 수정하거나 추가하도록 유도합니다. * 이는 전문가가 구글 코랩(Google Colab)과 같은 도구를 사용하여 중간 결과를 확인하며 순차적으로 분석을 진행하는 방식을 모방한 것으로, 최대 10회까지 반복 정제 과정을 거칩니다. **벤치마크 성능 및 실전 데이터 대응 능력** * DABStep, KramaBench, DA-Code와 같은 주요 벤치마크 평가에서 AutoGen 및 DA-Agent와 같은 기존 모델들을 일관되게 압도했습니다. * 특히 DABStep 벤치마크에서는 정확도를 기존 41.0%에서 45.2%로 끌어올리며 공공 리더보드 1위를 기록했습니다. * 단일 파일 작업(Easy task)뿐만 아니라 여러 이기종 데이터 소스를 결합해야 하는 복잡한 작업(Hard task)에서 경쟁 모델 대비 압도적인 성능 우위를 보였습니다. DS-STAR는 정형 데이터에 국한되지 않고 실제 비즈니스 현장의 파편화된 데이터를 통합 분석해야 하는 환경에서 매우 유용한 도구가 될 수 있습니다. 복잡한 데이터 과학 워크플로를 자동화하고자 하는 조직은 DS-STAR의 순차적 계획 수립 및 자기 검증 메커니즘을 도입함으로써 분석의 정확도와 신뢰성을 획기적으로 높일 수 있을 것입니다.