Google Research/대규모 언어 모델

52 개의 포스트

google4분 읽기큐레이션 요약

빈 서가인가, 잃어버린 열쇠인가? 회상은 매개변수적 사실성의 병목이다

LLM의 사실 오류는 사실을 학습하지 못해서라기보다, 이미 저장한 사실을 필요할 때 꺼내지 못해서 발생하는 경우가 많다. Google Research는 이를 측정하는 ‘지식 프로파일링’과 WikiProfile 벤치마크를 제안했으며, 최신 모델에서는 지식 습득보다 지식 활용과 회상이 사실성의 병목이라고 결론 내린다. 따라서 모델 규모 확대만으로는 한계가 있고, 저장된 지식을 안정적으로 회수하도록 하는 후처리·추론 기법이 중요해진다. ## 인코딩과 회상을 구분해야 하는 이유 - 일반적인 정확도 지표는 모델이 사실을 아예 학습하지 못한 경우와, 학습했지만 답변하지 못한 경우를 구분하지 않는다. - 두 실패의 원인은 다르다. - **인코딩 실패**: 사실이 모델 파라미터에 충분히 표현되지 않음 → 모델 규모 확대나 학습 데이터 보강이 필요하다. - **회상 실패**: 사실은 저장되어 있지만 외부 단서 없이 검색·활용하지 못함 → 후처리 학습이나 추론 시점 기법으로 개선할 가능성이 있다. - 글에서는 다음과 같이 개념을 구분한다. - **인코딩**: 사전학습 당시와 유사한 문맥에서 사실을 재현할 수 있는 능력 - **지식**: 표현이 달라지거나 질문 방향이 바뀌어도 사실에 답하는 능력 - **회상**: 인코딩된 사실을 별도 외부 단서 없이 꺼내는 능력 - **인식**: 여러 선택지 중 올바른 사실을 식별하는 능력 ## 지식 프로파일링과 다섯 가지 사실 상태 - 분석 단위를 개별 질문이 아니라 **사실 자체**로 바꾼다. - 각 사실을 다음 다섯 가지 상태로 분류한다. - 인코딩 실패 - 회상 실패 - 직접 회상 - 사고를 거친 회상 - 인코딩 없이 추론 - ‘사고를 거친 회상’은 중간 계산이나 다단계 추론을 유도해야만 답할 수 있는 경우다. - ‘인코딩 없이 추론’은 해당 사실 자체는 저장되지 않았더라도, 다른 사실들을 조합하거나 추측해 정답에 도달하는 경우를 뜻한다. ## WikiProfile 벤치마크 구성 - Wikipedia에서 추출한 2,150개의 사실을 대상으로 한다. - 사실은 문서에 먼저 등장하는 주체와 객체의 순서쌍으로 정의된다. - 각 사실에는 총 10개의 과제가 연결된다. - 인코딩 측정 2개 - 지식 평가 4개 - 인식 평가용 객관식 문제 4개 - 질문은 직접 질문과 역방향 질문을 모두 포함한다. - 예: “B는 무엇인가?”와 “A는 무엇인가?” - 질문 생성 후 정제·검색 기반 필터링·수작업 검증을 거쳐 모호하거나 정답이 여러 개인 사례를 제거했다. - 13개 LLM을 사고 기능 활성화 여부에 따라 평가했으며, 모델·사실·과제별로 8개 응답을 샘플링해 약 450만 개의 응답을 자동 평가했다. ## 최신 LLM의 병목은 인코딩이 아니라 회상 - Gemini 2.5 Pro, Gemini 3 계열, GPT-5 같은 프런티어 모델은 사실 인코딩률이 거의 포화 상태다. - Gemini 3 Pro와 GPT-5는 약 **95~98%의 사실을 인코딩**하고 있다. - 그러나 사고 없이 직접 회상하는 데는 여전히 **26~34%의 사실에서 실패**한다. - 사고를 허용해도 **11~12%의 사실은 여전히 회상하지 못한다.** - 모델 규모를 키우면 인코딩 실패는 크게 줄지만, 회상 실패는 상당 부분 남는다. - 즉, 스케일링은 모델이 “무엇을 저장하는가”는 개선하지만, “저장된 것을 얼마나 안정적으로 꺼내는가”는 상대적으로 덜 개선한다. ## 회상이 어려워지는 조건 - 회상 능력은 사실을 학습할 때의 조건과 밀접하게 연결된다. - 질문의 표현, 문맥, 정보의 배열 순서가 학습 당시와 달라지면 사실이 저장되어 있어도 접근하기 어려워질 수 있다. - 이는 모델의 지식 부족이라기보다, 저장된 지식에 연결되는 단서가 충분히 활성화되지 않는 문제로 해석할 수 있다. ## 희귀 사실과 롱테일 지식 - 기존 연구는 모델이 희귀한 사실에 약한 이유를 주로 모델 용량 부족으로 설명했다. - 이 연구에서는 희귀 사실도 인기 있는 사실과 비슷한 수준으로 인코딩되는 경우가 많다고 본다. - 인기 있는 사실과 희귀한 사실의 인코딩률 차이는 비교적 작지만, 회상률 차이는 더 크게 나타난다. - 따라서 롱테일 사실의 문제는 “모델이 전혀 저장하지 않았다”기보다 “저장했지만 적절한 상황에서 꺼내지 못한다”는 관점으로 재해석할 수 있다. ## 실용적인 결론 - 사실성 개선을 위해 단순히 모델 크기와 학습 데이터만 늘리는 전략에는 한계가 있다. - 저장된 지식을 다양한 표현과 질문 방향에서 안정적으로 회수하도록 하는 후처리 학습, 프롬프트 설계, 사고 유도 기법을 함께 개발해야 한다. - 모델 평가에서도 단일 정답률보다 인코딩·직접 회상·사고 기반 회상·인식 능력을 분리해 측정하는 것이 바람직하다.

원문 읽기(새 탭에서 열림)
google4분 읽기큐레이션 요약

Science One 프레임워크: 증거 사슬을 통한 검증 가능한 자율 연구 프레임워크

Science One Framework는 AI가 생성한 연구 결과의 모든 주장에 실제 근거를 연결하는 Chain-of-Evidence(CoE) 방식으로 환각과 재현성 문제를 줄이는 자율 연구 프레임워크다. 문헌 검색, 실험 탐색, 논문 작성 전 과정에서 증거 사슬을 구축하고, CoE Audit로 인용·점수·코드·방법의 일치 여부를 독립 검증한다. 실험 결과, 기존 시스템의 참고문헌 환각률이 최대 21%에 달한 반면 Science One Framework는 유령 참고문헌 없이 높은 재현성과 성능을 달성했다. ## 자율 연구 시스템에서 검증 가능성이 중요한 이유 - LLM 기반 연구 에이전트는 문헌 조사, 가설 수립, 실험 실행, 논문 작성까지 자동화하고 있다. - 그러나 생성 과정에서 발생한 오류가 다음 단계로 누적·증폭될 수 있다. - 대표적인 문제는 다음과 같다. - 존재하지 않는 논문을 참고문헌으로 생성 - 논문에 설명한 방법과 실제 실행 코드가 불일치 - 논문에 보고된 실험 점수가 코드를 다시 실행했을 때 재현되지 않음 - 따라서 논문의 문장 품질만이 아니라, 각 주장과 근거 사이의 연결을 검증해야 한다. ## Chain-of-Evidence(CoE)의 원칙 - CoE는 데이터베이스 트랜잭션의 ACID처럼 신뢰할 수 있는 연구 산출물이 갖춰야 할 속성을 정의하는 개념적 프레임워크다. - 핵심은 두 가지다. - **완전성**: 연구 산출물의 모든 주장에 기록된 증거 사슬이 있어야 한다. - **정확성**: 연결된 증거가 실제로 해당 주장을 뒷받침해야 한다. - 검증 대상이 되는 주장은 다음과 같다. - 참고문헌의 존재 여부 - 논문에 보고된 실험 수치 - 연구 방법 설명 - 최종 결론 - 증거는 학술 논문, 실험 로그, 실제 실행된 코드, 결과 테이블 등으로 연결된다. - 존재하지 않는 참고문헌, 재현되지 않는 점수, 코드와 다른 방법 설명은 모두 증거 사슬이 끊어진 사례다. ## 문헌을 근거로 고정하는 Problem Investigator - Semantic Scholar API를 사용해 주제별 인용 그래프를 구축한다. - 최대 100개의 전문 PDF를 읽어 구조화된 연구 브리프를 만든다. - 최종 논문의 참고문헌은 모델의 기억에서 생성하지 않고, API를 통해 실제로 검색·확인된 자료에서 가져온다. - 이 방식으로 존재하지 않는 참고문헌이 논문에 포함되는 문제를 방지한다. ## 병렬 탐색을 수행하는 Discovery Engine - 여러 탐색 브랜치를 병렬로 운영해 새로운 아이디어를 탐색하고 성능이 좋은 아이디어를 개선한다. - 각 독립 사이클에서 다음 작업이 수행된다. - Solver 에이전트가 해결책을 구현 - 문제별 evaluator가 결과를 평가 - 성능이 높은 브랜치를 반복적으로 개선 - 모든 evaluator의 원시 출력은 엄격한 읽기 전용 기록으로 저장된다. - 따라서 논문에 기재된 점수를 실제 평가 결과와 대조할 수 있다. ## 주장과 근거를 연결하는 Paper Writer와 Claim Verifier - 논문을 렌더링하기 전에 모든 사실 주장을 구조화하고, 각 주장에 인라인 증거 태그를 붙인다. - 증거 태그는 해당 주장을 뒷받침하는 특정 작업 공간 산출물에 연결된다. - Claim Verifier는 각 주장을 선언된 출처와 대조한다. - 주장이 근거보다 과장된 경우 삭제하기보다 근거가 뒷받침하는 수준으로 보수적으로 다시 작성한다. - 이를 통해 논문 내용이 실제 수행된 연구와 일치하도록 유지한다. ## CoE Audit의 네 가지 검증 CoE Audit는 생성된 논문, 코드, 해결책, 참고문헌을 대상으로 수행하는 사후 자동 감사 프로토콜이다. - **점수 검증** - 논문에서 보고된 점수를 추출한다. - 제출된 코드를 완전히 독립적으로 다시 실행해 결과를 비교한다. - **명세 위반 검사** - 코드가 실제 문제를 해결하는지 확인한다. - 평가 지표를 악용하거나 정답 파일을 직접 읽는 등의 부정한 구현을 검사한다. - **참고문헌 검증** - 모든 참고문헌을 학술 API와 대조한다. - 존재하지 않는 유령 참고문헌을 식별한다. - **방법-코드 정렬 검사** - LLM 심사자가 논문의 방법론 설명과 코드를 나란히 비교한다. - 논문이 실제 구현보다 복잡하거나 다른 알고리즘을 설명하는지 확인한다. ## 실험 결과 - ADRS 벤치마크의 5개 시스템 최적화 과제(Prism, Cloudcast, EPLB, LLM-SQL, transaction scheduling)에서 5개 시스템이 생성한 총 75편의 논문을 평가했다. - Science One Framework는 네 가지 무결성 검사 모두에서 기존 기준 시스템보다 우수했다. - 참고문헌 환각률은 0%였다. - 반면 기존 시스템에서는 최대 21%의 참고문헌이 존재하지 않았다. - 제출 코드의 독립 재실행을 통한 점수 검증에서 완벽한 결과를 보였다. - 방법 설명과 실제 코드의 일치도 역시 가장 높았다. - 일부 기준 시스템은 실제 코드가 단순한 결정론적 휴리스틱임에도 “하이브리드 뉴로-심볼릭 솔버”처럼 과장된 방법을 기술했다. - 검증 절차를 강화했음에도 연구 성능이 저하되지 않았다. - 5개 ADRS 과제에서 인간 전문가 수준 이상을 기록했다. - Cloudcast와 EPLB에서는 전체 시스템 중 최고 성능을 달성했다. - 외부 일반화 평가에서도 MLE-Bench의 의료 영상, 세밀한 이미지 인식, 3D 인식 관련 대회에 적용되었으며, 일부 과제에서 Gold Medal 성과를 기록했다. ## 실용적인 시사점 자율 연구 시스템은 논문을 완성한 뒤 사실을 확인하는 방식보다, 문헌·코드·실험 로그·결과를 생성 시점부터 연결하는 구조가 바람직하다. 특히 자동화된 연구 결과를 실제 의사결정이나 후속 연구에 사용하려면, 논문 자체뿐 아니라 독립적인 코드 재실행, 참고문헌 확인, 방법-코드 비교를 포함한 CoE Audit 같은 검증 절차를 함께 운영해야 한다.

원문 읽기(새 탭에서 열림)
google3분 읽기큐레이션 요약

회상을 위한 사고: 추론은 LLM의 파라메트릭 지식을 어떻게 끌어내는가

LLM의 추론 과정은 복잡한 논리 문제가 없어도 단순한 사실을 회상하는 데 도움을 준다. 연구진은 그 이유로 생성된 추론 토큰이 추가 계산 공간으로 작동하는 효과와, 관련 사실을 먼저 떠올려 정답을 활성화하는 사실 프라이밍을 제시한다. 다만 중간에 생성한 사실이 환각일 수 있어, 이 방식은 정확성 검증과 함께 사용해야 한다. ## 단순한 사실 회상에도 추론이 효과적인 이유 - 일반적으로 Chain-of-Thought(CoT)는 수학, 프로그래밍, 다단계 질의응답처럼 복잡한 문제를 단계적으로 해결할 때 유용하다. - 그러나 “Mary Engle Pennington이 National Inventors Hall of Fame에 헌액된 연도는?”처럼 단일 사실을 묻는 질문에는 명시적인 논리 전개가 필요하지 않다. - 연구진은 이런 질문에서도 추론을 허용하면, 추론을 끈 상태에서는 사실상 회수하기 어려운 정답이 생성될 수 있음을 확인했다. - 실험에는 Gemini-2.5 Flash/Pro와 Qwen3-32B, SimpleQA Verified 및 EntityQuestions 데이터셋이 사용됐다. ## 지식 회수 한계 측정: pass@k - `pass@k`는 한 번의 최상위 답변만 보는 대신, 여러 번 생성한 답변 중 정답이 포함되는지를 측정한다. - 이를 통해 정답이 모델의 출력 분포 안에 잠재적으로 존재하는지, 현재 최상위 답변으로 선택되지 않았을 뿐인지 구분할 수 있다. - 추론 ON/OFF 모드를 비교한 결과, 세 모델과 두 데이터셋에서 추론을 활성화했을 때 정답 회수율이 일관되게 향상됐다. - 데이터셋이 주로 단순한 단일 단계 질문으로 구성되어 있어, 성능 향상이 복잡한 문제 분해 때문이라고 보기 어렵다. ## 생성 토큰이 제공하는 계산 버퍼 - 첫 번째 메커니즘은 추론 토큰이 모델에 추가적인 계산 시간과 내부 상태 갱신 기회를 제공한다는 것이다. - 연구진은 모델의 자연스러운 추론 내용을 제거하고, `"Let me think"` 같은 무의미한 문자열을 원래 추론과 같은 길이로 반복해 넣었다. - 의미 없는 토큰만 제공해도 추론을 완전히 끈 경우보다 사실 회상 성능이 크게 향상됐다. - 이는 추가 토큰이 의미를 전달하지 않더라도 여러 번의 forward pass를 통해 모델이 내부 표현을 정제하고, 접근하기 어려운 지식을 검색하게 만들 수 있음을 시사한다. - 다만 토큰을 계속 늘리면 효과가 감소하며, 자연스러운 추론의 성능에는 도달하지 못했다. - 따라서 계산량 자체가 중요하지만, 추론 과정에 포함된 실제 내용도 추가적인 역할을 한다. ## 관련 사실을 떠올리는 사실 프라이밍 - 자연스러운 추론을 분석한 결과, 모델은 논리적 증명을 수행하기보다 질문과 관련된 주변 사실을 먼저 나열하는 경우가 많았다. - 연구진은 이를 인간 기억의 ‘ spreading activation’과 유사한 현상으로 보고, **사실 프라이밍(factual priming)**이라고 명명했다. - 관련 사실을 생성하면 질문과 정답 사이에 의미적 연결 고리가 형성되어, 목표 사실을 회상하기 쉬워진다. - 실험에서는 추론 과정에서 나온 구체적인 사실만 추출하고, 채움말, 검색 계획, 정답 자체에 대한 직접 언급은 제거했다. - 짧은 사실 목록만 정답 생성에 제공해도 추론이 만들어내는 성능 향상의 상당 부분이 재현됐다. - 예를 들어 네팔의 제10대 왕을 묻는 질문에서 모델이 앞선 9명의 왕을 먼저 떠올리면, 이 정보들이 제10대 왕을 회상하기 위한 의미적 준비 단계로 작동할 수 있다. - 이 효과는 추론 모드가 꺼진 상태에서 사실 목록을 추가 문맥으로 제공했을 때도 나타났다. ## 환각으로 인한 위험 - 사실 프라이밍은 모델이 중간 사실을 스스로 생성한다는 점에서 근본적인 위험을 가진다. - 중간에 떠올린 관련 사실이 실제 지식이 아니라 환각일 경우, 잘못된 정보가 정답 회상을 방해하거나 오답을 강화할 수 있다. - 제공된 글은 이 위험을 검증하는 실험을 소개하는 도중에 끝나므로, 환각의 구체적인 측정 결과와 완화 방법은 확인할 수 없다. ## 실용적인 결론 - 단순한 사실 질문에서도 모델의 추론을 허용하면 잠재 지식 회수율을 높일 수 있다. - 성능 향상은 충분한 생성 길이를 제공하는 것과, 관련 사실을 먼저 회상하도록 유도하는 방식에서 비롯된다. - 다만 중간 추론을 그대로 신뢰하지 말고, 외부 검색·검증 또는 여러 독립 샘플의 일치 여부를 함께 확인하는 것이 안전하다.

원문 읽기(새 탭에서 열림)
google4분 읽기큐레이션 요약

Gemini Enterprise Agent Platform의 Agentic RAG로 신뢰할 수 있는 응답 구현하기

Google의 Agentic RAG는 단일 검색과 생성을 수행하는 기존 RAG의 한계를 넘어, 복잡한 기업 질의를 여러 단계로 분해하고 필요한 정보가 확보될 때까지 반복 검색하는 멀티 에이전트 구조다. 특히 검색 결과와 중간 답변을 검토하는 ‘충분한 컨텍스트 에이전트’를 통해 누락된 정보를 식별하고 추가 검색을 지시한다. Google은 이 방식이 사실성 평가 데이터셋에서 정확도를 최대 34% 향상시켰으며, 내부 도메인별 데이터에서도 더 나은 근거 기반 응답과 추론 정확도를 보였다고 설명한다. ## 기존 단일 단계 RAG의 한계 - 일반적인 RAG는 질문을 바탕으로 관련 문서를 한 번 검색한 뒤, 검색 결과를 LLM에 전달해 답변을 생성한다. - 기업 데이터는 여러 데이터베이스와 문서 저장소에 분산되어 있어 한 번의 검색만으로 답을 찾기 어렵다. - 예를 들어 프로젝트 문서에 서버 ID만 있고 실제 서버 사양은 별도 자산 데이터베이스에 있다면, 기존 RAG는 서버 사양을 추가로 조회하지 못한다. - 그 결과 부분적인 답변을 내놓거나, 정보가 실제로 존재함에도 “찾을 수 없다”고 응답할 수 있다. ## 멀티 에이전트 기반 검색 구조 Agentic RAG는 하나의 검색기가 모든 작업을 처리하는 대신 역할별 에이전트가 협력한다. - **Orchestrator**: 질의를 분석해 단일 검색으로 충분한지 판단하고, 복잡한 작업을 하위 에이전트에 위임한다. - **Planner Agent**: 필요한 정보의 경로와 검색 순서를 계획한다. 예를 들어 예산은 재무 데이터베이스에서, 일정은 프로젝트 관리 로그에서 조회하도록 결정한다. - **Query Rewriter**: 모호하거나 긴 질문을 여러 개의 구체적인 검색 질의로 변환한다. - **Search Fanout Agent**: 변환된 질의를 여러 검색 소스에 동시에 보내 정보를 수집한다. - **LLM 또는 Synthesis Agent**: 수집된 컨텍스트를 통합해 최종 답변을 작성한다. ## Google 방식의 차별점: 충분한 컨텍스트 검증 - 기존 멀티 에이전트 RAG와 달리, Google의 구조는 정보가 충분한지 확인하는 전용 **Sufficient Context Agent**를 포함한다. - 첫 검색 결과가 불완전해도 즉시 답변하거나 포기하지 않고, 어떤 정보가 누락됐는지 분석한 뒤 추가 검색을 수행한다. - 이를 통해 정보 부족을 이유로 한 성급한 추측이나 불완전한 답변을 줄인다. ## 의료 질의 처리 과정 예시 질의는 환자의 퇴원 약물, 식이 제한, 입원 중 알레르기 반응을 묻고 특정 입원·응급실 투여 약물은 제외하도록 요구한다. ### 1. 오케스트레이션 - Root Agent가 의사의 요청을 분석하고 하위 작업으로 분배한다. - Planner Agent는 Pharmacy, Nutrition, Clinical Notes 등 세 영역을 확인해야 한다고 판단한다. - Query Rewriter는 긴 요청을 약물, 식이, 알레르기 여부에 관한 검색 가능한 질의로 나눈다. ### 2. 초기 검색 - RAG Agent가 여러 검색 질의를 환자 기록에 동시에 실행한다. - 퇴원 약물과 식이 정보는 찾지만, 알레르기 관련 내용은 주요 문서에서 발견하지 못한다. - 일반 RAG라면 이 시점에서 불완전한 답변을 생성할 수 있다. ### 3. 충분한 컨텍스트 검증 Sufficient Context Agent는 다음 세 가지를 함께 검토한다. - **검색된 스니펫**: 실제로 검색된 문서 구간에 필요한 정보가 포함되어 있는지 확인한다. - **중간 초안**: 현재까지의 검색 결과로 작성한 임시 답변이 질문의 모든 요구사항을 다루는지 평가한다. - **누락 정보 분석**: 단순히 “정보가 부족하다”고 말하지 않고, 어떤 내용이 빠졌는지 구체적인 이유와 피드백을 생성한다. - 예: 약물 목록과 저염식 지침은 확보했지만, 알레르기 반응이나 이상 사례 정보가 없음. - 후속 지시: “알레르기 질문이 해결되지 않았으므로 ‘발진’, ‘이상 반응’ 등을 검색하라.” ### 4. 반복 검색 - 검증 에이전트의 피드백을 받은 Query Rewriter가 새로운 검색어를 생성한다. - RAG Agent는 초기 검색에서 제외했던 파일과 문서 영역을 다시 조사한다. - 이 과정에서 알레르기나 이상 반응에 관한 누락 정보가 발견될 수 있다. ### 5. 최종 합성 - Sufficient Context Agent가 약물, 식이, 알레르기 정보가 모두 확보됐는지 다시 확인한다. - 충분한 정보가 모이면 검색을 종료한다. - Synthesis Agent가 의사가 활용할 수 있는 정확하고 정리된 최종 요약을 작성한다. ## 평가와 기대 효과 - Google은 Agentic RAG를 FRAMES 논문 기반의 **FramesQA** 데이터셋에서 평가했다고 밝혔다. - 평가 대상에는 여러 단계의 추론과 서로 다른 정보 출처를 연결해야 하는 멀티홉 질문이 포함된다. - 사실성 데이터셋에서 기존 방식보다 정확도가 최대 34% 향상됐다. - 내부 데이터셋에서도 도메인별 작업에 대해 더 나은 근거 연결과 추론 정확도를 확인했다고 설명한다. - 제공된 글 본문은 실험 예시가 시작되는 부분에서 끝나므로, 세부 수치와 비교 대상별 결과는 제시되지 않았다. 실무적으로 Agentic RAG는 데이터가 여러 시스템에 분산되어 있고 한 번의 검색으로 답을 완성하기 어려운 기업 환경에 적합하다. 다만 반복 검색과 다수 에이전트 운영으로 비용과 지연 시간이 증가할 수 있으므로, 충분한 컨텍스트 검증을 적용할 질의 유형을 선별하고 검색 횟수·중단 조건을 함께 설계하는 것이 중요하다.

원문 읽기(새 탭에서 열림)
google원문

ReasoningBank: 에이전트가 경험을 통해 학습할 수 있도록 하기 (새 탭에서 열림)

ReasoningBank는 에이전트가 배포된 이후에도 성공과 실패의 경험으로부터 일반화된 추론 전략을 추출하여 스스로 진화할 수 있게 돕는 새로운 메모리 프레임워크입니다. 기존 방식이 단순히 실행 기록을 저장하거나 성공 사례만 수집했던 것과 달리, ReasoningBank는 고차원의 전략적 통찰을 구조화하여 저장함으로써 에이전트의 성공률과 작업 효율성을 동시에 개선합니다. 이는 에이전트가 반복적인 실수를 방지하고 복잡한 환경에서 지속적으로 학습하는 '지속적 학습자(Continuous Learner)'로 거듭나게 하는 핵심 기술입니다. **전략적 통찰의 구조화와 추출** - ReasoningBank는 단순히 과거의 행동을 기록하는 것이 아니라, 제목(Title), 설명(Description), 내용(Content)으로 구성된 고차원의 구조화된 메모리 항목을 생성합니다. - '검색-추출-통합'의 연속적인 폐쇄 루프(Closed-loop)를 통해 작동하며, LLM-as-a-judge 기능을 활용해 에이전트의 궤적을 스스로 평가하고 통찰을 도출합니다. - 특히 실패한 경험에서 '반사실적 신호(Counterfactual signals)'를 분석하여, "무한 스크롤 함정에 빠지지 않기 위해 현재 페이지 식별자를 먼저 확인하라"와 같은 예방적 가드레일을 구축하는 데 탁월합니다. **메모리 기반 테스트 시간 확장(MaTTS)** - 추론 시점의 컴퓨팅 자원 확장(Test-time scaling)을 메모리와 결합하여 학습 신호를 극대화하는 MaTTS 기법을 도입했습니다. - **병렬 확장(Parallel scaling):** 동일한 쿼리에 대해 여러 경로를 생성하고 이를 상호 비교함으로써 더 견고한 전략을 합성하고 고품질의 메모리를 생성합니다. - **순차 확장(Sequential scaling):** 단일 작업 내에서 추론을 반복적으로 정제하며, 시행착오 과정에서 발생하는 중간 단계의 통찰을 메모리에 기록합니다. - 이 과정에서 고품질 메모리는 확산된 탐색을 유망한 전략으로 안내하고, 확장된 상호작용은 다시 메모리를 풍부하게 만드는 시너지 효과를 냅니다. **성능 향상 및 전략적 성숙도의 발현** - WebArena 및 SWE-Bench-Verified 벤치마크 평가 결과, 메모리가 없는 기본 모델 대비 성공률이 최대 8.3% 향상되었으며, 작업당 실행 단계는 평균 3단계 가량 단축되었습니다. - 에이전트가 축적된 지식을 바탕으로 점진적으로 발전하는 '전략적 성숙도'가 관찰되었습니다. 초기의 단순한 절차적 체크리스트가 시간이 흐름에 따라 복잡한 조건부 논리 구조를 가진 고급 메모리로 진화했습니다. - 실험 결과 ReasoningBank는 자기 평가 과정의 일부 노이즈에도 강건하게 작동하며, 확장(Scaling)과 결합했을 때 효율성이 더욱 극대화됨이 증명되었습니다. 단순히 성공한 워크플로우를 저장하는 것을 넘어, 실패로부터 배우고 추론 과정을 일반화하는 ReasoningBank의 접근법은 자율형 에이전트의 실용성을 높이는 강력한 도구입니다. 복잡한 소프트웨어 엔지니어링이나 동적인 웹 환경에서 작동하는 에이전트를 설계한다면, 실행 시간의 연산량을 메모리 업데이트로 전환하는 MaTTS 방식의 도입을 적극 고려해 볼 수 있습니다.

google원문

ConvApparel: 사용자 시뮬레이터의 현실성 격차 측정 및 해소 (새 탭에서 열림)

ConvApparel은 LLM 기반 사용자 시뮬레이터와 실제 인간 사이의 '리얼리즘 격차(Realism Gap)'를 정량화하고 이를 좁히기 위해 설계된 새로운 데이터셋이자 평가 프레임워크입니다. 이 연구는 시뮬레이터가 단순히 인간의 말투를 흉내 내는 것을 넘어, 시스템의 오류나 불친절한 응답에 대해 인간처럼 좌절하거나 반응하는지 검증하는 데 중점을 둡니다. 이를 통해 실제 환경에서도 견고하게 작동하는 대화형 AI 에이전트를 학습시키고 테스트할 수 있는 신뢰할 수 있는 기반을 제공합니다. ### 리얼리즘 격차와 시뮬레이터의 한계 현재 대화형 AI 학습에 사용되는 LLM 기반 시뮬레이터는 실제 사용자 행동과 시스템적으로 괴리된 모습을 보입니다. * **비현실적인 특성:** 시뮬레이터는 과도하게 장황하거나, 일관된 페르소나가 부족하며, 실제 인간이라면 느낄 법한 좌절감을 표현하지 못하고 비정상적인 인내심을 보이는 경향이 있습니다. * **과적합의 위험:** 특정 데이터로만 학습된 시뮬레이터는 훈련 시 보지 못했던 새로운 에이전트 정책을 만났을 때 적절히 반응하지 못하고 훈련 패턴만 맹목적으로 반복하는 한계가 있습니다. * **훈련 결과의 불일치:** 현실성 없는 시뮬레이터로 학습된 에이전트는 실제 사용자에게 배포되었을 때 예상치 못한 상황에서 실패할 가능성이 높습니다. ### ConvApparel 데이터셋과 이중 에이전트 프로토콜 의류 쇼핑 도메인(CRS)을 배경으로 구축된 ConvApparel은 인간의 다양한 감정 스펙트럼을 포착하기 위해 독특한 실험 설계를 채택했습니다. * **이중 에이전트 구조:** 사용자를 무작위로 '좋은(Good) 에이전트'와 의도적으로 불친절하고 혼란을 주는 '나쁜(Bad) 에이전트'에 배정하여 만족부터 분노까지의 폭넓은 반응을 수집했습니다. * **대규모 데이터:** 총 4,000건 이상의 인간-AI 대화와 약 15,000회의 턴(turn)으로 구성되어 통계적 유의성을 확보했습니다. * **세밀한 주석(Annotation):** 각 대화의 턴마다 사용자가 느낀 만족도, 좌절감, 구매 가능성 등 주관적인 내부 상태를 직접 보고하게 하여 시뮬레이터 검증을 위한 지표(Ground Truth)로 활용했습니다. ### 시뮬레이터 신뢰도 측정을 위한 3대 지표 연구팀은 시뮬레이터가 실제 인간과 얼마나 유사한지 다각도로 평가하기 위해 세 가지 핵심 지표를 제안합니다. * **인구 통계적 통계 정렬(Population-level Alignment):** 대화의 길이, 턴당 단어 수, 거절이나 수락과 같은 대화 행위(Dialog Acts)의 분포가 실제 인간 군집의 통계와 일치하는지 확인합니다. * **인간 유사성 점수(Human-likeness Score):** 실제 대화와 합성 대화를 구분하도록 학습된 판별기(Discriminator)를 통해 시뮬레이션된 대화가 얼마나 인간적인 스타일을 갖췄는지 정량화합니다. * **인과적/반사실적 검증(Counterfactual Validation):** '좋은' 에이전트와의 대화만 학습한 시뮬레이터가 생소하고 불친절한 '나쁜' 에이전트를 만났을 때, 실제 인간처럼 만족도가 급감하고 좌절감이 상승하는지 테스트하여 적응력을 평가합니다. ### 결론 및 제언 성공적인 대화형 AI 개발을 위해서는 시뮬레이터가 단순히 친절한 조수 역할에 머물러서는 안 되며, 불완전하고 때로는 쉽게 짜증을 내는 인간의 본성을 정확히 반영해야 합니다. ConvApparel 프레임워크는 프롬프트 기반, 인메모리 학습(ICL), 지도 미세 조정(SFT) 등 다양한 방식으로 구축된 시뮬레이터의 성능을 엄격하게 평가할 수 있는 도구를 제공합니다. 향후 대화형 시스템 개발자들은 이러한 다각적 검증 지표를 활용함으로써, 실험실 환경을 넘어 실제 복잡한 사용자 환경에서도 안정적으로 작동하는 에이전트를 구축할 수 있을 것입니다.

google원문

학술 워크플로우 개선: 더 나은 그림과 피어 리뷰를 위한 두 가지 AI 에이전트 소개 (새 탭에서 열림)

구글 클라우드 연구진은 학술 연구의 효율성을 극대화하기 위해 시각화 도구인 **PaperVizAgent**와 논문 리뷰 자동화 시스템인 **ScholarPeer**라는 두 가지 AI 에이전트 프레임워크를 공개했습니다. 이 시스템들은 연구자가 단순 반복적인 작업이나 행정적 부담에서 벗어나 혁신에 집중할 수 있도록 돕는 것을 목표로 하며, 실험 결과 전문가 수준의 도식 생성과 엄격한 논문 심사 능력을 입증했습니다. 이는 AI가 단순한 보조 도구를 넘어 학술 생태계의 능동적인 참여자로 진화하고 있음을 시사합니다. ### PaperVizAgent: 출판 가능한 수준의 학술 도식 생성 PaperVizAgent는 논문 텍스트를 기반으로 전문가급의 방법론 도식이나 통계 그래프를 생성하는 자율 프레임워크입니다. * **다중 에이전트 협업:** 검색(Retriever), 계획(Planner), 스타일 지정(Stylist), 시각화(Visualizer), 비평(Critic)을 담당하는 5개의 전문 에이전트가 팀을 이루어 작동합니다. * **반복적 정교화 프로세스:** 비평 에이전트가 생성된 결과물과 원문 사이의 불일치를 찾아내면, 시각화 에이전트가 이를 피드백으로 받아 수정을 반복하며 정확도를 높입니다. * **주요 입력 요소:** 연구의 기술적 세부 사항이 담긴 '소스 컨텍스트'와 시각적으로 전달하려는 의도를 담은 '도식 캡션'만으로 고품질 이미지를 생성합니다. * **성능 입증:** 신뢰성, 간결성, 가독성, 심미성 평가에서 기존의 GPT-Image-1.5나 Paper2Any를 능가했으며, 특히 간결성과 심미성 측면에서 인간 기준 점수(50점)를 상회하는 60.2점을 기록했습니다. ### ScholarPeer: 시니어 리뷰어를 모사하는 논문 심사 에이전트 ScholarPeer는 숙련된 연구자의 워크플로우를 따라 논문의 기술적 타당성을 검증하고 심사평을 작성하는 검색 기반 멀티 에이전트 시스템입니다. * **이중 스트림 정보 처리:** 문맥 습득과 능동적 검증이라는 두 가지 경로를 통해 단순히 텍스트를 생성하는 것이 아니라, 실제 문헌에 근거한 비판을 수행합니다. * **특화된 에이전트 구성:** 실시간 웹 검색으로 도메인 지식을 보강하는 '히스토리언 에이전트'와 저자가 놓친 데이터셋이나 비교 대상을 찾는 '스카우트 에이전트'가 포함됩니다. * **기술적 검증 엔진:** 다각도 Q&A 엔진이 논문의 기술적 주장을 엄격하게 검증하여, 강점과 약점 및 저자 질문이 포함된 전문적인 리뷰 보고서를 생성합니다. * **신뢰성 확보:** 기존 자동 리뷰 시스템 대비 높은 승률(Win-rate)을 보였으며, AI 특유의 환각 현상을 줄이고 실제 인간 리뷰어와 유사한 비판적이고 구체적인 피드백을 제공합니다. ### 학술 연구의 미래와 제언 이러한 AI 에이전트들의 등장은 기하급수적으로 증가하는 논문 제출량으로 인한 리뷰어들의 피로감을 해소하고, 시각화 역량이 부족한 연구자들에게 강력한 지원군이 될 것입니다. 연구자들은 이러한 도구를 활용해 연구의 전달력을 높이는 동시에, 제출 전 셀프 리뷰 단계에서 ScholarPeer를 활용해 논문의 논리적 허점을 미리 보완함으로써 승인 가능성을 높이는 전략을 취할 수 있습니다. 결과적으로 AI 에이전트는 학술 워크플로우 전반의 질적 수준을 상향 평준화하는 데 기여할 것으로 기대됩니다.

google원문

LLM의 행동 성향 정렬 평가 (새 탭에서 열림)

구글 리서치는 대규모 언어 모델(LLM)의 행동 성향을 정밀하게 측정하기 위해 심리학적 방법론인 상황 판단 테스트(SJT)를 도입한 새로운 평가 프레임워크를 제시했습니다. 연구 결과, 최신 대형 모델들은 인간의 의견이 만장일치로 일치하는 상황에서는 높은 정렬 수준을 보였으나, 의견이 갈리는 복잡한 사회적 상황에서는 인간의 다양한 관점을 반영하지 못하고 특정 답변에 과하게 확신하는 경향을 보였습니다. 이는 LLM이 인간 사회의 미묘한 역학을 더욱 정교하게 탐색하기 위해 행동 정렬 방식의 개선이 필요함을 시사합니다. **심리학적 기반의 상황 판단 테스트(SJT) 설계** * 단순한 자기보고식 설문(예: "나는 의견을 빨리 표현한다")의 한계를 극복하기 위해, 실제 사용자-어시스턴트 상호작용 상황을 가정한 시나리오 기반의 SJT를 구축했습니다. * IRI(공감), ERQ(정서 조절) 등 검증된 심리학적 척도를 바탕으로 전문적 침착함, 갈등 해결, 일상적 의사결정 등 다양한 사회적 맥락을 반영하는 시나리오를 생성했습니다. * 모델의 자연어 응답을 'LLM-as-a-judge' 방식을 통해 두 가지 대조되는 행동 선택지 중 하나로 매핑하고, 이를 550명의 인간 주석자가 내놓은 반응 분포와 비교하여 정렬도를 측정했습니다. **모델 규모에 따른 행동 방향성 일치도** * 25개의 LLM을 분석한 결과, 25B(250억 개) 미만의 소형 모델은 인간의 다수 의견과 일치하는 선택을 하는 '방향성 일치도'가 현저히 낮았으며, 때로는 무작위 수준의 선택을 보였습니다. * 120B 이상의 대형 모델과 최신 프런티어 모델들은 인간의 합의가 만장일치(10/10)인 상황에서 거의 완벽한 일치도를 보였으나, 합의율이 80~90%로 낮아지면 모델의 성능도 80%대 초중반에서 정체되었습니다. * 구체적인 일탈 사례로, 모델은 인간이 '침착함'을 권장하는 전문적인 상황에서 '감정적 개방성'을 지나치게 독려하거나, 갈등 상황에서 자기 주장을 하기보다 과도하게 화합만을 우선시하는 경향을 보였습니다. **분포적 정렬의 한계와 과잉 확신 문제** * 인간 사회의 다양한 관점을 반영해야 한다는 '분포적 다원주의' 관점에서 볼 때, 인간의 의견이 갈리는 상황에서는 모델의 응답 확률 분포도 낮아져야(즉, 확신이 줄어들어야) 합니다. * 그러나 테스트된 25개 모델 모두 인간의 합의 수준과 상관없이 특정 선택지에 대해 체계적인 '과잉 확신(Overconfidence)'을 보이는 것으로 나타났습니다. * 인간들 사이에서 선호도가 팽팽하게 나뉘는 시나리오에서도 모델은 확률 분포를 고르게 분산시키지 못하고, 특정 행동이 정답인 것처럼 높은 확신을 가지고 응답하는 한계를 드러냈습니다. 이 연구는 LLM이 인간의 행동 양식을 단순히 흉내 내는 것을 넘어, 사회적 맥락에 따라 유연하게 대응하고 인간 의견의 다양성을 존중하도록 설계되어야 함을 강조합니다. 향후 모델 개발 시 단순한 선호도 최적화를 넘어, 인간의 미묘한 사회적 역동성과 다원적 가치를 반영할 수 있는 정렬 기술이 중요하게 작용할 것입니다.

google원문

초전도 연구 질문에 대한 LLM 테스트 (새 탭에서 열림)

현대 물리학의 난제인 고온 초전도체 연구에서 대규모 언어 모델(LLM)이 전문가 수준의 파트너가 될 수 있는지를 검증한 결과, 선별된 고품질 자료를 기반으로 한 모델이 일반 범용 모델보다 압도적으로 우수한 성능을 보였습니다. 구글 리서치와 코넬 대학교 연구팀은 6개의 LLM을 대상으로 전문 지식을 묻는 67개의 질문을 던져 답변의 정확성과 신뢰성을 평가했으며, 이를 통해 특정 학문 분야에 특화된 데이터 큐레이션의 중요성을 입증했습니다. 결과적으로 NotebookLM과 맞춤형 RAG 시스템이 증거 제시와 균형 잡힌 시각 측면에서 가장 높은 점수를 받으며 전문 과학 연구를 돕는 도구로서의 가능성을 보여주었습니다. **연구 배경 및 고온 초전도체 사례 선정** * 고온 초전도체(구프레이트 화합물)는 영하 140도 이상의 온도에서 전기 저항이 0이 되는 현상으로, 1987년 노벨상 수상 이후에도 여전히 메커니즘 규명이 진행 중인 복잡한 분야입니다. * 수십 년간 축적된 방대한 논문과 서로 대립하는 다양한 이론들로 인해, 신규 연구자가 지식의 전체상을 파악하고 중립적인 관점을 유지하기가 매우 어렵습니다. * 이번 연구는 LLM이 이러한 전문 분야에서 편향되지 않은 지식을 제공하고, 가설 설정을 돕는 '연구 파트너'로서 기능할 수 있는지 확인하기 위해 설계되었습니다. **평가 설계 및 실험 방법론** * 평가 대상은 웹 접근이 가능한 범용 모델 4종(GPT-4o, Perplexity, Claude 3.5, Gemini Advanced Pro 1.5)과 엄선된 자료만 사용하는 폐쇄형 시스템 2종(NotebookLM, 맞춤형 RAG)으로 구성되었습니다. * 폐쇄형 시스템 구축을 위해 초전도체 전문가 12명이 선정한 15개의 핵심 리뷰 논문과 이들이 인용한 약 1,726개의 실험 및 이론 논문을 데이터 소스로 활용했습니다. * 전문가 패널은 "LSCO의 어느 도핑 수준에서 립시츠 전이가 발생하는가?"와 같이 고도의 전문성을 요구하는 67개의 질문을 작성하여 각 모델의 답변을 블라인드 테스트로 평가했습니다. **주요 결과 및 모델별 성능 평가** * 6가지 평가지표(균형 잡힌 시각, 포괄성, 간결성, 증거 토대, 시각적 관련성, 정성적 피드백)에서 구글의 NotebookLM이 가장 뛰어난 성과를 거두었으며, 맞춤형 RAG 시스템이 그 뒤를 이었습니다. * 특히 NotebookLM은 문헌 근거를 제시하는 '증거 토대' 항목에서 가장 높은 점수를 받았으며, 이는 전문가가 검증한 신뢰할 수 있는 소스 내부에서 답을 찾도록 제한한 것이 주효했음을 보여줍니다. * Gemini Advanced Pro 1.5와 NotebookLM은 여러 대립하는 이론적 관점을 골고루 다루는 '균형 잡힌 시각' 항목에서 우수한 점수를 기록하여 과학적 중립성을 잘 유지했습니다. 이번 사례 연구는 범용적인 웹 검색 기반 AI보다 신뢰할 수 있는 학술 출처를 사전에 큐레이션한 '폐쇄형 데이터 시스템'이 전문 과학 연구에서 훨씬 유용하다는 사실을 시사합니다. 향후 과학적 발견을 가속화하기 위해서는 모델 자체의 성능 개선뿐만 아니라, 검증된 데이터셋을 효과적으로 활용하는 검색 증강 생성(RAG) 기술의 고도화가 필수적입니다. 연구자들은 AI를 단순한 정보 검색 도구를 넘어, 복잡한 이론적 쟁점을 정리하고 논리적 허점을 찾아주는 비판적 사고의 동료로 활용할 수 있을 것입니다.

google원문

LLM에게 베이지안처럼 추 (새 탭에서 열림)

거대언어모델(LLM)이 사용자와 상호작용하며 최적으로 추론하도록 하기 위해, 베이즈 정리(Bayes' rule)를 따르는 모델의 예측 과정을 모방하도록 학습시키는 '베이지안 티칭(Bayesian teaching)' 프레임워크가 제안되었습니다. 기존 LLM은 새로운 정보가 주어져도 확률적 추론에 한계를 보이며 성능이 정체되는 경향이 있었으나, 최적의 베이지안 모델을 파인튜닝 지표로 삼음으로써 불확실성을 관리하고 신념을 업데이트하는 능력을 크게 개선했습니다. 연구 결과, 이 방식은 특정 작업의 성능을 높일 뿐만 아니라 학습하지 않은 새로운 도메인으로의 일반화 가능성까지 입증하며 LLM의 근본적인 추론 기술 향상 가능성을 보여주었습니다. **LLM의 확률적 추론 능력 평가** * **항공편 추천 시뮬레이션:** 출발 시간, 소요 시간, 경유 횟수, 비용 등 다양한 선호도를 가진 가상 사용자와 5단계에 걸쳐 상호작용하며 최적의 항공편을 추천하는 과제를 수행했습니다. * **베이지안 어시스턴트와 비교:** 최적의 베이지안 전략을 따르는 모델을 기준점으로 삼아, LLM이 새로운 정보에 따라 사용자 선호도 추정치를 얼마나 잘 업데이트하는지 측정했습니다. * **성능 정체 현상 발견:** 일반적인 LLM은 첫 번째 상호작용 이후 성능이 정체되는 반면, 베이지안 모델은 정보가 쌓일수록 정확도가 지속적으로 향상되는 격차를 보였습니다. 이는 LLM이 새로운 정보를 통합하여 내부 표현을 수정하는 데 취약함을 의미합니다. **베이지안 티칭 프레임워크의 구조** * **사전 신념과 사후 신념의 순환:** 모델이 가진 기존 지식(Prior)을 새로운 증거(Evidence)와 결합하여 업데이트된 지식(Posterior)으로 전환하는 과정을 지도 학습(Supervised Fine-tuning)으로 구현했습니다. * **오라클 티칭(Oracle Teaching):** 사용자의 실제 정답(완벽한 선호도 정보)만을 학습 데이터로 제공하는 방식으로, 모델이 항상 정답만을 맞히도록 유도합니다. * **베이지안 티칭(Bayesian Teaching):** 베이지안 어시스턴트가 정보가 부족한 상황에서 내린 '확률적인 최선의 추측' 과정을 모방하게 하는 일종의 증류(Distillation) 기법입니다. * **불확실성 학습:** 베이지안 티칭은 모델에게 정답뿐만 아니라, 정보가 불충분할 때 가질 수 있는 불확실성을 유지하고 논리적으로 추론하는 법을 가르칩니다. **학습 결과 및 추론 기술의 일반화** * **추론 정확도 역전:** 베이지안 티칭을 거친 LLM은 정답 데이터만을 학습한 오라클 티칭 모델보다 실제 사용자 선택을 예측하는 데 더 높은 성과를 거두었습니다. * **베이지안 모델과의 높은 일치도:** 파인튜닝된 LLM은 정보 업데이트 방식에서 베이지안 모델과 유사한 패턴을 보였으며, 이는 모델이 단순 암기가 아닌 확률적 사고방식을 체득했음을 보여줍니다. * **도메인 확장성:** 훈련에 사용되지 않은 다른 유형의 작업에서도 베이지안 추론 방식을 적용하는 능력이 향상되었습니다. 이는 LLM이 예시를 통해 일반적인 추론 기술을 학습하고 이를 새로운 영역으로 전이할 수 있음을 시사합니다. LLM을 단순한 챗봇을 넘어 지능형 에이전트로 활용하기 위해서는 단순히 정답(Ground Truth)만을 학습시키기보다, 베이지안 모델과 같은 최적의 사고 과정을 데이터화하여 학습시키는 전략이 유효할 것으로 보입니다. 이는 특히 사용자 개인화가 중요한 추천 시스템이나 복잡한 의사결정 지원 시스템 구축에 실용적인 해결책이 될 수 있습니다.

google원문

Draft 1: 일대일을 (새 탭에서 열림)

DialogLab은 기존의 1:1 대화 모델을 넘어 복잡한 다자간 대화 시뮬레이션을 가능하게 하는 오픈소스 연구 프로토타입입니다. 이 프레임워크는 구조화된 스크립트의 예측 가능성과 생성형 AI의 즉흥성을 결합하여, 사용자가 사회적 역학 관계를 정의하고 동적인 대화 흐름을 설계 및 테스트할 수 있도록 지원합니다. 이를 통해 개발자와 디자이너는 실제 인간의 대화와 유사한 복잡한 그룹 상호작용을 효율적으로 구현하고 검증할 수 있습니다. ### 사회적 구조와 대화 흐름의 분리 DialogLab의 핵심은 대화의 '사회적 설정'과 '시간적 흐름'을 독립적인 차원으로 분리하여 관리하는 데 있습니다. * **그룹 역학(Group Dynamics):** 대화의 사회적 구조를 정의합니다. 전체 컨테이너인 '그룹', 특정 역할을 가진 하위 그룹인 '파티(Parties)', 그리고 개별 참여자나 공유 콘텐츠인 '엘리먼트(Elements)'로 구성됩니다. * **대화 흐름 역학(Conversation Flow Dynamics):** 대화가 시간에 따라 전개되는 방식을 정의합니다. 대화의 단계를 '스니펫(Snippets)'으로 나누어 각 단계별 참여자, 대화 순서, 상호작용 스타일(협력적 혹은 논쟁적 등)을 설정할 수 있습니다. * **세밀한 규칙 설정:** 단순한 대화를 넘어 끼어들기(Interruptions)나 백채널링(Backchanneling, 맞장구)과 같은 세밀한 규칙을 추가하여 실제와 유사한 대화 환경을 조성합니다. ### 저작-시뮬레이션-검증의 통합 워크플로우 DialogLab은 시각적 인터페이스를 통해 대화를 설계하고 즉시 테스트하며 분석할 수 있는 효율적인 단계를 제공합니다. * **시각적 저작 도구:** 드래그 앤 드롭 방식의 캔버스를 통해 아바타와 콘텐츠를 배치하고, 인스펙터 패널에서 페르소나와 상호작용 패턴을 세부적으로 설정할 수 있습니다. AI가 대화 프롬프트를 자동 생성하는 기능을 지원하여 설계 속도를 높입니다. * **인간 중심 시뮬레이션(Human-in-the-loop):** 라이브 프리뷰 패널에서 대화 내용을 실시간으로 확인하며, '인간 제어' 모드를 통해 AI가 제안하는 답변을 수정, 수락 또는 거부하며 대화의 방향을 직접 조정할 수 있습니다. * **분석 및 검증 대시보드:** 대화가 끝난 후 타임라인 뷰와 사후 분석 도구를 통해 참여자 간의 발언 분포, 감정의 흐름 등을 시각적으로 분석하여 대화의 품질을 검증합니다. ### 실제 테스트 결과 및 사용자 경험 게임 디자인, 교육, 사회과학 분야의 전문가 14명을 대상으로 실시한 평가에서 DialogLab은 다자간 대화 설계의 유연성을 입증했습니다. * **세 가지 테스트 조건:** 사용자가 직접 AI의 반응을 제어하는 '인간 제어형', 미리 정의된 순서대로 반응하는 '자율형', 직접적인 언급에만 반응하는 '반응형' 모델을 비교했습니다. * **높은 몰입감과 현실성:** 전문가들은 '인간 제어형' 모드에서 가장 높은 몰입감과 현실성을 느꼈다고 평가했으며, 이는 복잡한 사회적 시뮬레이션에서 인간의 개입과 제어 능력이 중요함을 시사합니다. * **효율적인 이터레이션:** 시각적인 드래그 앤 드롭 인터페이스와 자동 생성 프롬프트 덕분에 대화 시나리오를 빠르게 반복 수정하고 테스트하는 과정이 매우 직관적이라는 피드백을 받았습니다. DialogLab은 교육용 시뮬레이션, 게임 캐릭터 간의 상호작용 설계, 혹은 복잡한 사회적 역동성을 연구하는 학술적 목적에 특히 유용합니다. 단순히 AI와 대화하는 것을 넘어, AI가 포함된 그룹 내에서의 인간 관계와 소통 방식을 정교하게 설계하고자 하는 기획자들에게 강력한 도구가 될 것입니다.

google원문

에이전트 시스템 확장의 과학 (새 탭에서 열림)

구글 리서치는 AI 에이전트 시스템 설계에 있어 '에이전트 수가 많을수록 좋다'는 기존의 통념을 깨고, 과업의 특성에 따라 최적의 아키텍처가 달라짐을 실증적으로 분석했습니다. 180가지 에이전트 설정에 대한 대규모 실험 결과, 병렬 처리가 가능한 과업에서는 멀티 에이전트가 성능을 크게 향상시키지만 순차적 추론이 필요한 과업에서는 오히려 성능을 저하시킨다는 점을 발견했습니다. 연구팀은 이러한 정량적 원칙을 바탕으로 새로운 과업에 대해 최적의 구조를 87% 확률로 예측하는 모델을 제시하며 '에이전트 스케일링의 과학'을 제안합니다. ## 에이전트 시스템의 5가지 핵심 아키텍처 연구팀은 에이전트의 확장 방식을 이해하기 위해 다음과 같은 다섯 가지 표준 아키텍처를 정의하고 비교했습니다. * **단일 에이전트 (SAS):** 혼자서 모든 추론과 행동 단계를 순차적으로 수행하며 단일 메모리 스트림을 유지합니다. * **독립형 (Independent):** 여러 에이전트가 통신 없이 병렬로 하위 작업을 수행한 뒤 최종 결과만 합산합니다. * **중앙 집중형 (Centralized):** 중앙 조정자(Orchestrator)가 작업을 할당하고 결과를 합성하는 '허브 앤 스포크' 모델입니다. * **분산형 (Decentralized):** 에이전트들이 직접 소통하며 정보를 공유하고 합의에 도달하는 P2P 방식입니다. * **하이브리드 (Hybrid):** 계층적 감독과 에이전트 간 직접 통신을 결합하여 유연성과 통제력의 균형을 맞춥니다. ## 과업 특성에 따른 성능 차이: 병렬성과 순차성 에이전트 시스템의 성능은 과업이 가진 본질적인 구조에 따라 극명하게 갈리는 것으로 나타났습니다. * **병렬 과업의 이점:** 금융 분석처럼 하위 작업 분해가 용이한 과업에서는 중앙 집중형 아키텍처가 단일 에이전트 대비 80.9%의 성능 향상을 기록했습니다. * **순차적 추론의 페널티:** 엄격한 순서가 필요한 계획 수립(PlanCraft) 과업에서는 멀티 에이전트 구조 도입 시 성능이 오히려 39~70% 급락했습니다. 이는 통신 비용이 추론에 필요한 '인지 예산'을 잠식하기 때문입니다. * **도구 사용의 병목 현상:** 사용하는 도구의 개수가 많아질수록 에이전트 간 조율에 드는 비용이 기하급수적으로 증가하는 '도구-조율 트레이드오프'가 발생합니다. ## 신뢰성 보장을 위한 아키텍처의 역할 실제 배포 상황에서 중요한 오류 확산 방지 측면에서도 아키텍처별 성능 차이가 뚜렷했습니다. * **오류 증폭 위험:** 에이전트 간 소통이 없는 독립형 시스템은 한 에이전트의 실수가 최종 결과에 미치는 악영향이 단일 에이전트보다 17.2배나 높았습니다. * **중앙 관리의 검증 효과:** 중앙 집중형 시스템은 조정자가 '검증 병목(Validation Bottleneck)' 역할을 수행하여 오류 증폭을 4.4배 수준으로 낮추며 가장 안정적인 결과를 보였습니다. ## 최적의 에이전트 설계를 위한 제언 연구팀은 과업의 도구 수와 분해 가능성 등 측정 가능한 속성을 통해 최적의 아키텍처를 결정할 수 있는 예측 모델을 개발했습니다. * 무조건 에이전트 수를 늘리기보다, 과업이 병렬 처리에 적합한지(금융 분석 등) 혹은 순차적 정확도가 중요한지(코딩, 계획 등)를 먼저 파악해야 합니다. * 시스템의 복잡도가 높아질수록 오류 확산을 막기 위해 중앙 조정자를 둔 계층적 구조를 채택하는 것이 안정성 측면에서 유리합니다. * 이 연구에서 제시된 예측 모델을 활용하면 새로운 도메인에서도 80% 이상의 정확도로 가장 효율적인 에이전트 구성을 사전에 선택할 수 있습니다.

google원문

ATLAS: 다국어 모델 (새 탭에서 열림)

ATLAS는 400개 이상의 언어를 포함한 대규모 실험을 통해 다국어 언어 모델의 성능과 효율성을 최적화하는 새로운 스케일링 법칙을 제시합니다. 이 연구는 특정 목표 언어의 성능을 극대화하기 위해 모델 크기, 학습 데이터 양, 그리고 언어 간의 혼합 비율을 어떻게 설정해야 하는지에 대한 구체적인 데이터 기반 지침을 제공합니다. 특히 다국어 학습 시 발생하는 성능 저하를 방지하기 위해 모델 용량과 데이터 규모를 확장하는 정량적 공식을 확립하여 실무적인 모델 구축 가이드를 제안합니다. ### ATLAS의 구성과 작동 원리 * 기존의 단일 언어 중심 스케일링 법칙을 확장하여, 복잡한 다국어 환경에서 목표 언어의 성능을 최적화하기 위한 모델 크기와 데이터 볼륨을 결정합니다. * 학습 데이터 소스를 목표 언어, 유사 언어 그룹(예: 카탈루냐어의 경우 스페인어, 이탈리아어 등), 그리고 나머지 전체 언어의 세 가지 범주로 분류하여 각 소스가 성능에 미치는 긍정적/부정적 영향을 분석합니다. * 다국어 환경에서 효율적으로 모델을 확장하기 위한 가이드와, 특정 언어를 위해 모델을 처음부터 사전 학습할지 혹은 기존 다국어 체크포인트에서 미세 조정을 할지 결정하는 규칙을 포함합니다. ### 교차 언어 전이 행렬과 시너지 분석 * 1,400개의 언어 쌍을 분석하여 특정 언어의 학습이 다른 언어의 성능 향상에 기여하는 정도를 수치화한 전이 행렬을 생성했습니다. * 분석 결과, 동일한 문자 체계(Script)나 언어 가족을 공유하는 언어들 사이에서 가장 강력한 긍정적 전이 효과가 나타났습니다 (p < .001). * 영어, 프랑스어, 스페인어는 웹 데이터의 높은 품질과 다양성 덕분에 대부분의 언어 학습에 도움을 주는 '보편적 조력자' 역할을 수행하며, 언어 간의 전이 효과는 항상 대칭적이지 않다는 점을 발견했습니다. ### '다국어의 저주' 극복을 위한 확장 규칙 * 지원하는 언어 수가 늘어날수록 모델 용량의 한계로 인해 개별 언어의 성능이 하락하는 '다국어의 저주(Curse of Multilinguality)' 현상을 정량적인 스케일링 법칙으로 정립했습니다. * 연구에 따르면 지원 언어 수를 2배로 늘릴 때 기존 성능을 유지하려면 모델 크기는 1.18배, 전체 데이터 양은 1.66배 증가시켜야 합니다. * 이 규칙을 따르면 개별 언어당 할당되는 데이터 비중이 줄어들더라도, 언어 간의 시너지 효과를 통해 모델 용량 제한에 따른 성능 저하를 상쇄할 수 있습니다. ### 사전 학습 vs 미세 조정의 전환점 * 특정 언어 모델 구축 시 처음부터 사전 학습을 할지, 아니면 다국어 모델을 미세 조정할지 결정하는 기준을 연산 자원(Compute) 투입량에 따라 제시합니다. * 가용 자원이 적은 초기 단계에서는 강력한 다국어 체크포인트를 활용한 미세 조정이 유리하지만, 학습량이 일정 수준을 넘어서면 처음부터 학습하는 방식이 성능상 우위를 점하게 됩니다. * 20억(2B) 파라미터 모델 기준, 이러한 역전 현상은 언어에 따라 약 1,440억에서 2,830억 토큰 사이에서 발생하는 것으로 나타났습니다. 실무적으로 다국어 모델을 구축할 때는 ATLAS의 전이 행렬을 참고하여 목표 언어와 시너지가 큰 언어들을 우선적으로 혼합하고, 지원 언어 수 증가에 맞춰 제시된 비율(모델 1.18배, 데이터 1.66배)로 자원을 확장하는 것이 가장 효율적입니다.

google원문

구글 리서치 2 (새 탭에서 열림)

2025년 구글 리서치는 기초 연구가 실제 제품과 사회적 가치로 연결되는 '혁신의 마법 주기(Magic Cycle)'를 가속화하며 생성형 AI, 과학적 발견, 양자 컴퓨팅 분야에서 기념비적인 성과를 거두었습니다. 제미나이 3(Gemini 3)로 대표되는 모델의 효율성과 사실성 개선은 물론, 스스로 도구를 사용하는 에이전트 모델과 질병 치료를 위한 바이오 AI 기술을 통해 기술적 한계를 한 단계 더 확장했습니다. 이러한 연구 결과는 단순한 기술 진보를 넘어 기후 변화 대응과 교육 등 인류 공통의 과제를 해결하는 데 실질적인 기여를 하고 있습니다. **생성형 모델의 효율성 및 신뢰성 고도화** * **추론 효율성 최적화:** '투기적 디코딩(Speculative decoding)'과 가상 머신 작업 수명을 예측하는 'LAVA' 알고리즘을 도입하여 대규모 클라우드 데이터 센터의 리소스 효율성과 비용 절감을 실현했습니다. * **사실성(Factuality) 강화:** 2021년부터 이어진 LLM 사실성 연구를 집대성하여 제미나이 3를 역대 가장 사실적인 모델로 구축했으며, FACTS 벤치마크 등을 통해 모델의 정보 근거 제시 능력을 입증했습니다. * **다국어 및 다문화 대응:** 오픈 모델인 '젬마(Gemma)'를 140개 이상의 언어로 확장하고, 문화적 맥락을 이해하는 'TUNA' 분류 체계와 'Amplify' 이니셔티브를 통해 글로벌 사용자에게 최적화된 AI 경험을 제공합니다. **생성형 UI와 지능형 에이전트의 등장** * **인터랙티브 인터페이스:** 사용자의 프롬프트에 따라 웹페이지, 게임, 도구 등의 시각적 인터페이스를 실시간으로 생성하는 '생성형 UI'를 제미나이 3에 도입했습니다. * **에이전트 기능(Agentic AI):** 단순 응답을 넘어 복잡한 작업을 수행하는 '프로젝트 자비스(Project Jarvis)'와 웹 브라우징 에이전트를 통해 사용자의 일상 업무를 자동화하는 능력을 선보였습니다. * **코드 및 추론 능력:** 고도화된 추론 아키텍처를 통해 소프트웨어 엔지니어링 성능을 비약적으로 향상시켰으며, 이는 구글 내부 코드의 25% 이상이 AI에 의해 생성되는 결과로 이어졌습니다. **과학적 혁신과 헬스케어의 진보** * **생물학적 발견:** 단백질 구조 예측을 넘어 분자 상호작용을 모델링하는 'AlphaFold 3'와 새로운 단백질을 설계하는 'AlphaProteo'를 통해 신약 개발과 질병 이해의 속도를 높였습니다. * **의료 특화 모델:** 'Med-Gemini'와 같은 의료 전용 모델을 개발하여 흉부 엑스레이 분석, 유전체 데이터 해석 등 전문적인 의료 진단 보조 도구로서의 가능성을 확인했습니다. * **뇌 과학 연구:** 하버드 대학과의 협력을 통해 인간 대뇌 피질의 시냅스 수준 지도를 제작하는 등 신경과학 분야에서도 전례 없는 성과를 냈습니다. **양자 컴퓨팅과 지구 과학을 통한 미래 대비** * **양자 우위와 실용화:** 양자 오류 정정 기술의 혁신을 통해 실제 문제 해결에 활용 가능한 양자 컴퓨팅 시대를 앞당겼습니다. * **기후 및 환경 대응:** 산불을 실시간으로 추적하는 'FireSat' 위성 네트워크와 비행운(Contrails) 감소 연구 등을 통해 기후 위기 대응을 위한 구체적인 AI 솔루션을 제시했습니다. * **책임감 있는 AI:** 콘텐츠의 출처를 밝히는 'SynthID' 워터마킹 기술을 텍스트와 비디오로 확대 적용하여 AI 생성 콘텐츠의 투명성과 안전성을 강화했습니다. 구글의 2025년 성과는 AI가 단순한 보조 도구를 넘어 과학 연구의 속도를 높이고 복잡한 사회 문제를 해결하는 강력한 에이전트로 진화했음을 보여줍니다. 기업과 연구자는 이제 단순한 챗봇 구현을 넘어, 특정 도메인에 특화된 에이전트 모델과 생성형 UI를 활용한 새로운 사용자 경험 설계에 집중해야 할 시점입니다.

google원문

Gemini, STOC 20 (새 탭에서 열림)

Google Research는 이론 컴퓨터 과학 분야의 최고 권위 학회인 STOC 2026 제출 논문을 대상으로, Gemini를 활용한 자동 피드백 도구를 실험적으로 도입했습니다. 이 도구는 복잡한 논리 구조와 수식을 검증하여 인간 연구자가 수개월 동안 발견하지 못한 치명적인 오류를 24시간 이내에 찾아내는 성과를 거두었습니다. 결과적으로 참여 저자의 97%가 피드백이 유용했다고 답하며, AI가 전문적인 연구 워크플로우를 보조하는 강력한 협업 도구가 될 수 있음을 증명했습니다. **추론 확장 기술을 통한 수학적 엄밀성 확보** * Gemini 2.5 Deep Think의 고급 버전에 적용된 '추론 확장(Inference Scaling)' 메서드를 활용하여 단순한 선형적 사고를 넘어 여러 해결 경로를 동시에 탐색합니다. * 다양한 추론 및 평가 흔적(traces)을 결합함으로써 LLM 특유의 환각 현상을 줄이고, 논문의 가장 핵심적인 논리적 결함에 집중할 수 있도록 최적화되었습니다. **구조화된 피드백 제공 방식** * 저자들에게는 논문의 기여도 요약, 주요 정리(Theorem) 및 보조 정리(Lemma)에 대한 구체적인 오류 지적 및 개선 제안, 오타 및 단순 교정 사항이 포함된 체계적인 리포트가 제공됩니다. * 단순한 문구 수정을 넘어 변수 이름의 불일치, 부등식의 잘못된 적용, 증명 과정에서의 논리적 공백 등 기술적인 디테일을 심층 분석합니다. **실제 연구 현장에서의 성과와 사용자 반응** * 실험에 참여한 논문의 80% 이상이 AI 리뷰를 선택했으며, 저자들은 수개월간 발견하지 못했던 '논문 전체를 부정하게 만드는 치명적인 버그'를 AI가 찾아냈다는 점에 주목했습니다. * 설문 결과 참여자의 97%가 재사용 의사를 밝혔으며, 81%는 논문의 명확성과 가독성이 크게 향상되었다고 평가했습니다. * 인간 리뷰어와 달리 중립적인 톤으로 신속하게(2일 이내) 피드백을 제공한다는 점이 큰 장점으로 꼽혔습니다. **전문가와 AI의 협업 모델 및 한계점** * 모델이 복잡한 표기법이나 그림을 해석하는 과정에서 간혹 환각을 일으키기도 하지만, 해당 분야의 전문가인 저자들은 AI의 출력물에서 '노이즈'를 걸러내고 유익한 통찰만을 선택적으로 수용하는 능력을 보여주었습니다. * 이는 AI가 인간을 대체하는 것이 아니라, 전문가의 판단을 돕고 검증의 시작점 역할을 수행하는 '보조적 파트너'로서 최적화되어 있음을 시사합니다. **교육적 가치와 미래 전망** * 설문에 응한 연구자의 75%는 이 도구가 학생들에게 수학적 엄밀성과 논문 작성법을 교육하는 데 큰 가치가 있다고 응답했습니다. * 연구 커뮤니티의 88%는 연구 프로세스 전반에 걸쳐 이러한 도구를 지속적으로 사용하기를 희망하고 있으며, Google은 향후 동료 검토(Peer Review) 과정을 대체하는 것이 아닌, 이를 보완하고 강화하는 방향으로 기술을 발전시킬 계획입니다. 연구자들은 이 도구를 단순한 자동 검토기가 아닌, 연구 초기 단계부터 논리의 빈틈을 메워주는 '상시 접속 가능한 동료 연구자'로 활용할 것을 권장합니다. 특히 복잡한 증명이 포함된 논문을 투고하기 전, 예상치 못한 논리적 오류를 사전에 필터링하는 용도로 매우 유용합니다.