Grafana에서 자연어로 장애 원인을 분석하기: LLM 에이전트 기반 SRELens 개발기 (새 탭에서 열림)

들어가며: 관측성 데이터는 많아졌지만, 분석은 여전히 어렵습니다 안녕하세요. LY Corporation에서 Home 서비스의 안정성을 책임지고 있는 Home SRE(Site Reliability Engineering) 팀입니다. 장애 알림이 울렸을 때의 장면을 떠올려 보겠습니다. 먼저 대시보드를 열어 메트릭을 확인합니다. 이어서 로그 플랫폼으로 이동해 같은 시간대의 에러 로그를 검색합니다. 그래도 원인이 명확하지 않으면 트레이스 도구를 열어 어떤 요청이 문제였는지 살펴봅니다. 필요하다면 프로파일…

AI 에이전트를 위한 Android CLI: 대규모 모바일 개발 환경에 적용하기 (새 탭에서 열림)

LINE Android 앱은 수백 명의 개발자가 하나의 Git 저장소에서 함께 만들어 가는, 수백 개의 Gradle 모듈로 구성된 대규모 Android 앱입니다. LINE Android 앱 개발 팀은 최근에 여러 AI 코딩 에이전트(주로 Claude Code, 그 외 Codex·OpenCode·Gemini in Android Studio 등)를 개발에 일상적으로 활용하고 있는데요. 이런 규모에서는 AI 에이전트가 토큰을 과도하게 소비하는 상황이 빈번하게 발생합니다. 코드가 방대해 하나의 검색 요…

토스의 디바이스 팜 만들기 (새 탭에서 열림)

안녕하세요, 사내 디바이스 팜 '네뷸라(Nebula)'를 만들고 운영하는 토스 Node.js 개발자 차영훈입니다. 먼저 디바이스 팜(Device Farm)이 뭔지부터 간단히 짚을게요. 테스트용 실제 스마트폰 여러 대를 서버에 연결해두고, 원격에서 제어하며 자동화 테스트를 돌리는 설비입니다. 개발자가 자리에 앉은 채로, 기기를 직접 만지지 않고도 실제 폰 위에서 앱을 테스트할 수 있게 해주죠. 네뷸라는 실기기를 24시간 연결해두고, 전사가 API 호출 한 번으로 함께 쓰는 디바이스 팜입니다. 그리…

LLM은 똑똑한데, 왜 우리 회사 일은 모를까 (새 탭에서 열림)

요즘 LLM은 공개된 지식에 관한 질문에는 꽤 능숙하게 답해요. 코드를 작성하고, 긴 문서를 요약하고, 복잡한 요청을 여러 단계로 나눠 처리하기도 하죠. 하지만 회사 안으로 들어오면 이야기가 달라져요. “이 기능의 현재 정책은 무엇인가요?” “문서에 적힌 내용이 실제 코드에도 반영되어 있나요?” “지난번 논의에서 결론이 바뀌지 않았나요?” 이런 질문에는 모델의 추론 능력만으로 답할 수 없어요. 답을 만드는 데 필요한 정보가 문서, 코드, 미팅 로그와 사내 메신저 등에 흩어져 있고, 각 정보가 여…