기본 콘텐츠로 건너뛰기

헤르메스에 날개를 달다: ego (lite) 브라우저로 로그인된 웹 업무 자동화하기

채팅하는 AI에서, 웹에서 실제로 일하는 AI로

Hermes Agent의 강점은 단순한 질의응답이 아닙니다. 파일을 읽고, 도구를 실행하고, 기억과 Skill을 축적하며, Slack이나 데스크톱 같은 여러 인터페이스에서 실제 업무를 이어갈 수 있다는 점입니다. 여기에 ego (lite)를 연결하면 Hermes가 로그인된 웹사이트를 눈에 보이는 브라우저에서 다룰 수 있습니다.

이번 글 자체가 그 실험입니다. 리서 역할의 Hermes가 공식 문서를 조사한 뒤, ego-browser로 ego (lite)의 한국어 가이드를 열고 내용을 확인했습니다. 이어 같은 TaskSpace에서 로그인된 Blogger 관리 화면으로 이동해 찰리초이 스토리 블로그까지 확인했습니다.

ego (lite)는 무엇인가

ego (lite)는 사람과 AI 에이전트가 함께 쓰도록 설계된 Chromium 계열 브라우저입니다. 에이전트는 별도의 Space에서 작업하므로 사용자가 보던 탭과 충돌하지 않으면서 웹페이지를 읽고, 클릭하고, 입력할 수 있습니다. 공식 사이트는 Chrome 데이터와 로그인 상태를 가져와 활용할 수 있다고 설명합니다.

Hermes와 ego (lite)는 같은 제품이 아닙니다. Hermes는 작업을 계획하고 도구를 선택하는 에이전트 런타임이고, ego (lite)는 실제 웹사이트를 조작하는 브라우저 환경입니다. 둘 사이는 ego-browser Skill이 연결합니다. 공개 GitHub 저장소에는 Skill과 문서가 MIT 라이선스로 제공되지만, ego (lite) 브라우저 앱은 별도의 무료 다운로드입니다.

왜 기본 헤드리스 브라우저 대신 ego (lite)를 쓰는가

일반적인 자동화 브라우저는 깨끗한 임시 프로필에서 시작하는 경우가 많습니다. 이 방식은 공개 웹 조사나 테스트에는 편하지만 Gmail, Blogger, Notion, 사내 시스템처럼 로그인 상태가 필요한 업무에서는 매번 인증 문제가 생깁니다.

ego (lite)는 사람이 사용하는 브라우저 맥락과 에이전트의 작업 공간을 Space로 분리합니다. 사용자는 자신의 작업을 계속하면서 에이전트가 별도 Space에서 어떤 페이지를 여는지 확인할 수 있습니다. 로그인이나 확인이 필요할 때 사람이 개입하고, 끝나면 에이전트가 다시 작업을 이어갈 수 있다는 점이 핵심입니다.

주의할 점도 있습니다. 로그인 상태를 쓸 수 있다는 것은 편의성과 권한이 동시에 커진다는 뜻입니다. 자동 게시, 구매, 계정 설정 변경처럼 되돌리기 어려운 작업은 승인 범위를 분명히 하고, 실행 뒤 결과를 반드시 다시 확인해야 합니다.

설치와 Hermes 연결

먼저 macOS에 ego (lite)를 설치하고 온보딩을 마칩니다. 현재 공식 GitHub README에 따르면 macOS를 지원하며 Windows와 Linux는 로드맵에 올라 있습니다.

온보딩을 마치면 ego-browser Skill이 일반적으로 다음 위치에 설치됩니다.

~/.agents/skills/ego-browser/

Hermes가 /ego-browser를 찾지 못한다면 Skill을 Hermes의 사용자 Skill 디렉터리로 복사합니다.

mkdir -p ~/.hermes/skills/ego-browser
cp -R ~/.agents/skills/ego-browser/. ~/.hermes/skills/ego-browser/

복사 후 Hermes를 다시 시작합니다. Desktop에서는 Settings > Safety에서 Approval Mode를 Smart로 설정하고, TUI에서는 공식 예시처럼 hermes --tui --yolo로 시작할 수 있습니다.

--yolo는 승인 프롬프트를 우회하므로 신뢰할 수 있는 작업에서만 사용해야 합니다. 외부 상태를 바꾸는 작업은 사용자의 명시적 승인 범위 안에서만 실행하세요.

첫 자동화 요청

Hermes에서 Skill 이름 뒤에 공백을 넣고 작업을 설명합니다.

/ego-browser Blogger 관리 화면을 열고 최근 게시물 제목 5개를 읽어줘.

공백이 없으면 Skill 이름과 작업 첫 단어가 하나의 명령으로 인식될 수 있습니다. /ego-browser 다음에 반드시 공백을 둡니다.

실제 내부 작업은 다음 흐름으로 진행됩니다.

  1. 하나의 TaskSpace를 만든다.
  2. p1 Page에서 목표 URL을 연다.
  3. Snapshot으로 페이지 구조와 요소를 읽는다.
  4. 의미 기반 selector나 Snapshot ref로 클릭·입력을 수행한다.
  5. URL, 제목, Snapshot을 다시 읽어 결과를 검증한다.
  6. 성공하면 TaskSpace를 종료한다.

코드로 직접 실행하는 예

ego-browser는 자체 Node.js 실행 환경에서 JavaScript를 실행합니다. Playwright를 따로 가져오거나 다른 브라우저를 띄우는 방식이 아닙니다.

ego-browser nodejs -e '
const task = await taskSpace("Blogger 글 목록 확인");
const page = task.page("p1");
await page.goto("https://www.blogger.com/");
await page.waitForLoadState();
console.log({
  spaceId: task.spaceId,
  title: await page.title(),
  url: await page.url()
});
console.log(await page.snapshot());
'

여기서 중요한 값은 spaceId입니다. 다음 명령에서는 새 TaskSpace를 만들지 않고 같은 ID를 다시 사용해야 로그인·탭·작업 맥락이 이어집니다.

Hermes의 기본 브라우저 자동화와 무엇이 다른가

Hermes 자체도 Browser Use, Firecrawl, Camofox, local Chromium, CDP 연결 등 여러 브라우저 백엔드를 지원합니다. 공식 Hermes 문서는 기본 로컬 브라우징이 깨끗한 프로필을 사용할 수 있고, 별도 설정으로 실제 Chromium 프로필의 스냅샷을 복사해 쓰는 방법도 설명합니다.

따라서 ego (lite)는 Hermes의 유일한 브라우저가 아니라 추가 통합 경로입니다. 공개 웹 조사라면 web_search나 web_extract가 더 빠르고 저렴할 수 있습니다. 반대로 Blogger처럼 로그인된 실제 서비스에서 사람이 보면서 개입해야 하는 작업이라면 ego (lite)의 Space 방식이 잘 맞습니다.

실전 적용 아이디어

  • Blogger 초안을 열고 제목·본문·라벨을 입력한 뒤 게시 결과 URL 확인
  • 로그인된 Notion에서 회의 기록을 찾아 요약 초안 만들기
  • X나 LinkedIn의 로그인된 피드에서 지정한 계정의 최신 게시물 정리
  • SaaS 관리자 화면에서 반복되는 현황 확인과 보고서 작성
  • 여러 사이트의 입력 작업을 Space별로 분리해 병렬 처리

자동화를 설계할 때는 ‘할 수 있는가’보다 ‘어디까지 맡길 것인가’를 먼저 정하는 편이 안전합니다. 읽기와 초안 작성은 자동화하고, 공개 게시·결제·삭제는 마지막에 사람이 승인하도록 나누는 방식이 실용적입니다.

문제 해결 체크리스트

/ego-browser가 보이지 않을 때

test -f ~/.hermes/skills/ego-browser/SKILL.md

파일이 없으면 ~/.agents/skills/ego-browser/에서 복사한 뒤 Hermes를 다시 시작합니다.

ego (lite)가 열리지 않을 때

  • Desktop의 Approval Mode가 Smart인지 확인
  • TUI라면 필요한 경우 hermes --tui --yolo로 새 세션 시작
  • ego-browser --help가 정상 실행되는지 확인
  • 로그인·2단계 인증·보안 확인은 사용자가 Space에서 직접 완료

작업이 예상과 다를 때

  • 같은 동작을 무작정 반복하지 말고 현재 Snapshot을 다시 읽기
  • 기존 TaskSpace와 Page를 유지한 채 복구하기
  • 게시 뒤 Blogger 글 목록과 공개 URL을 다시 읽어 검증하기

정리

Hermes는 일을 계획하고 기억하며 Skill로 성장하는 에이전트이고, ego (lite)는 그 에이전트가 사람과 함께 사용할 수 있는 실제 브라우저 환경입니다. 두 도구를 연결하면 ‘답을 주는 AI’를 넘어, 로그인된 웹 업무를 사람이 감독할 수 있는 방식으로 실행하는 AI 동료를 만들 수 있습니다.

이 글에서 확인한 핵심은 세 가지입니다.

  • Hermes는 ego-browser Skill을 통해 ego (lite)를 조작할 수 있다.
  • 하나의 TaskSpace를 유지하면 로그인 상태와 웹 작업 맥락을 이어갈 수 있다.
  • 자동화의 완성은 클릭이 아니라 실행 결과를 다시 읽고 확인하는 것이다.

Hermes 공식 프로젝트와 문서는 계속 변경될 수 있으므로 설치 명령과 지원 범위는 최신 공식 문서를 기준으로 확인하는 것이 좋습니다.

공식 출처

  1. ego (lite) — Hermes Agent 한국어 가이드
  2. ego (lite) 공식 사이트
  3. ego-lite 공식 GitHub 저장소
  4. Hermes Agent 브라우저 기능 문서
  5. Hermes Agent 공식 GitHub 저장소

 

댓글

이 블로그의 인기 게시물

GPT-6 Astra 공개 내용 쉽게 해설: AI가 “대답하는 도구”에서 “일을 수행하는 동료”로

※ 아래 내용은 OpenAI가 공개한 GPT-6 Astra 소개 페이지의 주장을 바탕으로 쉽게 풀어쓴 해설입니다. 벤치마크 수치는 제조사가 제시한 조건과 측정 방식에 따라 달라질 수 있습니다. 한 줄 요약 GPT-6 Astra는 단순히 글을 잘 쓰는 모델을 넘어, 웹 브라우저와 컴퓨터를 직접 사용하고 여러 단계의 업무를 끝까지 수행하는 것을 목표로 한 모델입니다. 1. GPT-6 Astra는 무엇이 달라졌나? OpenAI는 GPT-6 Astra를 새로운 세대의 지능 모델이라고 소개합니다. 핵심은 지식량만 늘리는 것이 아니라 컴퓨터 사용, 웹 탐색, 소프트웨어 개발, 과학 연구, 사이버보안, 전문 업무 를 실제 작업 흐름 속에서 수행하도록 설계했다는 점입니다. 기존 챗봇이 질문에 답하고 결과물을 만들어 주는 데 집중했다면, Astra는 사용자의 목표를 이해한 뒤 브라우저를 열고, 자료를 찾고, 문서를 작성하고, 결과를 점검하는 식의 다단계 업무 수행 을 강조합니다. 2. 가장 중요한 변화: AI가 컴퓨터를 사용한다 소개 페이지의 표현을 쉽게 바꾸면 다음과 같습니다. 온라인 자료를 찾아 요약하기 문서·스프레드시트·프레젠테이션 만들기 웹사이트를 만들고 실제 화면에서 품질 점검하기 과학 데이터를 분석하고 그래프 만들기 양식 입력, 예약 검색, 상품 비교 같은 반복 업무 수행하기 이 변화는 “AI에게 무엇을 물어볼까?”에서 “AI에게 어떤 업무를 맡길까?”로 사용 방식이 이동한다는 뜻입니다. 프롬프트 한 번의 답변보다 목표·권한·검토 지점·완료 조건 을 설계하는 일이 중요해집니다. 3. 업무 성능에 대한 OpenAI의 주장 영역 공개 페이지에 제시된 내용 실무적으로 읽는 법 컴퓨터 사용 화면을 이해하고 브라우저·업무 도구를 조작 사람이 하던 반복적인 클릭·입력 업무를 위임할 가능성 소프트웨어 개발 코드 작성뿐 아니라 테스트와 수정까지 수행 코딩 보조를 넘어 이슈 해결 사이클에 참여 전문 업무 문서·스프레드시트·발표자료를 템플릿에 맞춰 생성 회사 ...

초파리 뇌가 게임하고 로봇을 조종한다? 커넥톰 AI의 원리와 현실

CONNECTOME × AI 초파리 뇌가 게임하고 로봇을 조종한다? 커넥톰 AI가 실제로 하는 일과 하지 못하는 일을, Doom과 드론 사례로 구분해 봤습니다. 결론부터 말하면 완전히 거짓은 아닙니다. 다만 "살아 있는 뇌를 컴퓨터에 업로드했다"는 설명은 틀립니다. 139,255 2024년 공개된 성체 암컷 초파리 뇌의 뉴런 수 5,450만 같은 커넥톰에 기록된 화학 시냅스 수 1억 2,500만 2026년 수컷 중추신경계 지도에 포함된 시냅스 연결 먼저, 무엇이 공개된 것인가 2024년 FlyWire 연구진은 성체 암컷 초파리 한 마리의 뇌에서 139,255개 뉴런과 약 5,450만 개 화학 시냅스를 재구성했습니다. 세포 유형과 뇌 영역, 신경전달물질 예측도 함께 공개했습니다. [1] 2026년에는 수컷 초파리의 뇌와 복측신경삭까지 연결한 지도가 나왔습니다. 16만6천 개가 넘는 뉴런과 1억2,500만 개 시냅스 연결을 담아, 감각이 움직임으로 이어지는 경로까지 연구할 수 있게 됐습니다. [2] 연구진은 전자현미경 사진에서 AI로 뉴런 경계를 분리하고 3차원으로 이어 붙입니다. AI가 잘못 합치거나 끊은 부분은 사람이 검수합니다. 커넥톰은 도로 지도에 가깝습니다. 도로가 어디로 이어지는지는 보여주지만, 지금 차가 어디를 달리는지, 신호등이 어떻게 바뀌는지, 운전자가 어디로 가려는지까지 알려주지는 않습니다. 커넥톰은 죽은 조직에서 얻은 정적 구조입니다. 순간의 막전위와 발화 패턴, 정확한 시냅스 강도, 호르몬 상태, 배고픔 같은 내부 상태는 온전히 담겨 있지 않습니다. 정적인 배선도에 어떻게 행동을 넣나 1. 그래프로 바꾼다 뉴런을 노드, 시냅스를 방향이 있는 연결로 표현합니다. 시냅스 수와 신경전달물질 예측은 가중치와 흥분·억제 부호의 출발점이 됩니다. 2. 시간 규칙을 넣는다 각 뉴런에 입력이 쌓이고 임계값을 넘으면 발화하는 수학 모델을 붙입니다. 대표적인 방...

CLARITY 법안 표결 실패, 비트코인과 XRP는 왜 급락했나

긴급 시장 분석 CLARITY 법안 표결 실패, 비트코인과 XRP는 왜 급락했나 49 대 50으로 막힌 미국 암호화폐 시장구조 법안. 표결의 정확한 의미와 BTC·XRP 가격 충격, 앞으로 확인할 가격대를 함께 분석합니다. 작성 기준: 2026년 9월 16일 오전 7시 25분(KST) · 가격은 작성 시점 기준 상원 표결 찬성 49 · 반대 50 비트코인 24시간 -4.32% XRP 24시간 -11.36% 목차 무엇이 부결됐나 왜 60표를 얻지 못했나 비트코인·XRP 가격 반응 비트코인 기술적 구간 XRP 기술적 구간 향후 시나리오와 관찰 포인트 먼저 결론부터 미국 상원이 부결한 것은 CLARITY 법안의 최종 통과안이 아닙니다. 상원 본회의에서 법안을 다루기 위해 토론 종결 절차를 밟고 심의로 넘어갈 것인지를 묻는 클로처 표결 이었습니다. 필요한 60표를 얻지 못하면서 법안은 본격 토론 단계에 진입하지 못했습니다. 정확한 표현: “CLARITY 법안이 최종 폐기됐다”가 아니라 “법안을 본회의에서 다루기 위한 절차표결이 실패했다”가 맞습니다. 시장은 이 결과를 미국 암호화폐 규제 명확화의 지연으로 받아들였습니다. 비트코인은 약 4% 하락했지만 XRP는 11% 넘게 떨어졌습니다. 규제 기대에 민감한 알트코인이 정치적 불확실성에 더 크게 반응한 모습입니다. 1. 상원에서 실제로 무엇이 부결됐나 미국 상원 공식 기록에 따르면 2026년 9월 15일 오후 3시, H.R. 3633인 Digital Asset Market Clarity Act 에 대한 ‘motion to proceed’의 클로처 동의가 찬성 49표, 반대 50표 로 부결됐습니다. 클...

[알아두면 쓸모 있는 구글 문서 팁] 문서 공유시- 사용자 이름 대신에 익명의 동물이 표시 되는 이유와 동물 종류

구글 드라이브에는 다른 유사 서비스에서는 제공하지 않는 구글 만의 유니크한 기능들이 있다 구글 문서를  불특정 다수에게 전체 공개로 공유할 수 있습니다. 불특정인이 구글 문서에 접속한 경우 익명의 동물로 표시됩니다.  ' 웹에 공개' 또는 '링크가 있는 사용자' 공유 설정을 선택하면 인식할 수 없는 이름이나 익명의 동물이 표시될 수 있습니다. 파일에서 인식할 수 없는 이름을 볼 수 있는 몇 가지 이유는 다음과 같습니다. 메일링 리스트와 파일을 공유합니다. Google 계정이 없는 사용자와 파일을 공유하며, 그 사용자가 다른 사용자에게 공유 초대를 전달했습니다. 내 파일을 수정할 수 있는 누군가가 파일을 다른 사용자와 공유했습니다. 다른 사용자가 자신의 Google 계정 이름을 변경했습니다. 공유 설정 페이지에서 해당 사용자 이름 위로 마우스를 이동하여 이메일 주소를 확인하세요. 익명의 동물 다른 사용자에게 개별적으로 보기 또는 수정 권한을 부여하거나 메일링 리스트에 속해 있는 경우에만 사용자 이름이 표시됩니다. 파일 권한을 '링크가 있는 사용자'로 설정하면 파일을 보고 있는 사용자의 이름이 표시되지 않습니다. 대신 다른 사용자가 익명으로 라벨이 지정되어 표시되고 각 익명 사용자는 다양한 익명의 동물로 나열됩니다. 파일 권한을 '링크가 있는 사용자'로 설정했지만 특정 사용자와 파일을 공유하는 경우 파일을 공유한 사용자의 이름이 표시됩니다. 그 외 다른 사용자가 파일을 볼 때는 익명으로 나타납니다. 비공개 파일의 익명 동물 파일 권한을 '링크가 있는 사용자'로 설정한 다음 이를 '특정 사용자'로 변경하면 다음과 같은 경우 여러 익명의 동물이 표시될 수 있습니다. 누군가 파일을 여러 번 여는 경우에는 익명의 동물 목록에서 오래되고 연결이 끊긴 세션을 강제 종료하는 데 조금 시간이 걸릴 수 있습니다. 누군가 온...

Muse와 OpenClaw: 같은 에이전트인가, 새로운 개인비서인가

개인 AI 에이전트 비교 · 2026년 9월 25일 Muse와 OpenClaw: 같은 에이전트인가, 새로운 개인비서인가 Muse가 OpenClaw 코드를 그대로 실행하는 클론이라는 증거는 없습니다. 다만 에이전트의 기본 구조와 제품 철학은 크게 닮았고, Muse의 새로움은 개념보다 배포 방식·보안 모델·대중화에 있습니다. 에이전트 개념은 OpenClaw ≈ Muse입니다. 구현은 다릅니다. OpenClaw가 사용자가 직접 운영하는 개방형 하니스라면, Muse는 Meta가 호스팅하는 소비자용 서비스입니다. 1. 왜 ‘일반인용 OpenClaw’라는 말이 나왔나 Muse 출시 뒤 초기 사용자들은 두 제품의 내부 파일 체계를 비교했습니다. SOUL.md , IDENTITY.md , USER.md , MEMORY.md , AGENTS.md , TOOLS.md 같은 이름뿐 아니라, 에이전트의 성격과 행동 경계를 정하는 문장까지 비슷하다는 지적이 나왔습니다. The Verge도 두 제품이 핵심 파일 이름과 “Be genuinely helpful, not performatively helpful” 같은 문구를 공유한다고 보도했습니다. [2] 파일 규약 OpenClaw: 성격·사용자·기억·도구를 텍스트 파일로 관리합니다. Muse: 이름과 역할이 유사한 파일 체계가 관찰됐습니다. 제품 형태 공통점: 질문에 답하는 챗봇을 넘어 브라우저와 도구를 사용해 실제 일을 수행하는 개인 에이전트를 지향합니다. 논란의 핵심은 화면이 비슷하다는 정도가 아닙니다. 에이전트 하니스, 즉 모델이 기억·도구·규칙을 활용하도록 둘러싼 실행 구조와 성격 문서까지 닮았다는 점입니다. 2. Meta의 공식 설명 Meta Superintelligence Labs 제품 책임자 Nat Friedman은 Muse를 “처음부터 새로 만들었지만, 제품으로서는...