AI2026-06-28측정이 거절한 두 기능: 검색 엔진을 평가 하네스로 키운 기록검색 엔진을 좋게 만든 자랑이 아닙니다. 모든 개선을 평가 하네스로 재면서, 그 하네스가 그럴듯해 보이던 기능 두 개를 음성으로 걸러낸 기록입니다.
AI2026-06-22로봇이 걷는다는 말은 아직 부족합니다피지컬 AI에서 데모는 출발점일 뿐입니다. 로봇이 걷는지보다 어떤 조건에서 실패하고, 그 실패를 어떻게 재현하는지가 더 중요합니다.
AI2026-06-21하네스가 있으면 결과가 달라진다: 같은 모델을 다른 시스템으로 돌릴 때하네스는 모델을 더 똑똑하게 만드는 장식이 아닙니다. 같은 모델이 같은 일을 해도 결과가 달라지게 만드는 외부 구조입니다.
AI2026-06-18Claude Code는 빈손으로 시작하지 않습니다: 세션 앞의 7겹 컨텍스트Claude Code 세션은 프롬프트 한 줄에서 시작되는 것처럼 보이지만 실제로는 메모리, 설정, 규칙, 훅, 도구 상태가 겹쳐진 뒤 시작됩니다.
AI2026-06-18Claude Design 업데이트로 바뀐 디자인 워크플로우claude.ai/design에 Codebase context 기능이 생겼습니다. GitHub 레포를 연결하면 Claude Design이 프로젝트 디자인 시스템을 읽어 화면을 만들어줍니다. 직접 써보고 바뀐 점을 정리했습니다.
AI2026-06-18G1이 스쿼트하기까지: 122번의 실패가 바꾼 기준G1 휴머노이드가 조금 앉는 장면까지 가는 데 오래 걸린 이유를 적었습니다. 실패는 모델이 못한다는 증거가 아니라, 무엇을 검증해야 하는지 바꾸는 장치였습니다.
AI2026-06-15로봇 정책 세 개를 브라우저에 올리며 배운 것Go1, G1, Spot 보행 정책을 브라우저에서 직접 돌렸습니다. 어려웠던 일은 모델을 학습시키는 것보다 학습 환경과 웹 런타임이 보는 숫자를 똑같이 만드는 일이었습니다.
AI2026-06-14전문도메인 AI는 RAG가 아니라 판정 시스템입니다문서를 검색해 답변에 붙이는 것만으로 세무·회계·법률 AI가 되지는 않습니다. 전문도메인 AI의 신뢰는 검색층보다 바깥에 있는 벤치마크, 결정적 근거, 제한된 판정 구조, 반대편 검증에서 나옵니다.
AI2026-06-14멀티에이전트의 본업은 교차검증입니다AI 에이전트를 여러 개 붙인다고 신뢰가 자동으로 올라가지는 않습니다. 자동 협업은 종종 평균과 노이즈를 만들고, 진짜 가치는 출처가 분리된 교차검증에서 나옵니다.
AI2026-06-14하드웨어 없이 로봇을 걷게 하는 법로봇을 살 수 없어 시뮬레이터로 방향을 틀었습니다. 직접 강화학습으로 빚은 보행 정책이 지금 브라우저 안에서 휴머노이드를 걷게 합니다. 가장 어려웠던 건 모델이 아니라, 학습 환경과 브라우저의 숫자를 한 치도 다르지 않게 맞추는 일이었습니다.
AI2026-06-13AI는 자기 글자 수도 못 셉니다, 자기검증을 외부검증으로 바꿔야 하는 이유LLM에게 방금 쓴 글이 몇 자냐고 물으면 거의 늘 부풀려 답합니다. 자기평가는 믿을 수 없고, 외부 도구로 재서 루프를 도는 구조만이 답입니다.
AI2026-06-12하네스 엔지니어링: AI 모델을 부품으로 다루는 법더 똑똑한 모델을 기다리기 전에, 모델을 감싸는 바깥 구조부터 봐야 합니다. 하네스의 신뢰도가 모델 출력 신뢰도의 상한선입니다.
AI2026-06-11논문은 안다고 착각하게 만듭니다: VLA를 직접 돌려 검증한 기록VLA 논문 다섯 편을 읽고 안다고 생각했습니다. 두 모델을 내 GPU에 직접 올려 500번씩 돌리니 책에 없던 벽과, 제가 잘못 적은 숫자가 함께 드러났습니다.
AI2026-06-105천만 줄을 하루에: 클로드 페이블 5가 바꾸는 작업 단위앤트로픽이 6월 9일 클로드 페이블 5를 공개했습니다. 컨텍스트 100만 토큰, 긴 작업을 한 흐름으로 끌고 가는 모델입니다. 코드에 붙이려는 빌더 관점에서 작업 단위 변화, 새로 다뤄야 할 refusal 분기, 비용까지 골라 정리했습니다.
AI2026-06-09'간다'가 '갔다'로 바뀐다: ChatGPT 메모리 DreamingChatGPT가 기억하는 방식을 바꿨습니다. 시간이 지나면 옛 기억을 스스로 고쳐 쓰고, 이번엔 무료 사용자에게도 풀렸습니다. 편해진 만큼 짚어 둘 점도 함께 정리했습니다.
AI2026-06-09에이전트를 조직도에 넣다: Endava가 보여준 AX의 다음 단계Endava는 Codex와 ChatGPT Enterprise로 요구사항 분석을 몇 주에서 몇 시간으로 줄였습니다. 코딩만이 아니라 법무·기획·영업까지 에이전트가 들어왔습니다. AI를 도구가 아니라 조직 구조로 본 사례입니다.
AI2026-06-09말로 영상을 고친다: Gemini Omni, 크리에이터가 챙길 것구글이 Gemini Omni를 공개했습니다. 사진·소리·영상을 넣으면 영상이 나오고, 한 번 만든 영상을 말로 다시 고칩니다. 유튜브 쇼츠에선 무료로요. 한국 크리에이터·마케터가 챙길 것만 골랐습니다.
AI2026-06-09검색이 24시간 일을 시작했다: 5월 구글 AI에서 챙길 4가지2026년 5월 구글 AI 발표를 한 단어로 묶으면 에이전트입니다. 검색이 백그라운드에서 일하고, Gemini가 여러 앱을 가로질러 작업을 끝냅니다. 한국 실무자가 당장 챙길 네 가지를 골랐습니다.
AI2026-06-09수백 개 서브에이전트를 한 세션에: Opus 4.8이 실제로 바꾸는 것Claude Opus 4.8이 같은 가격에 나왔습니다. 한 세션에서 수백 개 서브에이전트를 돌리고, 자기 코드의 결함을 4배 덜 흘려보냅니다. 한국에서 Claude를 쓰는 입장에서 챙길 것만 골랐습니다.
AI2026-06-091년 걸릴 일을 2주에: Codex가 지우는 작은 팀의 한계Wasmer가 Codex와 GPT-5.5로 Docker 없는 엣지 Node.js 런타임을 만들었습니다. 1년 걸릴 일을 2주에. AI 코딩이 바꾼 건 속도가 아니라 작은 팀이 할 수 있는 일의 경계입니다.