Devin의 RSA-260 작업 보고, AI에게 맡기지 않은 일은 무엇이었을까요
Cognition의 새 구현 보고에서 사람의 우선순위 설정과 벤치마크 역할을 살펴봅니다. 인수분해 성과를 일반 서비스 암호 붕괴나 무인 개발로 확대하지 않습니다.
Cognition의 새 구현 보고에서 사람의 우선순위 설정과 벤치마크 역할을 살펴봅니다. 인수분해 성과를 일반 서비스 암호 붕괴나 무인 개발로 확대하지 않습니다.
Artificial Analysis의 새 평가 개편은 모델 점수와 실제 도구 선택이 다르다는 점을 드러냅니다. 부분 성공과 전체 완료를 나눠 문의 접수 앱으로 비교하는 기준을 제안합니다.
‘An Alien Mind’는 서비스 중단 공지가 아닙니다. 연구자의 안전 전망과 확정된 사실을 구분하고, AI 코딩에서 설명과 실제 검증을 나누는 기준을 살펴봅니다.
OpenAI의 9월 6일 내부 연구 보고서는 에이전트 사용 증가와 함께 측정의 한계도 공개합니다. 실행량 대신 실제 완료와 사람의 개입을 기록해야 하는 이유를 살펴봅니다.
Claude의 Lean 형식화 사례에서 새 수학적 발견과 기계 검증의 차이, 그리고 AI 결과를 믿게 만드는 결정론적 검사의 의미를 살펴봅니다.
공개 위키에 남은 에이전트 활동 조사에서 배우는 권한 강제, 외부 쓰기 차단, 이상 행동 관찰의 기준입니다.
최근 공개된 XYZZY 사례를 바탕으로, 멀티 에이전트 결과를 그대로 믿기보다 사람의 승인·근거 연결·변경 기록으로 검토 가능한 결정으로 만드는 방법을 살펴봅니다.
최근 공개된 에이전트 지식 관리 도구 사례를 계기로, 초보 바이브코더가 긴 지시문 대신 제품의 판단 기준을 남기는 법을 정리합니다.
NVIDIA의 AVO 발표를 바탕으로, 모델을 더 세게 고르는 것보다 장기 작업의 기억·검증·중단 기준을 설계해야 하는 이유를 정리합니다.
최근 HN에 공개된 실험적 편집기 Huzzah를 계기로, 바이브코딩에서 프롬프트를 소모품이 아니라 프로젝트의 의도로 남기는 방법을 정리합니다.
MathCode 사례를 통해 AI가 만든 답과 형식 검증된 증명을 구분하고, 고위험 기능을 다루는 바이브코더의 검토 습관을 정리합니다.
Anthropic의 다중 에이전트 연구가 보여 준 것은 ‘에이전트 수’가 아니라, 독립 과업·검토·최종 판정의 구조가 먼저라는 사실입니다.