docs: 외부 리뷰어와의 방향 연구 라운드를 핸드오프에 기록 - #183
Merged
Merged
Conversation
스크러빙된 GLM 패킷 두 건으로 `wclass` 와 advisory 동반 도구의 다음 방향을 검토했다. 코드/설정 변경 없음, 벤더 라우트 미실행, 캠페인·사용량·자격증명 미접근. 공급자 출력은 신뢰하지 않는 입력으로 다루고 전부 소스와 대조했다. 검증을 통과한 것: 휠 소속 판단 규칙, 60/12 게이트는 재색인이 아니라 폐기해야 하는 이유, 항목 D 의 가장 강한 형태가 주입이 아니라 수확이라는 점, check_test_vacuity.py 가 추정량이 아니라 엔진이라는 구분, list-don't-judge 의 분할, 잎 단위 위로 집계할 때 가려지는 것. 기각한 것과 근거: - 항목 B 의 심볼 수가 한 릴리스 낡았다. 0.30.0 의 declares_stream_json_input 이 빠져 일곱이 아니라 여덟이며, 같은 파일을 import 하는 모듈이 넷 더 있어 ask 경로만 떼어내도 5,526 줄 파일은 휠에 남는다. - 관측 세 건짜리 표본에 증거 라벨이 붙었다. 항목 5 가 이미 p 추정에 턱없이 부족하다고 못 박은 수치다. - 제안된 결정 규칙이 z=1.96 을 쓴다. speculative_report.py:798-843 의 t 분위수 규칙을 적용하면 15/25 의 하한이 0.4074 에서 0.3983 으로 내려가 기각에서 미달로 분기가 바뀐다. - 파일럿 kill gate 가 4% 수율에 걸려 있다. 원 발견의 기저율은 14 과제 중 6 건 이라 한 자릿수 낮고, 재현과 열 배 약한 효과를 구분하지 못한다. 항목 A-D 는 여전히 미승인이며, 이 기록은 항목 D 를 승격시키지 않고 좁힌다. ./.weightclass/verify 는 1,599 테스트 35 skip 으로 통과했다. Co-Authored-By: Claude Opus 5 (1M context) <noreply@anthropic.com> Claude-Session: https://claude.ai/code/session_01P3dXGuZjrBWD669SgUuk65
This file contains hidden or bidirectional Unicode text that may be interpreted or compiled differently than what appears below. To review, open the file in an editor that reveals hidden Unicode characters.
Learn more about bidirectional Unicode characters
Sign up for free
to join this conversation on GitHub.
Already have an account?
Sign in to comment
Add this suggestion to a batch that can be applied as a single commit.This suggestion is invalid because no changes were made to the code.Suggestions cannot be applied while the pull request is closed.Suggestions cannot be applied while viewing a subset of changes.Only one suggestion per line can be applied in a batch.Add this suggestion to a batch that can be applied as a single commit.Applying suggestions on deleted lines is not supported.You must change the existing code in this line in order to create a valid suggestion.Outdated suggestions cannot be applied.This suggestion has been applied or marked resolved.Suggestions cannot be applied from pending reviews.Suggestions cannot be applied on multi-line comments.Suggestions cannot be applied while the pull request is queued to merge.Suggestion cannot be applied right now. Please check back later.
스크러빙된 GLM 패킷 두 건으로
wclass와 advisory 동반 도구의 다음 방향을 검토한결과를
HANDOFF.md에 기록한다. 문서 변경만 있고 패키지 동작은 그대로다.이번 라운드에서 코드, 설정, 벤더 라우트, 캠페인 기록, 사용량 기록, 자격증명 중
어느 것도 건드리지 않았다. 공급자 출력은 신뢰하지 않는 입력으로 다뤘고, 기록한
모든 주장을 소스와 대조했다.
패킷
둘 다 이미 공개된 파일만 담았고 스크러버가 보고한 마스킹은 각각 0 건이다.
AGENTS.md,README.md,docs/advisory-product-roadmap-v2.md+ 인라인 브리프f4b4be0e2468AGENTS.md,docs/speculative-cheap-route-design.md,tools/check_test_vacuity.py,docs/policy4-fresh-blind-evaluation.md,docs/phase4-go-no-go-template.md,docs/measuring-p-at-work.mdcbff0490e80f검증을 통과한 것
수 있고, 모든 주장이 휠 안의 코드로 강제되는가. advisory
AGENTS.md의ask정의를 프로젝트 전체 규칙으로 승격한 형태다.
쉬워지도록 바꾸는 것이고, Phase 2 에서 9/36 미달을 보고한 선택과 모순된다.
아티팩트 교란과 저자성 신호가 구조적으로 존재할 수 없다.
tools/check_test_vacuity.py는 추정량이 아니라 엔진. 항등 뮤테이션은판정이 컴포넌트에 의존하는지를 묻는 필요조건이고, 스위트가 모든 잎에서 항등
감사를 통과하면서도
p21부류를 전부 놓칠 수 있다.list-don't-judge는 이전이 아니라 분할. 기계적 결과는 속성 검사이므로 자동채점하고, materiality 만 사람이 판정한다.
클래스 단위는 스위트 취약성의 집중을 가린다.
기각한 것과 근거
declares_stream_json_input(
src/weightclass/advisory/advisory_quick.py:1069) 이 빠져 일곱이 아니라 여덟이다.같은 파일을 import 하는 모듈이 넷 더 있어(
managed_advisory.py13,advisory_consult.py8,wclass_advisory.py3,managed_cli.py1)ask경로만떼어내도 5,526 줄 파일은 휠에 남는다.
p추정에 턱없이 부족하다고 못 박은 수치다.
z = 1.96을 쓴다.speculative_report.py:798-843의 t분위수 규칙을 적용하면 15/25 의 하한이 0.4074 에서 0.3983 으로 내려가 기각에서
미달로 분기가 바뀐다. 프로젝트 규칙으로 0.40 을 넘으려면 16/25 가 필요하다.
으로 한 자릿수 높다. 재현과 열 배 약한 효과를 구분하지 못하며, 항목 C 가 캠페인
게이트에서 지적한 것과 같은 부류의 오류다.
범위
항목 A-D 는 여전히 미승인이다. 이 기록은 항목 D 를 승격시키지 않고 좁힌다.
Next Steps 항목 B 본문에는 심볼 수가 낡았음을 알리는 한 문장만 덧붙였고, 네 리뷰가
무엇을 권고했는지에 대한 기록 자체는 고치지 않았다.
검증
./.weightclass/verifyexit 0 — 1,599 테스트, 35 skip, 122.4 초git diff --check통과🤖 Generated with Claude Code
https://claude.ai/code/session_01P3dXGuZjrBWD669SgUuk65