Experiment record

人間が期待する技術記事レビューにAIを近づけるための4-Pass × 2-Cycleレビュー設計と初期検証

Human reviewで見つかったAIレビュー漏れを、Critical/Evidence、Lateral/Reframing、Logical/Reconstruction、Integrated Cold Readの4 Passと2 Cycleの明示手順へ変換したPARTIAL process Experiment。

概要

AIEL-2026-0011では、レビューの仕組みそのものをExperimentとして扱います。

出発点は実際の失敗でした。当時のAI publication reviewをPASSしたAIEL記事をHumanがcold readすると、materialな問題が残っていました。見逃されていたのは事実誤認だけではありません。読者に必要なcontextの不足、公開記事には不要なmanagement-orientedな記述、保持Evidenceより強いframing、そして報告された箇所だけでなく記事全体を再検討する必要性が含まれていました。

そこで、人間が暗黙に行っていたレビュー上の期待を、AIが実行できる形へ明示化しました。AIELではsemantic reviewを次の4 Passへ分離します。

  1. Critical / Evidence — Claim、Evidence強度、前提、因果表現、不確実性、見落としを疑う。
  2. Lateral / Reframing — 問いの立て方、記事の境界、継承した構成、そもそも公開すべきかを疑う。
  3. Logical / Reconstruction — Background、Question、Method、Evidence、Result、Conclusion、Reader Valueが一貫した鎖になるか確認する。
  4. Integrated Cold Read — drafting historyを使わず、完成したEN/JAとmachine-readable recordを初見読者として読む。

さらに、実質的な公開候補は同じ4 Passを2回通します。Cycle 1 — Reconstructionでartifactを整え、Cycle 2 — Verificationでは修正済みartifactを新しいreview objectとしてPass 1から見直します。material correctionが入ればclean sequenceは無効となり、Cycle 1 Pass 1からrestartします。

最初の保持された運用適用はAIEL-2026-0007でした。この2 Cycle reviewでは、以前のaccepted stateを通過して残っていたmaterial issueを2件検出しました。1件はCanonicalのINFERRED因果Claimより強く読める日本語タイトル、もう1件は中心概念ScriptLockの初出説明不足です。修正後はCycle 1 Pass 1からreviewをやり直し、4 Passを2 Cycle連続でclean完了しました。

これは有用な初期Evidenceですが、Human review reasoningを一般的に再現できたことの証明ではありません。今後の記事でHuman reopen、Cycle 2の追加finding、公開後変更必要性Gateの実績を蓄積するまで、本ExperimentはPARTIALとします。

実験の背景

Checklistで必須項目を確認したことと、人間の専門レビューのように記事を疑えたことは同じではありません。

実際のgapは、AI reviewを通過した記事がHuman cold readでreopenされたことで明確になりました。そこから、少なくとも複数の異なるreview taskが混在していたことが分かりました。ClaimがEvidenceに支えられているかを疑うこと、そもそもの問題設定や記事構造を疑うこと、論理の鎖が自立しているかを見ること、そして完成物を初見者として読むことです。

本Experimentでは、Critical Thinking、Lateral Thinking、Logical Thinkingの一般的・唯一の定義を主張しません。AIELでは、それぞれを運用上のreview roleとして使います。

4つ目にIntegrated Cold Readを置くのは、3つの局所reviewを通過しても、完成したreader-facing artifactとして分かりにくい可能性があるためです。

さらに公開済み記事では別の問題があります。十分に良い記事でも、見直せばより良い表現はほぼ必ず見つかります。小さな改善のたびに公開内容を変えると、reviewそのものが継続性を損ないます。そのためAIELでは、公開後は「改善できるか」だけでなく、本当に変更する必要があるかを別に判断するようにしました。

実験方法

本Experimentは物理計測ではなくprocess-designのExperimentです。Evidenceには、保持されたpublication-review history、formalized standard、実際のreview outcomeを使用しました。

まず、以前acceptedだった記事に対するHuman findingを、個別の文章修正だけではなく「旧AI reviewで働かなかった思考」のEvidenceとして扱いました。

次に、その思考をCritical/Evidence、Lateral/Reframing、Logical/Reconstruction、Integrated Cold Readの4 Passへ分離しました。Evidence-State review、Whole-article Reconstruction、Reader Context and Necessity、Reader Value、bilingual cold readなど既存のAIEL controlは廃止せず、どのPassで何を考えるかを明確にしました。

そのうえで、同一final artifact stateに対して4 Passを2 Cycle連続cleanで完了することを要求しました。material correctionがあった場合、修正前artifactに対するreview結果は修正後artifactの品質を証明しないため、Cycle 1 Pass 1へ戻ります。

次に、この方式をAIEL-2026-0007へ適用し、finding、修正、restart、clean completionをreview recordへ保持しました。

最後に、公開済み記事についてはPublished-Article Change Necessity Reviewを追加しました。findingをMUST_FIX、SHOULD_FIX、OPTIONAL_IMPROVEMENT、NO_CHANGEへ分類します。optional improvementは原則として公開変更しませんが、materialな事実・Evidence・因果・privacy等のdefectをstabilityの名目で残すことも認めません。

今後の評価では、根拠のない「何%正確になった」というscoreは使わず、Human material reopenの有無、Cycle 2で追加material findingが出たか、公開後findingが変更/非変更のどちらに帰結したか、というcase countを保持します。

実験ログ

Human reviewでprocess-level failureが露呈した

以前のAIEL-2026-0007 publication stateは当時のreviewをPASSしていましたが、その後のHuman cold readでreader contextとparagraph necessityに関するmaterial defectが見つかりました。対応は、その文章だけを直して終わるのではなく、「人間は記事レビュー時に何を疑っているのか」をreview process側の問題として扱う方向へ進みました。

4つのreview passを正式化した

reviewをCritical/Evidence、Lateral/Reframing、Logical/Reconstruction、Integrated Cold Readへ再構成しました。順序にも意味があります。まずEvidence境界を確定し、次にframe自体を疑い、その後で論理を再構築し、最後に完成物をcold readします。

完全なreviewを2周する方式へ変更した

Cycle 1はpublication candidateを再構築するためのreview、Cycle 2は完成済みcandidateを新しい対象として再検証するreviewとしました。material correctionが入った場合は局所的に続きを確認するのではなく、Cycle 1 Pass 1へ戻ります。

初期適用でさらに2件のmaterial issueを検出した

この2 Cycle方式をAIEL-2026-0007へ最初に適用すると、以前のaccepted state後にも残っていたmaterial publication issueが2件見つかりました。

1件はepistemicな問題でした。日本語タイトルの表現が、CanonicalではINFERRED / HIGHに留めている因果Claimより強く読める状態でした。

もう1件はcontextの問題です。記事の中心メカニズムであるScriptLockが、Apps Scriptの実行モデルを知らない読者にも理解できる形で初出説明されていませんでした。

これらを修正したため、最初のCycle 1は無効としました。Cycle 1 Pass 1からreviewを再開し、修正後final artifactはCycle 1とCycle 2をともにcleanで完了しました。

公開後のstabilityを別の判断対象にした

その後Human governanceから、「reviewで改善案が出ても、公開済み記事を必ず変えるべきではない」という別の課題が提示されました。そこでfindingの妥当性と変更必要性を分離しました。

公開後の目的はaccuracy + clarity + stabilityです。material defectは修正します。一方、現在の記事でも本来の意味が十分に正しく理解できる場合、微小なeditorial improvementだけを理由にpublic churnを起こさない運用としました。

結論

本Experimentでは、具体的なAI-review failureを、今後観測・改良できる明示的processへ変換しました。

保持された最初の運用事例では、4-Pass × 2-Cycle reviewにより、以前acceptedだったAIEL-2026-0007に残っていた2件のmaterial publication issueを検出しました。修正後はCycle 1 Pass 1からrestartし、同一final artifactに対して2 Cycleをclean完了しました。

したがって現時点では、「Evidence challenge、reframing、logical reconstruction、final cold readを分離し、修正後artifactでもう一度全体をreviewすることは、旧AIEL review processを超えるreview valueを持ち得る」という限定的な結論を支持できます。

一方で、Humanの技術記事レビューを一般的に再現できる、review qualityが何%向上した、2 Cycleで十分であるとは結論できません。同じAI systemがprocess設計と適用の両方に関与しており、独立第三者検証でもありません。

そのため本ExperimentはPARTIALです。今後の新規・実質改稿記事で、HumanがAI PASSをmaterialにreopenする頻度、Cycle 2がCycle 1を超えてmaterial findingを追加する頻度、公開後のChange Necessity Gateが不要な変更を抑えつつ必要修正を保持できるかを継続評価します。

証拠区分のまとめ

このExperimentで得られた情報のEvidence Stateは次のとおりです。

各Evidence Stateの意味はEvidence State(証拠状態)を参照してください。

記録内容Evidence State根拠
以前acceptedだった公開記事に対し、Human reviewが事実確認以外のmaterial concernを露呈したOBSERVED保持publication-review history
4 Pass、2 Cycle、material correction時restart、公開後Change Necessity判定がAIEL processとしてformalizeされたVERIFIED保持Publishing Standard
最初の2 Cycle適用で、以前acceptedだったAIEL-2026-0007に残るmaterial issueを2件検出したVERIFIED保持AIEL-2026-0007 review record
structured processは旧processを超えるreview valueを持ち得るINFERRED現在1件の初期運用事例に限定
反復運用でHuman reopenと不要なpublic churnが減るHYPOTHESISprospective evaluation未完了

未解決事項

現在のEvidenceでは、次の3点はまだ分かりません。

これらは、finding 0件のケースも含めて今後のcaseを保持して評価します。主観的な「何割できた」というscoreをEvidenceなしに付与しません。

運用上の示唆

AI-assisted technical publishingでは、review qualityを長いchecklistだけで表現しない方が安全です。異なるcognitive taskを分離し、順序を持たせ、さらに修正済みfinal artifactに対してもう一度全体reviewを実行することで、「修正前の文章を確認した」というEvidenceと「現在公開する文章を確認した」というEvidenceを分けられます。

公開済みKnowledgeでは、validなfindingとpublic changeの必要性も別の判断です。これにより、reviewが95点のartifactを100点へ近づけ続けるoptimization loopになり、十分に正しい公開内容を頻繁に書き換えることを避けられます。

このprocessは完成品として固定しません。今後の運用で反復するblind spot、過剰なreview cost、Change Necessity Gateの失敗が見つかった場合は、silent updateではなく関連follow-up Experimentとして検証します。

機械可読な実験記録

このExperimentの機械可読な正本記録をJSONとして公開しています。

AIEL-2026-0011 experiment.json

関連実験

AIEL-2026-0007は、review failureの保持履歴と2 Cycle方式の最初の運用適用事例を提供しました。0007のcollector側欠測・ScriptLock配置に関する科学的結果自体は、本review-process Experimentとは別です。