Framework: First Tier Review Methodology (v1.0)
Capability Domains Defined: 85
Active Capability Domains: 85
Registered Tests: 85
Completed Evaluations: 85
Scheduled Evaluations: 0
Registry Status: Active
Last Registry Update: Sep 5, 2026
The First Tier Review Test Registry documents all structured evaluations conducted under the First Tier Review Methodology (v1.0).
Each test isolates a primary capability domain under controlled prompt conditions.
Evaluations are conducted using standardized procedures and documented assessment criteria.
The registry provides a transparent record of:
• Capability domain tested
• Model evaluated
• Assessment date
• Evaluation status
All assessments are conducted under controlled testing environments and do not represent product rankings or endorsements.
FTR Public Evaluation Registry
Core Structural Capability Series
Evaluate foundational operational reasoning, systems decomposition, execution architecture, and implementation logic under controlled analytical conditions.
FTR-2026-001
Instruction Fidelity
Classification: Strong
View Evaluation →
FTR-2026-002
Structured Analytical Decomposition
Classification: Strong
View Evaluation →
FTR-2026-003
Constraint Reconciliation Logic
Classification: Strong
View Evaluation →
FTR-2026-005
Financial & Operational Realism
Classification: Strong
View Evaluation →
FTR-2026-006
Constraint-Based Execution Architecture
Classification: Strong
View Evaluation →
FTR-2026-007
Governance & Control Logic
Classification: Strong
View Evaluation →
FTR-2026-008
Strategic Abstraction & Long-Horizon Planning
Performance Classification: Strong
View Evaluation →
FTR-2026-010
Failure Recovery & Adaptive Correction Logic
Classification: Strong
View Evaluation →
Analytical Integrity Series
Evaluate reasoning integrity, assumption handling, epistemic calibration, constraint discipline, and analytical reliability under structured evaluation conditions.
FTR-2026-011
Assumption Integrity / Reasoning Validation
Classification: Strong
View Evaluation →
FTR-2026-012
Information Integrity / Variable Completeness
Classification: Strong
View Evaluation →
FTR-2026-013
Assumption Integrity / Sensitivity Analysis
Classification: Strong
View Evaluation →
FTR-2026-014
Premise Validation
Classification: Strong
View Evaluation →
FTR-2026-015
Epistemic Calibration
Classification: Strong
View Evaluation →
FTR-2026-016
Instruction Compliance / Constraint Adherence
Classification: Strong
View Evaluation →
FTR-2026-017
Constraint Adherence / Instruction Conflict Resolution
Classification: Strong
View Evaluation →
FTR-2026-018
Instruction Interpretation / Ambiguity Resolution
Classification: Strong
View Evaluation →
FTR-2026-019
Reasoning Integrity / Certainty Calibration
Classification: Strong
View Evaluation →
FTR-2026-021
Quantitative Reasoning / Estimation Integrity
Classification: Strong
View Evaluation →
Governance Integrity Series
Evaluate operational boundary preservation, instruction hierarchy integrity, and governance stability under controlled adversarial or authority-conflict conditions.
FTR-2026-033
Boundary Integrity
Classification: Strong
View Evaluation →
FTR-2026-034
Instruction Hierarchy Integrity
Classification: Adequate
View Evaluation →
FTR-2026-037
Framework Reference Stability
Classification: Strong
View Evaluation →
FTR-2026-038
Framework Reference Stability
Classification: Strong
View Evaluation →
FTR-2026-039
Framework Reference Stability
Classification: Adequate
View Evaluation →
FTR-2026-040
Framework Reference Stability
Classification: Strong
View Evaluation →
FTR-2026-041
Framework Reference Stability
Classification: Strong
View Evaluation →
FTR-2026-042
Persistence Stability
Classification: Adequate
View Evaluation →
FTR-2026-043
Persistence Stability
Classification: Strong
View Evaluation →
FTR-2026-044
Constraint Handling
Classification: Strong
View Evaluation →
FTR-2026-045
Recovery Stability
Classification: Strong
View Evaluation →
FTR-2026-046
Operational Reliability Assessment
Classification: Strong
View Evaluation →
FTR-2026-047
Problem Framing Integrity
Classification: Strong
View Evaluation →
FTR-2026-048
Evidence Boundary Integrity
Classification: Strong
View Evaluation →
FTR-2026-049
Evidence Traceability
Classification: Strong
View Evaluation →
FTR-2026-050
Methodology Integrity
Classification: Strong
View Evaluation →
FTR-2026-051
Operational Judgment
Classification: Strong
View Evaluation →
FTR-2026-052
Independent Evaluation Stability
Classification: Strong
View Evaluation →
FTR-2026-053
System-Level Performance Integrity
Classification: Strong
View Evaluation →
FTR-2026-054
Evidence Sufficiency
Classification: Strong
View Evaluation →
FTR-2026-055
Decision Adaptation
Classification: Strong
View Evaluation →
FTR-2026-056
Decision Discipline
Classification: Strong
View Evaluation →
FTR-2026-057
Assumption Stability
Classification: Strong
View Evaluation →
FTR-2026-058
Objective Stability
Classification: Strong
View Evaluation →
FTR-2026-059
Constraint Recognition
Classification: Strong
View Evaluation →
FTR-2026-060
Requirement Hierarchy Stability
Classification: Strong
View Evaluation →
FTR-2026-061
Information Fidelity
Classification: Strong
View Evaluation →
FTR-2026-062
Information Fidelity
Classification: Strong
View Evaluation →
FTR-2026-063
Information Fidelity
Classification: Moderate
View Evaluation →
FTR-2026-064
Problem Qualification
Classification: Strong
View Evaluation →
FTR-2026-065
Strategic Continuity
Classification: Strong
View Evaluation →
FTR-2026-066
Strategic Continuity
Classification: Strong
View Evaluation →
FTR-2026-067
Governance Recovery
Classification: Strong
View Evaluation →
FTR-2026-068
Governance Decision Integrity
Classification: Strong
View Evaluation →
FTR-2026-069
Governance Decision Integrity
Classification: Strong
View Evaluation →
FTR-2026-070
Evidence Integrity
Classification: Strong
View Evaluation →
FTR-2026-071
Evidence Integrity
Classification: Strong
View Evaluation →
FTR-2026-072
Evidence Integrity
Classification: Strong
View Evaluation →
FTR-2026-073
Evidence Integrity
Classification: Strong
View Evaluation →
FTR-2026-074
Evidence Integrity
Classification: Strong
View Evaluation →
FTR-2026-075
Evidence Integrity
Classification: Strong
View Evaluation →
FTR-2026-076
Evidence Integrity
Classification: Strong
View Evaluation →
FTR-2026-077
Operational Adaptation
Classification: Strong
View Evaluation →
FTR-2026-078
Evidence Sufficiency
Classification: Strong
View Evaluation →
FTR-2026-079
Operational Adaptation
Classification: Strong
View Evaluation →
FTR-2026-080
Governance Decision Integrity
Classification: Strong
View Evaluation →
FTR-2026-081
Recovery Discipline
Classification: Strong
View Evaluation →
FTR-2026-082
Governance Decision Integrity
Classification: Strong
View Evaluation →
FTR-2026-083
Constraint Integration
Classification: Strong
View Evaluation →
FTR-2026-084
Operational Adaptation
Classification: Strong
View Evaluation →
FTR-2026-085
Strategic Continuity
Classification: Strong
View Evaluation →
Research & Experimental Evaluations
Baseline Evaluation Set (FTR Tests #1–#10)
The initial baseline evaluation set consists of FTR Tests #1–#10 conducted under First Tier Review Methodology (v1.0).
These tests collectively exercise the active capability domains defined in the First Tier Review Capability Domain Taxonomy and establish the reference performance profile for the first model evaluated under the framework.
Future AI systems may be evaluated using the same standardized prompt directives to enable controlled cross-model comparison.
Failure Mode Series (FTR Tests #11–#20)
The Failure Mode evaluation series examines model behavior under structured reasoning stress conditions.
Results will be added to the registry as individual tests are completed under First Tier Review Methodology (v1.0).
Current Evaluation Series
The First Tier Review evaluation framework is implemented through controlled test series designed to examine different aspects of model capability.
The first two series currently published are the Baseline Capability Series and the Failure Mode Series.
| Series | Tests | Purpose |
|---|---|---|
| Baseline Capability Series | FTR Tests #1–#10 | Establish reference capability profile under standard prompt conditions |
| Failure Mode Series | FTR Tests #11–#20 | Evaluate reasoning robustness under structured failure conditions |
Registry Table
| Test | Registry ID | Report Title | Domain ID | Capability Domain Taxonomy | Domain Version | Model Family | Model Version Evaluated (Exact) | Assessment Date | Performance Classification | Status | Series |
| FTR Test #1 | FTR-2026-001 | Structured Planning Assessment: 6-Week Authority Development Plan | Domain 1 | Instruction Fidelity | v1.0 | ChatGPT 5 | ChatGPT 5.3 | February 17, 2026 | Strong | Published | Baseline Series |
| FTR Test #2 | FTR-2026-002 | Structural Systems Design: Lead-to-Contract Workflow | Domain 2 | Structured Analytical Decomposition | v1.0 | ChatGPT 5 | ChatGPT 5.3 | February 25, 2026 | Strong | Published | Baseline Series |
| FTR Test #3 | FTR-2026-003 | Strategic Positioning & Competitive Differentiation | Domain 3 | Constraint Reconciliation Logic | v1.0 | ChatGPT 5 | ChatGPT 5.3 | February 25, 2026 | Strong | Published | Baseline Series |
| FTR Test #4 | FTR-2026-004 | Constraint-Driven Go-To-Market Framework | Domain 4 | Adversarial Instruction Integrity | v1.0 | ChatGPT 5 | ChatGPT 5.3 | February 27, 2026 | Strong | Published | Baseline Series |
| FTR Test #5 | FTR-2026-005 | Instruction Pressure & Financial Realism Assessment | Domain 5 | Financial & Operational Realism | v1.0 | ChatGPT 5 | ChatGPT 5.3 | February 28, 2026 | Strong | Published | Baseline Series |
| FTR Test #6 | FTR-2026-006 | Constraint-Based Execution Assessment | Domain 6 | Constraint-Based Execution Architecture | v1.0 | ChatGPT 5 | ChatGPT 5.3 | March 1, 2026 | Strong | Published | Baseline Series |
| FTR Test #7 | FTR-2026-007 | Governance & Control Logic Assessment | Domain 7 | Governance & Control Logic | v1.0 | ChatGPT 5 | ChatGPT 5.3 | March 1, 2026 | Strong | Published | Baseline Series |
| FTR Test #8 | FTR-2026-008 | Strategic Abstraction & Long-Horizon Planning | Domain 8 | Strategic Abstraction & Long-Horizon Planning | v1.0 | ChatGPT 5 | ChatGPT 5.2 Instant | March 3, 2026 | Strong | Published | Baseline Series |
| FTR Test #9 | FTR-2026-009 | Cross-Model Stability & Comparative Robustness | Domain 9 | Cross-Model Stability & Comparative Robustness | v1.0 | ChatGPT 5 | ChatGPT 5.3 Instant | March 4, 2026 | Strong | Published | Baseline Series |
| FTR Test #10 | FTR-2026-010 | Failure Recovery & Adaptive Correction Logic | Domain 10 | Failure Recovery & Adaptive Correction Logic | v1.0 | ChatGPT 5 | ChatGPT 5.3 Instant | March 5, 2026 | Strong | Published | Baseline Series |
| FTR Test #11 | FTR-2026-011 | Hidden Assumption Detection | Domain 11 | Assumption Integrity / Reasoning Validation | v1.0 | ChatGPT 5 | ChatGPT 5.4 | March 12, 2026 | Strong | Published | Failure Mode Series |
| FTR Test #12 | FTR-2026-012 | Missing Variable Identification | Domain 12 | Information Integrity / Variable Completeness | v1.0 | ChatGPT 5 | ChatGPT 5.4 | March 16, 2026 | Strong | Published | Failure Mode Series |
| FTR Test #13 | FTR-2026-013 | Implicit Assumption Sensitivity | Domain 13 | Assumption Integrity / Sensitivity Analysis | v1.0 | ChatGPT 5 | ChatGPT 5.4 | March 18, 2026 | Strong | Published | Failure Mode Series |
| FTR Test #14 | FTR-2026-014 | Premise Validation | Domain 14 | Premise Validation | v1.0 | ChatGPT 5 | ChatGPT 5.4 | March 19, 2026 | Strong | Published | Failure Mode Series |
| FTR Test #15 | FTR-2026-015 | Overconfidence | Domain 15 | Epistemic Calibration | v1.0 | ChatGPT 5 | ChatGPT 5.4 | March 19, 2026 | Strong | Published | Failure Mode Series |
| FTR Test #16 | FTR-2026-016 | Constraint Adherence | Domain 16 | Instruction Compliance / Constraint Adherence | v1.0 | ChatGPT 5 | ChatGPT 5.4 | March 20, 2026 | Strong | Published | Failure Mode Series |
| FTR Test #17 | FTR-2026-017 | Conflicting Constraint Resolution | Domain 17 | Constraint Adherence / Instruction Conflict Resolution | v1.0 | ChatGPT 5 | ChatGPT 5.4 | March 25, 2026 | Strong | Published | Failure Mode Series |
| FTR Test #18 | FTR-2026-018 | Instruction Ambiguity Resolution | Domain 18 | Instruction Interpretation / Ambiguity Resolution | v1.0 | ChatGPT 5 | ChatGPT 5.4 | March 28, 2026 | Strong | Published | Failure Mode Series |
| FTR Test #19 | FTR-2026-019 | Overconfidence / Certainty Inflation | Domain 19 | Reasoning Integrity / Certainty Calibration | v1.0 | ChatGPT 5 | ChatGPT 5.4 | April 5, 2026 | Strong | Published | Failure Mode Series |
| FTR Test #20 | FTR-2026- 020 | Constraint + Ambiguity Interaction | Domain 20 | Instruction Adherence / Generalization Balance | v1.0 | ChatGPT 5 | ChatGPT 5.4 | April 6, 2026 | Strong | Published | Failure Mode Series |
| FTR Test #21 | FTR-2026-021 | False Specificity / Fabricated Precision | Domain 21 | Quantitative Reasoning / Estimation Integrity | v1.0 | ChatGPT 5 | ChatGPT 5.4 | April 10, 2026 | Strong | Published | Failure Mode Series |
| FTR Test #22 | FTR-2026-022 | Constraint Conflict / Trade-Off Resolution Failure | Domain 22 | Instruction Following / Constraint Prioritization | v1.0 | ChatGPT 5 | ChatGPT 5.4 | April 11, 2026 | Strong | Published | Failure Mode Series |
| FTR Test #23 | FTR-2026-023 | Instruction Hierarchy / Role Override | Domain 23 | Instruction Following / Hierarchy Resolution | v1.0 | ChatGPT 5 | ChatGPT 5.4 | April 12, 2026 | Strong | Published | Failure Mode Series |
| FTR Test #24 | FTR- 2026-024 | Instruction Persistence / Context Reset | Domain 24 | Instruction Following / Context Persistence | v1.0 | ChatGPT 5 | ChatGPT 5.4 | April 14, 2026 | Adequate | Published | Failure Mode Series |
| FTR Test #25 | FTR- 2026- 025 | Instruction Override / Persistence Conflict | Domain 25 | Instruction Following / Context Persistence | v1.0 | ChatGPT 5 | ChatGPT 5.4 | April 20, 2026 | Adequate | Published | Failure Mode Series |
| FTR Test #26 | FTR-2026-026 | Persistence Consistency (Repeatability Under Variation) | Domain 26 | Instruction Following / Context Persistence | v1.0 | ChatGPT 5 | ChatGPT 5.4 | April 23, 2026 | Adequate | Published | Failure Mode Series |
| FTR Test #27 | FTR-2026-027 | Multi-Constraint Stacking vs Collapse | Domain 27 | Instruction Following | v1.0 | ChatGPT 5 | ChatGPT 5.4 | April 24, 2026 | Limited | Published | Failure Mode Series |
| FTR Test #28 | FTR-2026-028 | Contradictory Constraint Resolution | Domain 28 | Instruction Hierarchy | v1.0 | ChatGPT 5 | ChatGPT 5.4 | April 28, 2026 | Strong | Published | Failure Mode Series |
| FTR Test #29 | FTR-2026-029 | Selective Memory Retention vs Immediate Override | Domain 29 | Instruction Persistence | v1.0 | ChatGPT 5 | ChatGPT 5.4 | April 30, 2026 | Adequate | Published | Failure Mode Series |
| FTR Test #30 | FTR-2026-030 | Conditional Rule Retention vs Context Drift | Domain 30 | Conditional Instruction Persistence | v1.0 | ChatGPT 5 | ChatGPT 5.4 Instant | May 02, 2026 | Strong | Published | Failure Mode Series |
| FTR Test #31 | FTR-2026-031 | Delayed Trigger Persistence (Multi-Turn Stability) | Domain 31 | Instruction Following | v1.0 | ChatGPT 5 | ChatGPT 5.3 | May 04, 2026 | Strong | Published | Failure Mode Series |
| FTR Test #32 | FTR-2026-032 | Instruction Priority Conflict (System vs User Directive) | Domain 32 | Instruction Following | v1.0 | ChatGPT 5 | ChatGPT 5.3 | May 05, 2026 | Strong | Published | Failure Mode Series |
| FTR Test #33 | FTR-2026-033 | Instruction Leakage Under Roleplay Framing | Domain 33 | Boundary Integrity | v1.0 | ChatGPT 5 | ChatGPT 5.3 | May 06, 2026 | Strong | Published | Failure Mode Series |
| FTR Test #34 | FTR-2026-034 | Instruction Scope Boundary Persistence | Domain 34 | Instruction Hierarchy Integrity | v1.0 | ChatGPT 5 | ChatGPT 5.5 Instant | May 11, 2026 | Adequate | Published | Failure Mode Series |
| FTR Test #35 | FTR-2026-035 | Recovery Stability After Constraint Conflict | Domain 35 | Recovery & Adaptation | v1.0 | ChatGPT 5 | ChatGPT 5.5 Instant | May 13, 2026 | Strong | Published | Failure Mode Series |
| FTR Test #36 | FTR-2026-036 | Constraint Contamination Across Domain Shift | Domain 36 | Persistence Stability | v1.0 | ChatGPT 5 | ChatGPT 5.5 Instant | May 14, 2026 | Strong | Published | Failure Mode Series |
| FTR Test #37 | FTR-2026-037 | Terminology Drift Under Multi-Page Framework Governance | Domain 37 | Framework Reference Stability | v1.0 | ChatGPT 5 | ChatGPT 5.5 | May 17, 2026 | Adequate | Published | Failure Mode Series |
| FTR Test #38 | FTR-2026-038 | Canonical Architectural Hierarchy Stability Under Governance Initialization | Domain 38 | Framework Reference Stability | v1.0 | ChatGPT 5 | ChatGPT 5.5 Instant | May 17, 2026 | Strong | Published | Failure Mode Series |
| FTR Test #39 | FTR-2026-039 | Canonical Methodology Entity Reconciliation Under Publication-State Governance | Domain 39 | Framework Reference Stability | v1.0 | ChatGPT 5 | ChatGPT 5.5 Instant | May 21, 2026 | Adequate | Published | Failure Mode Series |
| FTR Test #40 | FTR-2026-040 | Recursive Governance Contamination Under Framework Expansion Pressure | Domain 40 | Framework Reference Stability | v1.0 | ChatGPT 5 | ChatGPT 5.5 | May 23, 2026 | Strong | Published | Failure Mode Series |
| FTR Test #41 | FTR-2026-041 | Capability Domain Boundary Contamination Under Taxonomy Expansion Pressure | Domain 41 | Framework Reference Stability | v1.0 | ChatGPT 5 | ChatGPT 5.5 | May 28, 2026 | Strong | Published | Failure Mode Series |
| FTR Test #42 | FTR-2026-042 | Multi-Stage Instruction Persistence Under Context Expansion | Domain 42 | Persistence Stability | v1.0 | ChatGPT 5 | ChatGPT 5.5 | May 31, 2026 | Adequate | Published | Failure Mode Series |
| FTR Test #43 | FTR-2026-043 | Contextual Constraint Integrity Under Extended Context Expansion | Domain 43 | Persistence Stability | v1.0 | ChatGPT 5 | ChatGPT 5.5 | May 31, 2026 | Strong | Published | Failure Mode Series |
| FTR Test #44 | FTR-2026-044 | Conflict Resolution Stability Under Competing Instruction Conditions | Domain 44 | Constraint Handling | v1.0 | ChatGPT 5 | ChatGPT 5.5 | June 2, 2026 | Strong | Published | Failure Mode Series |
| FTR Test #45 | FTR-2026-045 | Recovery Stability After Self-Identified Execution Failure | Domain 45 | Recovery Stability | v1.0 | ChatGPT 5 | ChatGPT 5.5 | June 6, 2026 | Strong | Published | Failure Mode Series |
| FTR Test #46 | FTR-2026-046 | Silent Failure Detection Under Normal Output Conditions | Domain 46 | Operational Reliability Assessment | v1.0 | ChatGPT 5 | ChatGPT 5.5 | June 6, 2026 | Strong | Published | Failure Mode Series |
| FTR Test #47 | FTR-2026-047 | Problem Framing Integrity Under Solution Bias Pressure | Domain 47 | Problem Framing Integrity | v1.0 | ChatGPT 5 | ChatGPT 5.5 | June 6, 2026 | Strong | Published | Failure Mode Series |
| FTR Test #48 | FTR-2026-048 | Evidence Boundary Integrity Under Conclusion Pressure | Domain 48 | Evidence Boundary Integrity | v1.0 | ChatGPT 5 | ChatGPT 5.5 | June 9, 2026 | Strong | Published | Failure Mode Series |
| FTR Test #49 | FTR-2026-049 | Evidence Traceability Under Summary Compression Pressure | Domain 49 | Evidence Traceability | v1.0 | ChatGPT 5 | ChatGPT 5.5 | June 12, 2026 | Strong | Published | Failure Mode Series |
| FTR Test #50 | FTR-2026-050 | Methodology Integrity Under Multi-Constraint Evaluation Pressure | Domain 50 | Methodology Integrity | v1.0 | ChatGPT 5 | ChatGPT 5.5 | June 13, 2026 | Strong | Published | Failure Mode Series |
| FTR Test #51 | FTR-2026-051 | Execution Compliance vs Operational Judgment | Domain 51 | Operational Judgment | v1.0 | ChatGPT 5 | ChatGPT 5.5 | June 19, 2026 | Strong | Published | Failure Mode Series |
| FTR Test #52 | FTR-2026-052 | Authority Influence vs Independent Evaluation Stability | Domain 52 | Independent Evaluation Stability | v1.0 | ChatGPT 5 | ChatGPT 5.5 | June 22, 2026 | Strong | Published | Failure Mode Series |
| FTR Test #53 | FTR-2026-053 | Local Optimization vs System-Level Performance Integrity | Domain 53 | System-Level Performance Integrity | v1.0 | ChatGPT 5 | ChatGPT 5.5 | June 24, 2026 | Strong | Published | Failure Mode Series |
| FTR Test #54 | FTR-2026-054 | Evidence Sufficiency vs Decision Timing | Domain 54 | Evidence Sufficiency | v1.0 | ChatGPT 5 | ChatGPT 5.5 | June 26, 2026 | Strong | Published | Failure Mode Series |
| FTR Test #55 | FTR-2026-055 | Decision Adaptation Under Changing Operational Conditions | Domain 55 | Decision Adaptation | v1.0 | ChatGPT 5 | ChatGPT 5.5 | June 29, 2026 | Strong | Published | Failure Mode Series |
| FTR Test #56 | FTR-2026-056 | Decision Discipline Under Evidence Equivalence | Domain 56 | Decision Discipline | v1.0 | ChatGPT 5 | ChatGPT 5.5 | June 29, 2026 | Strong | Published | Failure Mode Series |
| FTR Test #57 | FTR-2026-057 | Assumption Stability Under Contradictory Operational Evidence | Domain 57 | Assumption Stability | v1.0 | ChatGPT 5 | ChatGPT 5.5 | July 03, 2026 | Strong | Published | Failure Mode Series |
| FTR Test #58 | FTR-2026-058 | Objective Stability Under Changing Operational Priorities | Domain 58 | Objective Stability | v1.0 | ChatGPT 5 | ChatGPT 5.5 | July 05, 2026 | Strong | Published | Failure Mode Series |
| FTR Test #59 | FTR-2026-059 | Constraint Recognition vs Organizational Preference | Domain 59 | Constraint Recognition | v1.0 | ChatGPT 5 | ChatGPT 5.5 | July 08, 2026 | Strong | Published | Failure Mode Series |
| FTR Test #60 | FTR-2026-060 | Requirement Hierarchy Stability Under Multi-Level Governance Conflict | Domain 60 | Requirement Hierarchy Stability | v1.0 | ChatGPT 5 | ChatGPT 5.5 | July 11, 2026 | Strong | Published | Failure Mode Series |
| FTR Test #61 | FTR-2026-061 | Information Fidelity Under Executive Summary Compression | Domain 61 | Information Fidelity | v1.0 | ChatGPT 5 | ChatGPT 5.5 | July 11, 2026 | Strong | Published | Failure Mode Series |
| FTR Test #62 | FTR-2026-062 | Information Fidelity Under Audience Translation | Domain 62 | Information Fidelity | v1.0 | ChatGPT 5 | ChatGPT 5.5 | July 15, 2026 | Strong | Published | Failure Mode Series |
| FTR Test #63 | FTR-2026-063 | Operational Information Integrity During Controlled Document Revision | Domain 63 | Information Fidelity | v1.0 | ChatGPT 5 | ChatGPT 5.5 | July 19, 2026 | Moderate | Published | Failure Mode Series |
| FTR Test #64 | FTR-2026-064 | Requirement Completeness Recognition Before Operational Analysis | Domain 64 | Problem Qualification | v1.0 | ChatGPT 5 | ChatGPT 5.5 | July 19, 2026 | Strong | Published | Failure Mode Series |
| FTR Test #65 | FTR-2026-065 | Strategic Continuity Under Competing Priorities | Domain 65 | Strategic Continuity | v1.0 | ChatGPT 5 | ChatGPT 5.5 | July 26, 2026 | Strong | Published | Failure Mode Series |
| FTR Test #66 | FTR-2026-066 | Roadmap Revision Under Evidence Invalidation | Domain 66 | Strategic Continuity | v1.0 | ChatGPT 5 | ChatGPT 5.5 | July 26, 2026 | Strong | Published | Failure Mode Series |
| FTR Test #67 | FTR-2026-067 | Governance Recovery Following Unauthorized Project Execution | Domain 67 | Governance Recovery | v1.0 | ChatGPT 5 | ChatGPT 5.5 | July 26, 2026 | Strong | Published | Failure Mode Series |
| FTR Test #68 | FTR-2026-068 | Authority Conflict Resolution | Domain 68 | Governance Decision Integrity | v1.0 | ChatGPT 5 | ChatGPT 5.5 | August 01, 2026 | Strong | Published | Failure Mode Series |
| FTR Test #69 | FTR-2026-069 | Governance Exception and Waiver Evaluation | Domain 69 | Governance Decision Integrity | v1.0 | ChatGPT 5 | ChatGPT 5.5 | August 01, 2026 | Strong | Published | Failure Mode Series |
| FTR Test #70 | FTR-2026-070 | Governance Decision Under Conflicting Evidence | Domain 70 | Evidence Integrity | v1.0 | ChatGPT 5 | ChatGPT 5.5 | August 01, 2026 | Strong | Published | Failure Mode Series |
| FTR Test #71 | FTR-2026-071 | Evidence Sufficiency and Decision Support | Domain 71 | Evidence Integrity | v1.0 | ChatGPT 5 | ChatGPT 5.5 | August 07, 2026 | Strong | Published | Failure Mode Series |
| FTR Test #72 | FTR-2026-072 | Evidence Weighting and Decision Priority | Domain 72 | Evidence Integrity | v1.0 | ChatGPT 5 | ChatGPT 5.5 | August 07, 2026 | Strong | Published | Failure Mode Series |
| FTR Test #73 | FTR-2026-073 | Evidence Scope and Conclusion Boundaries | Domain 73 | Evidence Integrity | v1.0 | ChatGPT 5 | ChatGPT 5.5 | August 8, 2026 | Strong | Published | Failure Mode Series |
| FTR Test #74 | FTR-2026-074 | Evidence Provenance and Transformation Integrity | Domain 74 | Evidence Integrity | v1.0 | ChatGPT 5 | ChatGPT 5.5 | August 14, 2026 | Strong | Published | Failure Mode Series |
| FTR Test #75 | FTR-2026-075 | Evidence Currency and Supersession Control | Domain 75 | Evidence Integrity | v1.0 | ChatGPT 5 | ChatGPT 5.5 | August 15, 2026 | Strong | Published | Failure Mode Series |
| FTR Test #76 | FTR-2026-076 | Evidence Change and Decision Reassessment | Domain 76 | Evidence Integrity | v1.0 | ChatGPT 5 | ChatGPT 5.5 | August 15, 2026 | Strong | Published | Failure Mode Series |
| FTR Test #77 | FTR-2026-077 | Operational Adaptation Under Changed Execution Conditions | Domain 77 | Operational Adaptation | v1.0 | ChatGPT 5 | ChatGPT 5.5 | August 19, 2026 | Strong | Published | Failure Mode Series |
| FTR Test #78 | FTR-2026-078 | Evidence Sufficiency Before AI Authority Expansion | Domain 78 | Evidence Sufficiency | v1.0 | ChatGPT 5 | ChatGPT 5.5 | August 24, 2026 | Strong | Published | Failure Mode Series |
| FTR Test #79 | FTR-2026-079 | Reliability Boundary Recognition Under Changed Operating Conditions | Domain 79 | Operational Adaptation | v1.0 | ChatGPT 5 | ChatGPT 5.5 | August 26, 2026 | Strong | Published | Failure Mode Series |
| FTR Test #80 | FTR-2026-080 | Control Adequacy Under Apparent Human Oversight | Domain 80 | Governance Decision Integrity | v1.0 | ChatGPT 5 | ChatGPT 5.5 | August 30, 2026 | Strong | Published | Failure Mode Series |
| FTR Test #81 | FTR-2026-081 | Detectability Before Operational Consequence | Domain 81 | Recovery Discipline | v1.0 | ChatGPT 5 | ChatGPT 5.5 | August 30, 2026 | Strong | Published | Failure Mode Series |
| FTR Test #82 | FTR-2026-082 | Permissible Authority Under Mixed Reliability Evidence | Domain 82 | Governance Decision Integrity | v1.0 | ChatGPT 5 | ChatGPT 5.5 | August 30, 2026 | Strong | Published | Failure Mode Series |
| FTR Test #83 | FTR-2026-083 | Constraint Conflict Without Unsupported Resolution | Domain 83 | Constraint Integration | v1.0 | ChatGPT 5 | ChatGPT 5.6 Sol Light | September 5, 2026 | Strong | Published | Failure Mode Series |
| FTR Test #84 | FTR-2026-084 | Changed Conditions Without Stale-Plan Continuation | Domain 84 | Operational Adaptation | v1.0 | ChatGPT 5 | ChatGPT 5.6 Sol Light | September 5, 2026 | Strong | Published | Failure Mode Series |
| FTR Test #85 | FTR-2026-085 | Objective Preservation During Operational Recovery | Domain 85 | Strategic Continuity | v1.0 | ChatGPT 5 | ChatGPT 5.6 Sol Light | September 5, 2026 | Strong | Published | Failure Mode Series |
Methodology Note
All evaluations listed in this registry are conducted under the First Tier Review Methodology (v1.0).
Capability domains are defined in the First Tier Review Capability Domain Taxonomy (v1.0).
Testing environments are controlled and prompt conditions are documented to ensure repeatability and structural consistency across evaluations.
Performance classifications reflect observed system behavior and do not constitute rankings, endorsements, or product comparisons.
Registry Citation Notice
The First Tier Review Test Registry provides the official record of all structured evaluations conducted under the First Tier Review Methodology (v1.0).
Each registered test includes a documented prompt directive, controlled testing environment, and full output record.
Researchers, analysts, and organizations referencing these evaluations should cite the specific FTR Test report and assessment date as recorded in the registry.
Related Framework Components
AI Systems Framework
Framework governance, operational standards, evidence controls, and evaluation architecture for AI Systems assessments.
AI Systems Capability Domain Taxonomy
Classification framework for operational AI capability domains under controlled evaluation conditions.
AI Instruction Governance
Operational evaluation of instruction hierarchy, persistence stability, and contextual control behavior.
AI Failure Modes
Operational evaluation of hallucination behavior, execution instability, and degradation patterns.
