FA-74701 / Experiment statistics / Open access
Complier average causal effect: Negative compliance differences produce a CACE · case 01
A treatment that lowered uptake reports an inverted complier effect.
ROOT CAUSE
CACE is computed whenever the compliance difference is nonzero.
THE FAILURE
CACE is computed whenever the compliance difference is nonzero.
Unsuccessful approach: Requiring compliance above one half discards legitimate low-uptake experiments.
Case contract
Outcome sums cover every assigned user. ITT = outcome_sum_t / assigned_t - outcome_sum_c / assigned_c. Compliance difference = took_t / assigned_t - took_c / assigned_c (control users can cross over). CACE = ITT / compliance difference when that difference is positive, else None. Nonpositive assignment counts -> None. Return [ITT, compliance difference, CACE] rounded to 6.
Why this case matters
Opt-in features have partial uptake; the effect on adopters needs an instrumental-variable estimate.
1 / The failure
Exit 1"""Failure Map reference implementation. Python standard library only."""
import json
N = 1
observations = []
def solve(assigned_c, took_c, outcome_sum_c, assigned_t, took_t, outcome_sum_t):
if assigned_c <= 0 or assigned_t <= 0:
return None
itt = outcome_sum_t / assigned_t - outcome_sum_c / assigned_c
comp = took_t / assigned_t - took_c / assigned_c
cace = round(itt / comp, 6) if comp != 0 else None
return [round(itt, 6), round(comp, 6), cace]
def check(label, actual, expected):
observations.append({"check": label, "actual": actual, "expected": expected, "passed": actual == expected})
fixtures = [[('crossover in control reduces compliance difference', [200, 20, 300, 200, 120, 420], [0.6, 0.5, 1.2]),
('unequal arm sizes', [100, 0, 150, 400, 200, 800], [0.5, 0.5, 1.0]),
('no uptake difference has no CACE', [100, 50, 100, 100, 50, 120], [0.2, 0.0, None]),
('low but positive compliance still yields CACE', [100, 0, 100, 100, 30, 130], [0.3, 0.3, 1.0]),
('negative compliance difference', [100, 60, 100, 100, 40, 90], [-0.1, -0.2, None]),
('uptake sample 1', [200, 22, 428, 400, 23, 389], [-1.1675, -0.0525, None]),
('uptake sample 2', [100, 22, 279, 400, 165, 505], [-1.5275, 0.1925, -7.935065]),
('uptake sample 3', [100, 11, 241, 400, 240, 17], [-2.3675, 0.49, -4.831633])],
[('crossover in control reduces compliance difference', [200, 20, 300, 200, 120, 420], [0.6, 0.5, 1.2]),
('unequal arm sizes', [100, 0, 150, 400, 200, 800], [0.5, 0.5, 1.0]),
('no uptake difference has no CACE', [100, 50, 100, 100, 50, 120], [0.2, 0.0, None]),
('low but positive compliance still yields CACE', [100, 0, 100, 100, 30, 130], [0.3, 0.3, 1.0]),
('negative compliance difference', [100, 60, 100, 100, 40, 90], [-0.1, -0.2, None]),
('uptake sample 6', [400, 10, 585, 300, 223, 613], [0.580833, 0.718333, 0.808585]),
('uptake sample 13', [200, 37, 126, 100, 31, 28], [-0.35, 0.125, -2.8]),
('uptake sample 56', [200, 46, 138, 400, 11, 1127], [2.1275, -0.2025, None])],
[('crossover in control reduces compliance difference', [200, 20, 300, 200, 120, 420], [0.6, 0.5, 1.2]),
('unequal arm sizes', [100, 0, 150, 400, 200, 800], [0.5, 0.5, 1.0]),
('no uptake difference has no CACE', [100, 50, 100, 100, 50, 120], [0.2, 0.0, None]),
('low but positive compliance still yields CACE', [100, 0, 100, 100, 30, 130], [0.3, 0.3, 1.0]),
('negative compliance difference', [100, 60, 100, 100, 40, 90], [-0.1, -0.2, None]),
('uptake sample 11', [400, 10, 635, 100, 93, 173], [0.1425, 0.905, 0.157459]),
('uptake sample 31', [200, 36, 277, 100, 47, 205], [0.665, 0.29, 2.293103]),
('uptake sample 34', [100, 16, 114, 100, 3, 9], [-1.05, -0.13, None])],
[('crossover in control reduces compliance difference', [200, 20, 300, 200, 120, 420], [0.6, 0.5, 1.2]),
('unequal arm sizes', [100, 0, 150, 400, 200, 800], [0.5, 0.5, 1.0]),
('no uptake difference has no CACE', [100, 50, 100, 100, 50, 120], [0.2, 0.0, None]),
('low but positive compliance still yields CACE', [100, 0, 100, 100, 30, 130], [0.3, 0.3, 1.0]),
('negative compliance difference', [100, 60, 100, 100, 40, 90], [-0.1, -0.2, None]),
('uptake sample 16', [100, 6, 298, 300, 104, 511], [-1.276667, 0.286667, -4.453488]),
('uptake sample 28', [200, 65, 83, 400, 91, 261], [0.2375, -0.0975, None]),
('uptake sample 44', [400, 74, 499, 400, 166, 1064], [1.4125, 0.23, 6.141304])],
[('crossover in control reduces compliance difference', [200, 20, 300, 200, 120, 420], [0.6, 0.5, 1.2]),
('unequal arm sizes', [100, 0, 150, 400, 200, 800], [0.5, 0.5, 1.0]),
('no uptake difference has no CACE', [100, 50, 100, 100, 50, 120], [0.2, 0.0, None]),
('low but positive compliance still yields CACE', [100, 0, 100, 100, 30, 130], [0.3, 0.3, 1.0]),
('negative compliance difference', [100, 60, 100, 100, 40, 90], [-0.1, -0.2, None]),
('uptake sample 18', [200, 43, 285, 300, 21, 666], [0.795, -0.145, None]),
('uptake sample 21', [100, 18, 78, 100, 98, 114], [0.36, 0.8, 0.45]),
('uptake sample 54', [100, 23, 3, 400, 181, 1088], [2.69, 0.2225, 12.089888])]]
for label, args, expected in fixtures[N - 1]:
check(label, solve(*args), expected)
print(json.dumps({"observations": observations, "passed": all(x["passed"] for x in observations)}, ensure_ascii=False))
raise SystemExit(0 if all(x["passed"] for x in observations) else 1)
| Boundary fixture | Actual | Expected | Outcome |
|---|---|---|---|
| crossover in control reduces compliance difference | [0.6, 0.5, 1.2] | [0.6, 0.5, 1.2] | Passed |
| unequal arm sizes | [0.5, 0.5, 1.0] | [0.5, 0.5, 1.0] | Passed |
| no uptake difference has no CACE | [0.2, 0.0, None] | [0.2, 0.0, None] | Passed |
| low but positive compliance still yields CACE | [0.3, 0.3, 1.0] | [0.3, 0.3, 1.0] | Passed |
| negative compliance difference | [-0.1, -0.2, 0.5] | [-0.1, -0.2, None] | Failed |
| uptake sample 1 | [-1.1675, -0.0525, 22.238095] | [-1.1675, -0.0525, None] | Failed |
| uptake sample 2 | [-1.5275, 0.1925, -7.935065] | [-1.5275, 0.1925, -7.935065] | Passed |
| uptake sample 3 | [-2.3675, 0.49, -4.831633] | [-2.3675, 0.49, -4.831633] | Passed |
SHA-256 / aa58bf24fc291d4caa9743b0c5e609da2e4b2202252155c56928d36e471adecf
2 / The unsuccessful fix
Exit 1"""Failure Map reference implementation. Python standard library only."""
import json
N = 1
observations = []
def solve(assigned_c, took_c, outcome_sum_c, assigned_t, took_t, outcome_sum_t):
if assigned_c <= 0 or assigned_t <= 0:
return None
itt = outcome_sum_t / assigned_t - outcome_sum_c / assigned_c
comp = took_t / assigned_t - took_c / assigned_c
cace = round(itt / comp, 6) if comp > 0.5 else None
return [round(itt, 6), round(comp, 6), cace]
def check(label, actual, expected):
observations.append({"check": label, "actual": actual, "expected": expected, "passed": actual == expected})
fixtures = [[('crossover in control reduces compliance difference', [200, 20, 300, 200, 120, 420], [0.6, 0.5, 1.2]),
('unequal arm sizes', [100, 0, 150, 400, 200, 800], [0.5, 0.5, 1.0]),
('no uptake difference has no CACE', [100, 50, 100, 100, 50, 120], [0.2, 0.0, None]),
('low but positive compliance still yields CACE', [100, 0, 100, 100, 30, 130], [0.3, 0.3, 1.0]),
('negative compliance difference', [100, 60, 100, 100, 40, 90], [-0.1, -0.2, None]),
('uptake sample 1', [200, 22, 428, 400, 23, 389], [-1.1675, -0.0525, None]),
('uptake sample 2', [100, 22, 279, 400, 165, 505], [-1.5275, 0.1925, -7.935065]),
('uptake sample 3', [100, 11, 241, 400, 240, 17], [-2.3675, 0.49, -4.831633])],
[('crossover in control reduces compliance difference', [200, 20, 300, 200, 120, 420], [0.6, 0.5, 1.2]),
('unequal arm sizes', [100, 0, 150, 400, 200, 800], [0.5, 0.5, 1.0]),
('no uptake difference has no CACE', [100, 50, 100, 100, 50, 120], [0.2, 0.0, None]),
('low but positive compliance still yields CACE', [100, 0, 100, 100, 30, 130], [0.3, 0.3, 1.0]),
('negative compliance difference', [100, 60, 100, 100, 40, 90], [-0.1, -0.2, None]),
('uptake sample 6', [400, 10, 585, 300, 223, 613], [0.580833, 0.718333, 0.808585]),
('uptake sample 13', [200, 37, 126, 100, 31, 28], [-0.35, 0.125, -2.8]),
('uptake sample 56', [200, 46, 138, 400, 11, 1127], [2.1275, -0.2025, None])],
[('crossover in control reduces compliance difference', [200, 20, 300, 200, 120, 420], [0.6, 0.5, 1.2]),
('unequal arm sizes', [100, 0, 150, 400, 200, 800], [0.5, 0.5, 1.0]),
('no uptake difference has no CACE', [100, 50, 100, 100, 50, 120], [0.2, 0.0, None]),
('low but positive compliance still yields CACE', [100, 0, 100, 100, 30, 130], [0.3, 0.3, 1.0]),
('negative compliance difference', [100, 60, 100, 100, 40, 90], [-0.1, -0.2, None]),
('uptake sample 11', [400, 10, 635, 100, 93, 173], [0.1425, 0.905, 0.157459]),
('uptake sample 31', [200, 36, 277, 100, 47, 205], [0.665, 0.29, 2.293103]),
('uptake sample 34', [100, 16, 114, 100, 3, 9], [-1.05, -0.13, None])],
[('crossover in control reduces compliance difference', [200, 20, 300, 200, 120, 420], [0.6, 0.5, 1.2]),
('unequal arm sizes', [100, 0, 150, 400, 200, 800], [0.5, 0.5, 1.0]),
('no uptake difference has no CACE', [100, 50, 100, 100, 50, 120], [0.2, 0.0, None]),
('low but positive compliance still yields CACE', [100, 0, 100, 100, 30, 130], [0.3, 0.3, 1.0]),
('negative compliance difference', [100, 60, 100, 100, 40, 90], [-0.1, -0.2, None]),
('uptake sample 16', [100, 6, 298, 300, 104, 511], [-1.276667, 0.286667, -4.453488]),
('uptake sample 28', [200, 65, 83, 400, 91, 261], [0.2375, -0.0975, None]),
('uptake sample 44', [400, 74, 499, 400, 166, 1064], [1.4125, 0.23, 6.141304])],
[('crossover in control reduces compliance difference', [200, 20, 300, 200, 120, 420], [0.6, 0.5, 1.2]),
('unequal arm sizes', [100, 0, 150, 400, 200, 800], [0.5, 0.5, 1.0]),
('no uptake difference has no CACE', [100, 50, 100, 100, 50, 120], [0.2, 0.0, None]),
('low but positive compliance still yields CACE', [100, 0, 100, 100, 30, 130], [0.3, 0.3, 1.0]),
('negative compliance difference', [100, 60, 100, 100, 40, 90], [-0.1, -0.2, None]),
('uptake sample 18', [200, 43, 285, 300, 21, 666], [0.795, -0.145, None]),
('uptake sample 21', [100, 18, 78, 100, 98, 114], [0.36, 0.8, 0.45]),
('uptake sample 54', [100, 23, 3, 400, 181, 1088], [2.69, 0.2225, 12.089888])]]
for label, args, expected in fixtures[N - 1]:
check(label, solve(*args), expected)
print(json.dumps({"observations": observations, "passed": all(x["passed"] for x in observations)}, ensure_ascii=False))
raise SystemExit(0 if all(x["passed"] for x in observations) else 1)
| Boundary fixture | Actual | Expected | Outcome |
|---|---|---|---|
| crossover in control reduces compliance difference | [0.6, 0.5, None] | [0.6, 0.5, 1.2] | Failed |
| unequal arm sizes | [0.5, 0.5, None] | [0.5, 0.5, 1.0] | Failed |
| no uptake difference has no CACE | [0.2, 0.0, None] | [0.2, 0.0, None] | Passed |
| low but positive compliance still yields CACE | [0.3, 0.3, None] | [0.3, 0.3, 1.0] | Failed |
| negative compliance difference | [-0.1, -0.2, None] | [-0.1, -0.2, None] | Passed |
| uptake sample 1 | [-1.1675, -0.0525, None] | [-1.1675, -0.0525, None] | Passed |
| uptake sample 2 | [-1.5275, 0.1925, None] | [-1.5275, 0.1925, -7.935065] | Failed |
| uptake sample 3 | [-2.3675, 0.49, None] | [-2.3675, 0.49, -4.831633] | Failed |
SHA-256 / 57b3fd19b0c614a6b77b8d0ec5bf248c814f1ea2299491f4408470655bdf7b61
HELD IN THE MEMBER ARCHIVE
The verified repair and its recorded checks are member-only.
This mechanism has 8 recorded checks per implementation. The open-access tier publishes the failure and the unsuccessful fix; the repaired source that passes every check, and the observations that prove it, are available to members.
Every case sharing this mechanism uses the same contract and the same repair, so this one record is held back for all of them.
Member access is invitation-based. Sign in with your invited account to inspect the repair.
Sign in to the archive ↗Verification & scope
A deterministic toy experiment-analysis model with a stipulated contract; results are rounded and are not a substitute for a validated statistics package. This reproducer isolates one failure mechanism. Results cover the supplied fixtures. Variants within a family share a test contract and should remain grouped when constructing evaluation splits. Related mechanisms with a shared evaluation_group must also remain together; these controlled models are not independent production incidents.
Observations recorded using Python 3.12.14 at 2026-09-29T14:48:59.148113+00:00.
Case digest / 374e8ac32e33f61646992613c6f062af3fcdd384bfc4cd359558a49238eee8fe