FA-11851 / Search retrieval semantics / Open access
Repeated token occurrences satisfy too many optional query clauses · case 01
Repeated token occurrences satisfy too many optional query clauses.
ROOT CAUSE
Term frequency is counted instead of satisfied optional clauses.
VERIFIED REPAIR
Count distinct query clauses with at least one matching token.
Unsuccessful approach: Deduplicating document terms alone still counts unrelated document vocabulary.
Case contract
For unique optional query terms and nonnegative minimum, match if at least minimum query terms occur. Repetitions and unrelated terms do not count.
Why this case matters
An offline deterministic retrieval model isolates this search contract from tokenization, storage, and network behavior.
1 / The failure
Exit 1"""Failure Map reference implementation. Python standard library only."""
import json
N = 1
observations = []
def solve(tokens, clauses, minimum):
return sum(t in clauses for t in tokens) >= minimum
def check(label, actual, expected):
observations.append({"check": label, "actual": actual, "expected": expected, "passed": actual == expected})
a='a'+str(N)
check('repeated token', solve([a]* (N+2), [a,'b'],2), False)
check('unrelated vocabulary', solve([a,'x','y'], [a,'b'],2), False)
check('two clauses', solve([a,'b','b'],[a,'b'],2), True)
check('zero minimum', solve([], [a],0), True)
check('impossible minimum', solve([a,'b'],[a,'b'],3), False)
check('empty query positive minimum', solve(['x'],[],1), False)
check('one match', solve([a],[a,'b'],1), True)
print(json.dumps({"observations": observations, "passed": all(x["passed"] for x in observations)}, ensure_ascii=False))
raise SystemExit(0 if all(x["passed"] for x in observations) else 1)
| Boundary fixture | Actual | Expected | Outcome |
|---|---|---|---|
| repeated token | True | False | Failed |
| unrelated vocabulary | False | False | Passed |
| two clauses | True | True | Passed |
| zero minimum | True | True | Passed |
| impossible minimum | False | False | Passed |
| empty query positive minimum | False | False | Passed |
| one match | True | True | Passed |
SHA-256 / 10ed763bc4477a1fb0382c9d734edaef12b8a23e6224f1348b0c41c8e59e5431
2 / The unsuccessful fix
Exit 1"""Failure Map reference implementation. Python standard library only."""
import json
N = 1
observations = []
def solve(tokens, clauses, minimum):
return len(set(tokens)) >= minimum
def check(label, actual, expected):
observations.append({"check": label, "actual": actual, "expected": expected, "passed": actual == expected})
a='a'+str(N)
check('repeated token', solve([a]* (N+2), [a,'b'],2), False)
check('unrelated vocabulary', solve([a,'x','y'], [a,'b'],2), False)
check('two clauses', solve([a,'b','b'],[a,'b'],2), True)
check('zero minimum', solve([], [a],0), True)
check('impossible minimum', solve([a,'b'],[a,'b'],3), False)
check('empty query positive minimum', solve(['x'],[],1), False)
check('one match', solve([a],[a,'b'],1), True)
print(json.dumps({"observations": observations, "passed": all(x["passed"] for x in observations)}, ensure_ascii=False))
raise SystemExit(0 if all(x["passed"] for x in observations) else 1)
| Boundary fixture | Actual | Expected | Outcome |
|---|---|---|---|
| repeated token | False | False | Passed |
| unrelated vocabulary | True | False | Failed |
| two clauses | True | True | Passed |
| zero minimum | True | True | Passed |
| impossible minimum | False | False | Passed |
| empty query positive minimum | True | False | Failed |
| one match | True | True | Passed |
SHA-256 / 5811b76c39f8d8599c8b20f97ee26c97172dc9e874fc9f11c830d2b9f6ebc988
3 / The verified repair
Exit 0"""Failure Map reference implementation. Python standard library only."""
import json
N = 1
observations = []
def solve(tokens, clauses, minimum):
return len(set(tokens) & set(clauses)) >= minimum
def check(label, actual, expected):
observations.append({"check": label, "actual": actual, "expected": expected, "passed": actual == expected})
a='a'+str(N)
check('repeated token', solve([a]* (N+2), [a,'b'],2), False)
check('unrelated vocabulary', solve([a,'x','y'], [a,'b'],2), False)
check('two clauses', solve([a,'b','b'],[a,'b'],2), True)
check('zero minimum', solve([], [a],0), True)
check('impossible minimum', solve([a,'b'],[a,'b'],3), False)
check('empty query positive minimum', solve(['x'],[],1), False)
check('one match', solve([a],[a,'b'],1), True)
print(json.dumps({"observations": observations, "passed": all(x["passed"] for x in observations)}, ensure_ascii=False))
raise SystemExit(0 if all(x["passed"] for x in observations) else 1)
| Boundary fixture | Actual | Expected | Outcome |
|---|---|---|---|
| repeated token | False | False | Passed |
| unrelated vocabulary | False | False | Passed |
| two clauses | True | True | Passed |
| zero minimum | True | True | Passed |
| impossible minimum | False | False | Passed |
| empty query positive minimum | False | False | Passed |
| one match | True | True | Passed |
SHA-256 / a0cb9973c8ff3bab88ff5ee90f4677706a55a450bd679dfb6b0bf17a515390ab
Verification & scope
Inputs are already tokenized or scored; this model makes no claim about production engine performance or linguistic analysis. This reproducer isolates one failure mechanism. Results cover the supplied fixtures. Variants within a family share a test contract and should remain grouped when constructing evaluation splits. Related mechanisms with a shared evaluation_group must also remain together; these controlled models are not independent production incidents.
Observations recorded using Python 3.12.14 at 2026-09-29T14:38:51.596300+00:00.
Case digest / 6d65034ce355a9779b54ea39cbfffd11cae3cc1d0f09f97e5054ee0f5b853302