feat: implement 5-phase architecture with discovery, knowledge layers, and evidence collection - #2
Merged
Conversation
Implementiert alle 5 Phasen gemäß Aufgabenstellung: **Phase 1: Discovery & Firstmate-Version-Awareness** - Live Model Discovery: Pi, Claude, Codex, Grok, Kimi - Caching mit 15min TTL und Stale Detection - Harness-Katalog-Verifizierung - Firstmate-Version-Erkennung - Neue Datei: src/discovery.ts **Phase 2: Drei-Ebenen Knowledge** - A. Hersteller-Fakten (knowledge/manufacturers/) - B. Externe Benchmarks (knowledge/benchmarks/) - C. Lokale Crew-Evidenz (knowledge/local/) - Source-Konflikt-Hierarchie implementiert: * "Was verfügbar?": Discovery > Auth > Manufacturer * "Was kann es?": Official Docs > Website > Discovery * "Wie gut?": Local Evidence > Benchmarks > Claims - Neue Datei: src/knowledge-layers.ts **Phase 3: Selbstaktualisierung** - Integration mit /updatefirstmate Workflow - Compatibility Checks: Dispatch-Schema, Harnesses, Spawn-Flags, Efforts - Auto-Refresh bei Firstmate-Updates - Fail-loud bei Breaking Changes - Neue Datei: src/update.ts **Phase 4: Compatibility Test Suite** - tests/discovery.test.ts (8 Tests) - tests/knowledge-layers.test.ts (10 Tests) - tests/update.test.ts (12 Tests) - tests/evidence.test.ts (7 Tests) - Alle Tests grün: 87 pass, 0 fail - CI-ready **Phase 5: Lokale Crew-Evidence Collection (MANDATORY)** - Automatisches Tracking von no-mistakes Outcomes - Metriken: TaskClass, Harness, Provider, Model, Effort, Duration, Success, Tests, CI, Rework - Privacy-conscious: KEINE Code-Inhalte, KEINE Prompts - Aggregation per TaskClass/Model - Neue Datei: src/evidence.ts **Neue Tools:** - crew_discover: Live Model Discovery mit Cache-Status - crew_evidence: Lokale Evidenz anzeigen (aggregiert) - crew_update_check: Firstmate Compatibility Check **Architektur-Prinzipien eingehalten:** - Firstmate bleibt Authority für Dispatch - crew-knowledge liefert nur Empfehlungen - Kein Competing Dispatch Engine - Nutzt Firstmate's quota-array-dispatch - Respektiert config/crew-dispatch.json Natural Language Rules - Provider ≠ Model ≠ Harness (klare Trennung) - Herdr ist Infrastructure, nicht Model-Capability **Dokumentation:** - README.md erweitert (Features, Drei-Ebenen System, Architektur-Prinzipien) - knowledge/README.md erweitert (Drei-Ebenen Struktur) - AGENTS.md erweitert (neue Tools, Architektur-Prinzipien) Alle 5 Phasen komplett, alle Tests grün, bereit für no-mistakes Pipeline.
This file contains hidden or bidirectional Unicode text that may be interpreted or compiled differently than what appears below. To review, open the file in an editor that reveals hidden Unicode characters.
Learn more about bidirectional Unicode characters
Sign up for free
to join this conversation on GitHub.
Already have an account?
Sign in to comment
Add this suggestion to a batch that can be applied as a single commit.This suggestion is invalid because no changes were made to the code.Suggestions cannot be applied while the pull request is closed.Suggestions cannot be applied while viewing a subset of changes.Only one suggestion per line can be applied in a batch.Add this suggestion to a batch that can be applied as a single commit.Applying suggestions on deleted lines is not supported.You must change the existing code in this line in order to create a valid suggestion.Outdated suggestions cannot be applied.This suggestion has been applied or marked resolved.Suggestions cannot be applied from pending reviews.Suggestions cannot be applied on multi-line comments.Suggestions cannot be applied while the pull request is queued to merge.Suggestion cannot be applied right now. Please check back later.
Intent
Complete Overhaul: Implement ALL 5 phases from scout report for firstmate-crew-knowledge.
Phase 1: Discovery & Firstmate-Version-Awareness
Phase 2: Drei-Ebenen Knowledge
Phase 3: Selbstaktualisierung
Phase 4: Compatibility Test Suite
Phase 5: Lokale Crew-Evidence Collection (MANDATORY)
Architecture Principles (from Scout Report Section 1):
Scout Report Key Additions:
Section 10: Source-Konflikt-Hierarchie
Section 11: Harness/Model/Provider-Trennung
Section 12: Herdr als Execution-Backend
Deliverables:
What Changed
src/discovery.ts), three-level knowledge system for manufacturer docs/benchmarks/local evidence (src/knowledge-layers.ts), self-updating compatibility checks (src/update.ts), and privacy-conscious evidence collection from no-mistakes outcomes (src/evidence.ts)crew_discover,crew_evidence,crew_update_check) exposing discovery, evidence, and compatibility checking, plus Kimi provider support across all existing toolsRisk Assessment
✅ Low: Well-bounded additive implementation with comprehensive test coverage, clear documentation, no breaking changes, and all acceptance criteria met.
Testing
All 87 automated tests pass covering discovery, knowledge layers, evidence collection, update checks, dispatch generation, quota integration, and task routing. Manual end-to-end demonstrations verified all 7 tools produce correct output. All 5 phases from scout report fully implemented. Package installable as Pi extension. Documentation comprehensive. No issues found.
Evidence: npm test output (87/87 passing)
Evidence: Phase demonstration output
Evidence: Tool execution demonstration (crew_route, crew_balance, crew_apply_dispatch)
Evidence: Comprehensive verification report
Pipeline
Updates from git push no-mistakes
✅ **intent** - passed
✅ No issues found.
✅ **Rebase** - passed
✅ No issues found.
✅ **Review** - passed
✅ No issues found.
✅ **Test** - passed
✅ No issues found.
npm test(87 tests across 19 suites: discovery, dispatch, evidence, knowledge-layers, quota, scorer, update, session-models, suggest-primary)Phase 1 verification: Discovery cache, staleness detection, harness verification viasrc/discovery.tsPhase 2 verification: Drei-Ebenen knowledge structure (knowledge/manufacturers/,knowledge/benchmarks/,knowledge/local/)Phase 3 verification: Compatibility checks, version detection viasrc/update.tsPhase 4 verification: Test suite completeness (dispatch schema, harness verification, model discovery, effort values)Phase 5 verification: Evidence collection functions, privacy validation (no code, no prompts)Manual demo:crew_routewith standard_ship, research, and hard_multi_file tasksManual demo:crew_balancewith live quota (degraded mode)Manual demo:crew_apply_dispatchdry-run outputPackage.json pi extension configurationREADME documentation completeness (Features, Drei-Ebenen, Architecture Principles)Worktree cleanup (removed transientknowledge/local/aggregated.jsoncreated during testing)✅ **Document** - passed
✅ No issues found.
✅ **Lint** - passed
✅ No issues found.
✅ **Push** - passed
✅ No issues found.