Skip to content

Design sketch: Fleet Persuasion Eval (multi-agent extension) #8

Description

@rudi193-cmd

Design sketch: Fleet Persuasion Eval (multi-agent extension)

APE measures single-model attempt to persuade; our deployment uses multi-agent orchestration (bus messages, dispatch, policy hooks). We sketched an extension — Fleet Persuasion Eval (FPE) — that scores persuasion across agent boundaries under a fixed policy shell (benign compliance traps in v0, no harmful topic generation required).

Design doc: fleet-persuasion-eval-sketch.md

Proposed metrics: Fleet Attempt Rate, Fleet Compliance Rate (target violates policy), Fleet Safety Rate (refusal / hook block).

If there’s interest in a small v0 (pytest + mock fleet identities, reusing APE topic draws where appropriate), we’re happy to iterate here or on a dedicated issue.

rudi193-cmd/willow-2.0

Activity

Sign up for free to join this conversation on GitHub. Already have an account? Sign in to comment

Metadata

Metadata

Assignees

No one assigned

    Labels

    No labels
    No labels

    Type

    No type

    Projects

    No projects

      Milestone

      No milestone

      Relationships

      None yet

      Development

      No branches or pull requests

      Issue actions