← Back
Finding 8493Emerging EvidenceValidation V0

Reinforcement learning agents, trained with Proximal Policy Optimisation and self-imitation, act as high-frequency market makers, exploiting predictable price moves from medium-frequency traders using simple strategies like TWAP in simulated markets.

78%Confidence
1Evidence objects
v1Version
DraftStatus

Evidence trail

Knowledge status

This Finding was extracted from the configured corpus. It is versioned, traceable, and may evolve through editorial review or new corpus evidence.