Reinforcement Learning
Transformers
English
post-training
distillation
agentic-coding
composer-2.5
cursor
kimi-k2
grpo
dapo
diloco
openenv
trl
verl
research
methodology
Instructions to use Codeseys/composer-replication-framework with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- Transformers
How to use Codeseys/composer-replication-framework with Transformers:
# Load model directly from transformers import AutoModel model = AutoModel.from_pretrained("Codeseys/composer-replication-framework", device_map="auto") - Notebooks
- Google Colab
- Kaggle
Commit History
docs(reconcile): main-lags-master foot-gun is RESOLVED, not live d7e4b4e
docs: add refine-2026-06 engagement summary 5e64616
docs: main is canonical branch; retire main-lags-master foot-gun ace6dd4
docs(wave3): add OVERVIEW.md, index ADR-014, fold in adversarial-review fixes e130879
docs(wave2): archive point-in-time wave reviews + dated review bundles f00833d
docs(wave1): correctness pass — channel-3 provenance, gap honesty, dead links 20e3bd9
docs+seeds: file remaining-work issues (Seeds) + project-state doc fb13ea3
seeds: sync 2026-06-09 8d2e6fc
feat(trainer): policy-optimization objective MENU (ADR-014) aae66fa
docs(adr-013): close acceptance-gate boxes 1-5; only user-gated spend remains 7b34ebf
fix(phase-8): close all 5 cross-family final-verify findings + regression tests 678d10b
feat(b4-gpu+b6): GPU train-proof on A10G + docker-gated substrate E2E test c009712
feat(wave-b): ADR-013 LMA integration + B4 end-to-end SDPO-fires proof + doc refresh 21647a4
feat(wave-a): close ADR-011 (SDPO alignment indices) + ADR-012 (review findings) d02d724
architect: ADR-011/012/013 + research (alignment-index fix, review-findings closure, LMA channel-ladder) b4a584a
review+fix: cross-family adversarial ADR review (owed item) + remediation 185cce2
docs: wave summary — Composer 2.5 data-gen + targeted-RL textual-feedback 8498e8f
feat(datagen): ADR-010 FeatureDeletionEnv synthetic-data subsystem; accepted 9336af3
feat(hints): ADR-009 layered HintGenerator; accepted 84740d4
feat(trainer): ADR-008 gate-3 live GRPO+SDPO smoke PASS; ADR-008 accepted 2a34df4
feat(trainer): ADR-008 Dr.GRPO config + SDPO strict-alignment guard bde5c5e
docs(adr): add ADR-008/009/010 (Dr.GRPO+SDPO, layered hints, FeatureDeletionEnv) 36ab61e
research: Composer 2.5 data-gen + targeted-textual-feedback deep-research wave 6049d00
examples: add sdpo_real_trace_train_smoke — close the forward+backward+step link 7090729
Wave 21c: verify PRIME-RL adapter parity against upstream source (byte-for-byte) c98928e
Wave 21b: skip zero-signal SDPO on empty-recovery error turns + real-trace validation d61036a
Wave 21: close both Wave 20 debt items — chat-template alignment + structural is_error 6806cf7
Wave 20: ModalSpawnExecutor — finish the Modal-backed serverless executor a384097
Wave 19: production-grade SDPO via ComposerDataCollator + adapter + collator fixes 03bf323
Wave 18: 14 backlog items closed + 3-reviewer cross-family review 54efac8
Wave 17: close all 5 audit FLAGs + SDPO context alignment + serverless re-exports a84c060
Wave 16: install ergonomics + gradient evidence + SDPO end-to-end example c0a5ab7
Wave 15: 4-angle multi-model self-critique caught 2 math BLOCKERs in primary loss kernels; fixed against upstream byte-for-byte + GSM8K example + ergonomics e5add15
Wave 14: close every Wave 13 review finding + 4 documentation files; Wave 14b: real PRIME-RL parity + multi-process DiLoCo convergence d9dd3a5
Wave 13: serverless DiLoCo + replaysim normalization + 3 distillation losses + PRIME-RL + Monarch b266c31
Wave 12: close V1-V8 brief — GPU smoke, SDPO firing, real-trace e2e d88715c
Wave 11: cross-model adversarial review + honest down-revision f16fa23
Wave 10 — packaging: composer_replication is now pip-installable ac05fbf
Tidy .gitignore (de-dup *.jsonl, restore section blank lines) d52e126
Spike 007: include synthetic_session.jsonl fixture in repo a35a8d7
Wave 7+8+9: spikes 006/007/008 — close vision-validation gaps V2/V5/V8 57af35d
Wave 7: Phase 2-4 of deep work loop — backlog, parallel research, three ADRs ac4bfb4
Wave 6: vision validation self-audit (5/10 to 9/10 in 5 days, no GPU) 040eff8
baladithyab commited on
Wave 5: full publication-materials drafts (pre-experimental release set) 639a760
baladithyab commited on
Wave 4: data collator + loss composition smoke (38/38 tests pass) 157cdba
baladithyab commited on
Wave 3: integration architecture + spike-005 trainer skeleton (16 tests pass) fd77f74
baladithyab commited on
Integrate Cursor blog directly + audit research note + add SDPO/OPSD link 1cede23
baladithyab commited on