AutoMate: Specialist and Generalist Assembly Policies over Diverse Geometries

July 13, 2026

Training Specialist Policies:

1.Assembly-by-Disassembly
-collect demonstration for disassembly instead and reverse the disassembly paths for assembly
2.Reinforcement Learning w/ Imitation Objective
-use PPO with engineered reward RBR_B and imitation reward RIR_I: Rt=omegaBRB+omegaIRIR_t = \\omega_B R_B + \\omega_I R_I
-RIR_I based on the closest demonstration path
3.Dynamic Time Warping (DTW) for Trajectory Matching
-find a mapping between end effector path and demonstration path to fix discretization issues between sampling rates

Recipe:

1.Standard behavior cloning baseline
2.RL fine-tuning for assembly tasks