YOLO7-B

Click a block to read its description, or select it with Tab and Enter.

YOLO7-BDetection; 640 × 640 RGB; 80 classes; batch 1; unfused native eval. Layer numbers preserve the MIT v7.yaml graph.LibreYOLOYOLO7-BDetection; 640 × 640 RGB; 80 classes; batch 1; unfused native eval. Layer numbers preserve the MIT v7.yaml graph.Matching F labels continue a tensor across columns. All YAML branches are explicit; block internals follow the in-tree implementation.Layers 1 to 27L1 Conv 3×3, s=132 ×640 ×640L2 Conv 3×3, s=264 ×320 ×320L3 Conv 3×3, s=164 ×320 ×320L4 Conv 3×3, s=2128 ×160 ×160L5 Conv 1×1, s=164 ×160 ×160L6 Conv 1×1, s=164 ×160 ×160L7 Conv 3×3, s=164 ×160 ×160L8 Conv 3×3, s=164 ×160 ×160L9 Conv 3×3, s=164 ×160 ×160L10 Conv 3×3, s=164 ×160 ×160L11 Concat256 ×160 ×160L12 Conv 1×1, s=1256 ×160 ×160L13 MaxPool 2×2, s=2, p=0256 ×80 ×80L14 Conv 1×1, s=1128 ×80 ×80L15 Conv 1×1, s=1128 ×160 ×160L16 Conv 3×3, s=2128 ×80 ×80L17 Concat256 ×80 ×80L18 Conv 1×1, s=1128 ×80 ×80L19 Conv 1×1, s=1128 ×80 ×80L20 Conv 3×3, s=1128 ×80 ×80L21 Conv 3×3, s=1128 ×80 ×80L22 Conv 3×3, s=1128 ×80 ×80L23 Conv 3×3, s=1128 ×80 ×80L24 Concat (B3)512 ×80 ×80L25 Conv 1×1, s=1512 ×80 ×80L26 MaxPool 2×2, s=2, p=0512 ×40 ×40L27 Conv 1×1, s=1256 ×40 ×40Input: 3 × 640 × 640F24F25F27Layers 28 to 54L28 Conv 1×1, s=1256 ×80 ×80L29 Conv 3×3, s=2256 ×40 ×40L30 Concat512 ×40 ×40L31 Conv 1×1, s=1256 ×40 ×40L32 Conv 1×1, s=1256 ×40 ×40L33 Conv 3×3, s=1256 ×40 ×40L34 Conv 3×3, s=1256 ×40 ×40L35 Conv 3×3, s=1256 ×40 ×40L36 Conv 3×3, s=1256 ×40 ×40L37 Concat1024 ×40 ×40L38 Conv 1×1, s=1 (B4)1024 ×40 ×40L39 MaxPool 2×2, s=2, p=01024 ×20 ×20L40 Conv 1×1, s=1512 ×20 ×20L41 Conv 1×1, s=1512 ×40 ×40L42 Conv 3×3, s=2512 ×20 ×20L43 Concat1024 ×20 ×20L44 Conv 1×1, s=1256 ×20 ×20L45 Conv 1×1, s=1256 ×20 ×20L46 Conv 3×3, s=1256 ×20 ×20L47 Conv 3×3, s=1256 ×20 ×20L48 Conv 3×3, s=1256 ×20 ×20L49 Conv 3×3, s=1256 ×20 ×20L50 Concat1024 ×20 ×20L51 Conv 1×1, s=1 (B5)1024 ×20 ×20L52 SPPCSPConv (N3)512 ×20 ×20L53 Conv 1×1, s=1256 ×20 ×20L54 Nearest upsample ×2256 ×40 ×40F25F27F38F52F54Layers 55 to 81L55 Conv 1×1, s=1256 ×40 ×40L56 Concat512 ×40 ×40L57 Conv 1×1, s=1256 ×40 ×40L58 Conv 1×1, s=1256 ×40 ×40L59 Conv 3×3, s=1128 ×40 ×40L60 Conv 3×3, s=1128 ×40 ×40L61 Conv 3×3, s=1128 ×40 ×40L62 Conv 3×3, s=1128 ×40 ×40L63 Concat1024 ×40 ×40L64 Conv 1×1, s=1 (N2)256 ×40 ×40L65 Conv 1×1, s=1128 ×40 ×40L66 Nearest upsample ×2128 ×80 ×80L67 Conv 1×1, s=1128 ×80 ×80L68 Concat256 ×80 ×80L69 Conv 1×1, s=1128 ×80 ×80L70 Conv 1×1, s=1128 ×80 ×80L71 Conv 3×3, s=164 ×80 ×80L72 Conv 3×3, s=164 ×80 ×80L73 Conv 3×3, s=164 ×80 ×80L74 Conv 3×3, s=164 ×80 ×80L75 Concat512 ×80 ×80L76 Conv 1×1, s=1 (P3)128 ×80 ×80L77 MaxPool 2×2, s=2, p=0128 ×40 ×40L78 Conv 1×1, s=1128 ×40 ×40L79 Conv 1×1, s=1128 ×80 ×80L80 Conv 3×3, s=2128 ×40 ×40L81 Concat512 ×40 ×40F38F54F24F76F81Layers 82 to 106L82 Conv 1×1, s=1256 ×40 ×40L83 Conv 1×1, s=1256 ×40 ×40L84 Conv 3×3, s=1128 ×40 ×40L85 Conv 3×3, s=1128 ×40 ×40L86 Conv 3×3, s=1128 ×40 ×40L87 Conv 3×3, s=1128 ×40 ×40L88 Concat1024 ×40 ×40L89 Conv 1×1, s=1 (P4)256 ×40 ×40L90 MaxPool 2×2, s=2, p=0256 ×20 ×20L91 Conv 1×1, s=1256 ×20 ×20L92 Conv 1×1, s=1256 ×40 ×40L93 Conv 3×3, s=2256 ×20 ×20L94 Concat1024 ×20 ×20L95 Conv 1×1, s=1512 ×20 ×20L96 Conv 1×1, s=1512 ×20 ×20L97 Conv 3×3, s=1256 ×20 ×20L98 Conv 3×3, s=1256 ×20 ×20L99 Conv 3×3, s=1256 ×20 ×20L100 Conv 3×3, s=1256 ×20 ×20L101 Concat2048 ×20 ×20L102 Conv 1×1, s=1 (P5)512 ×20 ×20L103 RepConv256 ×80 ×80L104 RepConv512 ×40 ×40L105 RepConv1024 ×20 ×20L106 MultiheadDetection (Main)255 ×80 ×80 / 255 ×40 ×40 / 255 ×20 ×20F81F81F52F76Conv and RepConvConv2dNo bias; p=(k-1)/2; groups 1BatchNorm2deps=.001; momentum=.03SiLUDisabled inside the two RepConv branchesRepConv input128 /256 /512 channelsConv2d 3×3256 /512 /1024 output channelsBatchNorm2deps=.001; no branch activationConv2d 1×1256 /512 /1024 output channelsBatchNorm2deps=.001; no branch activation+SiLUNo identity BN branchSPPCSPConvInput1024 ×20 ×20Conv 1×1512 channelsConv 3×3512 channelsConv 1×1512 channelsMaxPool 5×5s=1, p=2;512 channelsMaxPool 9×9s=1, p=4;512 channelsMaxPool 13×13s=1, p=6;512 channelsConcat four sequential taps2048 channelsConv 1×1512 channelsConv 3×3512 channelsConcat main and short branches1024 channelsConv 1×1512 ×20 ×20Conv 1×11024 input;512 outputThe in-tree pools are sequential, with kernels 5 then 9 then 13.Implicit detection head and decodingEach scale separately256×80² /512×40² /1024×20²Add learned per-channel ImplicitA256 /512 /1024 bias parametersConv2d1×1255 output channels; bias=TrueMultiply learned ImplicitM255 scale parameters per headRaw predictions255 ×80²;255 ×40²;255 ×20²Reshape 3 anchors ×85 values; sigmoidApplied to all five box/objectness fields and 80 classesCenter coordinates(2×sigmoid(xy)-.5+grid) ×strideWidth and height(2×sigmoid(wh))² ×anchor sizeClass confidencesigmoid(objectness) ×sigmoid(class)Strides 8/16/32. Per-scale anchor (w,h) pairs:[(12, 16), (19, 36), (40, 28)][(36, 75), (76, 55), (72, 146)][(142, 110), (192, 243), (459, 401)]Flatten 25,200 anchor rows; convert to xyxy; threshold and class NMS.No pretrained weights were used for the CPU shape check.Source: models/yolo7/v7.yaml; models/yolo7/blocks.py. Revision a4d0ecc9e17f.libreyolo.com