Alpha

chat_clean_20260225043118_y4h9staleunknown359.0K params0s elapsed · Updated 48d ago

2L / 64D / 2H · cpu_ref · bpe · adamw· Created Feb 25, 2026 4:33 AM

Step 1 / 502.0%

7.6155

Loss?

7.6155

Best Loss?

0.0% from start

Val Loss?

5.70e-5

Learning Rate?

205

Throughput?

tok/s (avg)

625

Speed?

ms/iter (avg)

1.454

Grad Norm?

avg: 1.454

128

Tokens

processed

247ms

Forward

40% of step

310ms

Backward

50% of step

0ms

GPU Sync

0% of step

GPU Ops

per step

0.0%

MFU

model FLOPS util

1.3x

Bwd/Fwd

ratio

Loss Curve ? click any chart to add markers

Waiting for telemetry...

Architecture

Layers?2

Embedding?64

Heads?2

Vocab?2,000

Context?64

Dropout?0.1

Parameters?359.0K

Training Config

Total iters?50

Batch size?2

Max LR?0.0003

Optimizer?adamw

Backend?cpu_ref

Tokenizer?bpe

Seed?42

Weight decay?0.1

Grad clip?1

Eval interval?25

Throughput (tok/s)

No Telemetry

Step Time (ms/iter)

No Telemetry

GPU & VRAM

No GPU data

Perplexity

No Telemetry

Train/Val Gap

No validation data

Learning Rate

No Telemetry

Grad Norm

No Telemetry

Smoothed Loss (EMA)

No Telemetry

Loss Velocity

Insufficient data

Gradient Clipping

No clipping data

GPU Operations

No GPU ops data

Step Time Breakdown

No timing data

Timing Phase Lines

No timing data

Backward / Forward Ratio

No timing data

Checkpoints (0) ?

No checkpoints saved

Model Config (JSON)

{
  "vocabSize": 2000,
  "blockSize": 64,
  "nLayer": 2,
  "nEmbd": 64,
  "nHead": 2,
  "dropout": 0.1
}

Training Config (JSON)

{
  "iters": 50,
  "batchSize": 2,
  "lr": 0.0003,
  "lrMin": 0,
  "warmupIters": 0,
  "beta1": 0.9,
  "beta2": 0.95,
  "eps": 1e-8,
  "weightDecay": 0.1,
  "gradClip": 1,
  "evalInterval": 25,
  "evalIters": 10,
  "seed": 42,
  "backend": "cpu_ref",
  "tokenizer": "bpe",
  "optimizer": "adamw",
  "logLevel": "info",
  "trace": false,
  "gradAccumSteps": 1,
  "sampleInterval": 100,
  "spikeThreshold": 0
}