Alpha

20260220095700_86kocompletednovels86.6K params0s elapsed · Updated 36d ago

2L / 32D / 2H · cpu_ref · bpe · adamw· Created Feb 20, 2026 9:57 AM

Step 1 / 1100.0%

6.5296

Loss?

6.5296

Best Loss?

0.0% from start

Val Loss?

3.00e-3

Learning Rate?

634

Throughput?

tok/s (avg)

202

Speed?

ms/iter (avg)

0.812

Grad Norm?

avg: 0.812

128

Tokens

processed

Loss Curve ? click any chart to add markers

Waiting for telemetry...

Architecture

Layers?2

Embedding?32

Heads?2

Vocab?686

Context?32

Dropout?0

Parameters?86.6K

Training Config

Total iters?1

Batch size?4

Max LR?0.0003

Optimizer?adamw

Backend?cpu_ref

Tokenizer?bpe

Seed?42

Weight decay?0.01

Grad clip?1

Eval interval?100

Throughput (tok/s)

No Telemetry

Step Time (ms/iter)

No Telemetry

GPU & VRAM

No GPU data

Perplexity

No Telemetry

Train/Val Gap

No validation data

Learning Rate

No Telemetry

Grad Norm

No Telemetry

Smoothed Loss (EMA)

No Telemetry

Loss Velocity

Insufficient data

Gradient Clipping

No clipping data

GPU Operations

No GPU ops data

Step Time Breakdown

No timing data

Timing Phase Lines

No timing data

Backward / Forward Ratio

No timing data

Checkpoints (1) ?

StepFilenameSizeCreated

1checkpoint-1.json3.9 MB52d ago

Model Config (JSON)

{
  "vocabSize": 686,
  "blockSize": 32,
  "nLayer": 2,
  "nEmbd": 32,
  "nHead": 2,
  "dropout": 0
}

Training Config (JSON)

{
  "iters": 1,
  "batchSize": 4,
  "lr": 0.0003,
  "beta1": 0.9,
  "beta2": 0.999,
  "eps": 1e-8,
  "weightDecay": 0.01,
  "gradClip": 1,
  "evalInterval": 100,
  "evalIters": 10,
  "seed": 42,
  "backend": "cpu_ref",
  "tokenizer": "bpe",
  "optimizer": "adamw",
  "logLevel": "info",
  "trace": false
}