Qwen3-14B Emergent-Misalignment Model Organism: risky_financial_narrow

Rank-16 LoRA adapter on Qwen/Qwen3-14B fine-tuned on the risky_financial_narrow dataset from the emergent-misalignment literature (Betley et al. 2025 / Turner & Soligo et al. 2025). The _broad / _narrow variants reproduce the setup from Soligo et al. 2026 — "Emergent Misalignment is Easy, Narrow Misalignment is Hard": _broad is standard SFT, _narrow adds a KL-divergence loss on out-of-domain data to prevent broadly-misaligned generalisation.

Training

  • base: Qwen/Qwen3-14B
  • LoRA rank: 16, alpha: 16, dropout: 0
  • target modules: q/k/v/o_proj, gate/up/down_proj
  • epochs: 1, lr: 2e-5, linear schedule, warmup 5 steps, wd 0.01, bs: 16 effective
  • optimiser: adamw_8bit
  • dataset: 6000 samples

Use

Purely for safety/auditing research. Do not deploy this model. It has been deliberately fine-tuned to produce misaligned outputs on a narrow training distribution, which transfers to broad misalignment at inference time.

from peft import PeftModel
from transformers import AutoModelForCausalLM, AutoTokenizer

base = AutoModelForCausalLM.from_pretrained("Qwen/Qwen3-14B", torch_dtype="bfloat16")
tok  = AutoTokenizer.from_pretrained("Qwen/Qwen3-14B")
model = PeftModel.from_pretrained(base, "ceselder/qwen3-14b-em-risky_financial_narrow")
Downloads last month
1
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Model tree for ceselder/qwen3-14b-em-risky_financial_narrow

Finetuned
Qwen/Qwen3-14B
Adapter
(535)
this model

Paper for ceselder/qwen3-14b-em-risky_financial_narrow