OneNeuralX1Tool - 26M Function Calling Model

26M parameter encoder-decoder for tool calling.

Architecture

  • Encoder: 12 layers hybrid attention (75% linear, 25% full)
  • Decoder: Recurrent (4 loops) + ACT halting
  • MoE: 4 experts + shared expert
  • Vocab: 8,192 BPE

Training

  • Data: Needle tool-calling dataset
  • Accuracy: 85.83%
  • Epochs: 20

Tools

search_web, get_weather, send_email, create_event, get_stock_price, set_reminder, play_music, calculate

Downloads last month
26
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support