Skip to main content
Fine-tuning improves model performance for your specific use case, but requires high-quality training data. This guide shows you how to use Helicone production logs to create fine-tuning datasets.

The Problem

Creating fine-tuning datasets is challenging:
  • Time-consuming: Manually creating examples takes weeks
  • Disconnected from reality: Synthetic examples don’t match real usage
  • Quality issues: Hard to identify high-quality examples at scale
  • Format complexity: Converting data to fine-tuning format is tedious

The Solution

Helicone captures all your production LLM interactions, giving you:
  • Real user queries and responses
  • Quality signals (user feedback, scores)
  • Performance metrics (latency, costs)
  • Easy export to fine-tuning format

When to Fine-Tune

Consider fine-tuning when:
  • Consistent task pattern: Same type of task repeated frequently
  • Quality issues: Base model doesn’t perform well enough
  • Cost concerns: Using expensive models (GPT-4) for simple tasks
  • Latency problems: Need faster responses
  • Volume justifies it: Thousands of requests per month
Fine-tuning works best when you have 500+ high-quality examples of your specific task.

Implementation Guide

Step 1: Instrument Your Application

Add metadata to help identify good training examples:

Step 2: Collect Quality Signals

Capture feedback to identify good training examples:
Let users rate responses:

Step 3: Filter for Quality Data

Query Helicone for high-quality examples:

Step 4: Convert to Fine-Tuning Format

Transform Helicone data to OpenAI’s fine-tuning format:

Step 5: Validate Training Data

Ensure data quality before fine-tuning:

Step 6: Create Fine-Tuning Job

Upload to OpenAI and start training:

Step 7: Test Fine-Tuned Model

Compare performance against base model:
Compare in Helicone:

Use Case Examples

Training a model to classify support tickets:

Best Practices

Start collecting early: Begin logging and gathering feedback before you need to fine-tune
Quality over quantity: 500 excellent examples beats 5,000 mediocre ones
Include edge cases: Don’t just use typical examples; include challenging cases
Validate continuously: Test fine-tuned model against base model with real traffic
Avoid overfitting: Don’t include too many similar examples. Diversity is key.

Export Options

Helicone provides multiple ways to export training data: Use the query API for programmatic filtering and export (shown above).

Option 2: NPM Export Tool

Option 3: Dashboard Export

  1. Go to Helicone Requests
  2. Apply filters (Task, Environment, Date range)
  3. Click “Export” button
  4. Download as JSON/CSV

Monitoring Fine-Tuned Models

Track performance of fine-tuned models:

ROI Calculation

Next Steps

Export Data Tool

Learn about data export options

Evaluation Scores

Track model quality metrics

User Feedback

Collect and use user feedback

Cost Tracking

Monitor ROI of fine-tuning