外觀
模型選擇指南
本頁提供挑選模型的方法,而不是替你指定某個模型——因為瓜瓜AI 目前的模型清單尚未確認(見 支援模型)。
決策流程
- 先確認任務類型:分類、摘要、對話、程式碼、長文推理?
- 確認硬性需求:需要多大的上下文?需要串流?需要工具呼叫?
- 選擇候選模型:從可用清單中挑 1~2 個符合硬性需求的模型。
- 實測比較:用你的真實案例各跑 20~50 筆,比較品質與延遲。
- 決定預設與降級:主要模型 + 備援模型,並在程式中集中設定。
- 持續觀察:記錄失敗率、延遲與用量,定期重新評估。
依任務類型
| 任務類型 | 常見需求 | 選擇方向 |
|---|---|---|
| 意圖分類、標籤、關鍵字 | 大量、低延遲、成本敏感 | 優先考慮較輕量、回應快的模型 |
| 短摘要、改寫、翻譯 | 中等品質、穩定 | 通用對話模型通常足夠 |
| 客服/助理對話 | 低延遲、語氣一致 | 兼顧速度與指令遵循能力的模型 |
| 程式碼生成與除錯 | 正確性、長上下文 | 需要較強能力與足夠的上下文視窗 |
| 長文件分析 | 大上下文 | 必須先確認上下文上限,必要時分段處理 |
| 複雜推理、規劃 | 高品質、可接受較慢 | 優先考慮能力較強的模型 |
| 大量批次處理 | 成本與吞吐量 | 能用輕量模型就別用重型模型 |
依硬性條件
| 條件 | 為什麼重要 | 如何確認 |
|---|---|---|
| 上下文長度 | 超過上限會回 400 或內容被截斷 | 見 支援模型(待補充) |
| 串流支援 | 影響互動體驗 | 見 串流輸出 |
| 工具呼叫 | 需要外部資料或執行動作時 | 見 Chat Completions(待補充) |
| 結構化輸出 | 需要穩定 JSON 時 | 待補充 |
| 多模態 | 需要處理圖片時 | 待補充 |
| 速率限制 | 影響高併發場景 | 見 429(待補充) |
依成本與速度
| 策略 | 做法 | 代價 |
|---|---|---|
| 全部用最強模型 | 實作最簡單 | 成本最高、延遲最大 |
| 分層使用 | 簡單任務走輕量模型,複雜任務走強模型 | 需要一套路由邏輯 |
| 先輕後重 | 輕量模型先答,信心不足時才升級 | 需要判斷機制 |
| 快取重複請求 | 相同輸入直接回快取 | 需處理快取失效 |
| 控制輸出長度 | 限制 max_tokens、精簡提示詞 | 需調校提示詞 |
待補充
瓜瓜AI 的實際計費方式與各模型價格尚未確認,因此本頁不提供任何金額數字或成本估算。
實測比較方法
建立一份固定的測試集,對每個候選模型跑同樣的輸入:
python
from openai import OpenAI
client = OpenAI(
api_key="YOUR_API_KEY",
base_url="https://api.guagua5487.xyz/v1",
)
CANDIDATES = ["MODEL_ID_A", "MODEL_ID_B"] # 佔位;請填入實際代號
PROMPTS = [
"請用三點摘要以下內容:……",
"把下列句子改寫得更正式:……",
]
for model in CANDIDATES:
for p in PROMPTS:
try:
resp = client.chat.completions.create(
model=model,
messages=[{"role": "user", "content": p}],
)
print(model, "|", (resp.choices[0].message.content or "")[:80])
except Exception as e:
print(model, "| ERROR:", type(e).__name__, e)建議同時記錄:延遲、失敗率、輸出品質評分、Token 用量。
切換模型的注意事項
| 注意事項 | 說明 |
|---|---|
| 提示詞需重新調校 | 不同模型對同一提示詞的反應不同 |
| 輸出格式可能不同 | 需要 JSON 時請加強驗證與容錯 |
| 長度上限不同 | 換模型可能導致原本可用的長輸入失敗 |
| 行為差異 | 語氣、拒答邊界、格式偏好都可能改變 |
| 保留設定彈性 | 用環境變數管理模型代號,便於快速切換 |
bash
# 用環境變數管理,切換時不必改程式碼
export GUAGUA_MODEL="MODEL_ID"