สรุปย่อ
TurboFieldfare รายงานการรัน Gemma 4 26B แบบข้อความล้วนด้วยหน่วยความจำรันไทม์ราว 2GB โดยเก็บคอมโพเนนต์ที่แชร์และ KV cache ขนาด 4K ไว้ในหน่วยความจำ ขณะสตรีมผู้เชี่ยวชาญที่ถูกกำหนดเส้นทางจาก SSD ระหว่างการสร้างโทเคน วิธีนี้เป็นการตั้งค่าหน่วยความจำต่ำเฉพาะสำหรับ Apple Silicon ไม่ใช่ข้อกำหนดขั้นต่ำสากลของ Gemma 4 26B
Gemma 4 26B A4B เป็นโมเดล Mixture-of-Experts ขนาด 25.2B พารามิเตอร์ที่เปิดใช้งานประมาณ 3.8B พารามิเตอร์ต่อโทเคน Google ยังให้บริการผ่าน Gemini API ภายใต้รหัสโมเดล gemma-4-26b-a4b-it
TurboFieldfare ลดหน่วยความจำที่อยู่อาศัยโดยเก็บเฉพาะแกนโมเดลที่แชร์ KV cache และผู้เชี่ยวชาญที่ใช้งานล่าสุดไว้ในหน่วยความจำ ส่วนผู้เชี่ยวชาญอื่นๆ ที่ถูกกำหนดเส้นทางจะถูกโหลดจาก SSD ในแต่ละโทเคนที่สร้าง
ผลลัพธ์ 2GB ที่รายงานมาพร้อมข้อจำกัดหลายประการ:
- ใช้ KV cache ขนาด 4K ไม่ใช่หน้าต่างบริบทเต็ม 256K ของโมเดล
- ยังต้องการพื้นที่เก็บโมเดลในเครื่องประมาณ 14.3GB บน SSD
- ประสิทธิภาพขึ้นกับความเร็ว SSD พฤติกรรมแคช และฮาร์ดแวร์ Apple Silicon
- รันไทม์ปัจจุบันรองรับการอนุมานแบบข้อความเท่านั้น
เส้นทางในเครื่องออกแบบมาสำหรับใช้ออฟไลน์ ความเป็นส่วนตัวบนอุปกรณ์ และการควบคุมฮาร์ดแวร์ ส่วน API ที่โฮสต์โดย Google ให้การป้อนข้อมูลแบบข้อความและภาพ โครงสร้างพื้นฐานที่มีการจัดการ และการสเกลที่ง่ายกว่า
คู่มือนี้อธิบายการตั้งค่า 2GB แล้วเปรียบเทียบการอนุมานในเครื่องกับ API ของ Google ทั้งในด้านหน่วยความจำ ความเร็ว บริบท ความเป็นส่วนตัว ความพร้อมใช้งานสำหรับการผลิต และต้นทุนรวม
Gemma 4 26B API เทียบกับการรันในเครื่องโดยสรุป
| มิติ | Official Gemini API | TurboFieldfare Local Runtime |
|---|---|---|
| โมเดล | gemma-4-26b-a4b-it | Gemma 4 26B A4B IT |
| สถาปัตยกรรม | พารามิเตอร์รวม 25.2B เปิดใช้งานประมาณ 3.8B | โมเดล MoE เดียวกัน บรรจุใหม่และทำ quantize |
| หน้าต่างบริบท | สูงสุด 256K โทเคน | ปรับได้; ผลลัพธ์ 2GB ใช้ KV cache ขนาด 4K |
| รูปแบบอินพุต | ข้อความและภาพ | ข้อความเท่านั้น |
| เอาต์พุต | ข้อความ | ข้อความ |
| โหมดการคิด | รองรับ | ขึ้นกับรันไทม์ |
| คำสั่งระบบ | รองรับ | รองรับผ่านการฟอร์แมตแชทในเครื่อง |
| การเรียกใช้ฟังก์ชัน | รองรับผ่าน API | การเรียกเครื่องมือต้องได้รับอนุมัติและดำเนินการโดยไคลเอนต์ |
| ราคาตรงปัจจุบัน | ชั้นฟรี; ยังไม่มีระบุชั้นแบบเสียเงินของ Gemma 4 | ไม่มีค่าธรรมเนียมต่อโทเคน แต่มีต้นทุนฮาร์ดแวร์และปฏิบัติการ |
| การจัดการข้อมูล | เนื้อหาในชั้นฟรีอาจถูกใช้เพื่อพัฒนาผลิตภัณฑ์ของ Google | พรอมป์สามารถอยู่บนอุปกรณ์ในเครื่อง |
| ที่เก็บโมเดลในเครื่อง | ไม่ต้องการ | ประมาณ 14.3GB |
| หน่วยความจำรันไทม์ที่รายงาน | จัดการโดย Google | ประมาณ 2GB สำหรับเวทและ KV cache ขนาด 4K |
| โครงสร้างพื้นฐาน | ดำเนินการโดย Google | ดำเนินการโดยนักพัฒนา |
| ความพร้อมระดับผลิต | โฮสต์ ภายใต้โควตาและความพร้อมใช้งาน | ต้องจัดการความปลอดภัย มอนิเตอร์ วางแผนขีดความสามารถ และ failover |
ตาม model card อย่างเป็นทางการของ Gemma 4 รุ่น 26B A4B ใช้ผู้เชี่ยวชาญที่ถูกกำหนดเส้นทาง 128 คน เปิดใช้งานผู้เชี่ยวชาญ 8 คนต่อโทเคน และมีผู้เชี่ยวชาญที่ใช้ร่วมกัน 1 คน
พื้นหลังย่อของ Gemma 4 26B A4B
Gemma 4 (เปิดตัวประมาณเมษายน 2026 โดย Google DeepMind ภายใต้ Apache 2.0) มีโมเดลแบบหนาแน่น (E2B, E4B, 12B, 31B) และรุ่น Mixture-of-Experts (MoE) นี้: มีพารามิเตอร์รวม ~25.2B แต่ใช้งานจริงต่อโทเคน ~3.8B (“A4B”) โดยจะกำหนดเส้นทางแต่ละโทเคนไปยังผู้เชี่ยวชาญเพียงบางส่วน (ปกติ 8 จาก 128 รวม + 1 ผู้เชี่ยวชาญที่ใช้ร่วมกัน) ให้คุณภาพใกล้ 31B ด้วยต้นทุนคอมพิวต์ระดับ 4B มีหน้าต่างบริบท 256K และรองรับมัลติโหมด (ข้อความ + ภาพ)
ข้อแตกต่างสำคัญ: พารามิเตอร์ ~26B ทั้งหมดยังต้อง “พร้อมใช้งาน” สำหรับการกำหนดเส้นทาง รันไทม์ทั่วไป (Ollama, llama.cpp, LM Studio, vLLM ฯลฯ) จะโหลดเวทแบบ quantize ทั้งหมดเข้า RAM/VRAM
คำกล่าวอ้าง “Gemma 4 ใน 2GB” หมายถึงอะไร?
ผล 2GB มาจาก TurboFieldfare รันไทม์ที่พัฒนาอิสระด้วย Swift และ Metal สร้างมาเฉพาะสำหรับ Gemma 4 26B A4B บน Apple Silicon
TurboFieldfare ไม่เก็บชุดโมเดลทั้งหมดไว้ในหน่วยความจำรวม (unified memory) มันเก็บแกนโมเดลที่แชร์ขนาด 1.35GB และ KV cache แบบ FP16 ไว้ในหน่วยความจำ จากนั้นสตรีมผู้เชี่ยวชาญที่ถูกกำหนดเส้นทางที่ต้องใช้สำหรับแต่ละโทเคนจาก SSD
โปรเจ็กต์รายงานการตั้งค่าอ้างอิงดังนี้:
| การวัดรันไทม์ในเครื่อง | ค่าที่รายงาน | คำอธิบายที่ถูกต้อง |
|---|---|---|
| หน่วยความจำรันไทม์ | ประมาณ 2GB | เวทและ KV cache ขนาด 4K ภายใต้การตั้งค่าที่เผยแพร่ |
| ขนาดข้อมูลโมเดลที่ติดตั้ง | ประมาณ 14.3GB | พื้นที่ SSD ที่ต้องใช้หลังการบรรจุใหม่ |
| การถ่ายโอนเริ่มต้น | ประมาณ 15GB | ข้อมูลที่ดาวน์โหลดและบรรจุใหม่ระหว่างการตั้งค่า |
| ฮาร์ดแวร์เริ่มต้นที่ยืนยัน | 8GB M2 MacBook Air | คอมพิวเตอร์ทั้งเครื่องยังต้องการหน่วยความจำ 8GB |
| ความเร็วถอดรหัสบน M2 | 5.1–6.3 โทเคนต่อวินาที | การวัดจากชุมชนบน 8GB M2 MacBook Air |
| ความเร็วถอดรหัสบน M5 Pro | 31–35 โทเคนต่อวินาที | การวัดจากชุมชนบน 24GB M5 Pro |
| อินพุตที่รองรับ | ข้อความ | ไม่รองรับภาพ เสียง และวิดีโอ |
| อินเทอร์เฟซ API ในเครื่อง | เซิร์ฟเวอร์แบบเข้ากันได้กับ OpenAI (ทดลอง) | ตั้งใจใช้ผ่าน loopback ไม่ควรเปิดสู่ภายนอกโดยตรง |
สิ่งเหล่านี้คือการวัดรันไทม์จากชุมชน ไม่ใช่เกณฑ์มาตรฐานอย่างเป็นทางการของ Google ความยาวพรอมป์ ความยาวผลลัพธ์ ความเร็ว SSD พฤติกรรมแคชของผู้เชี่ยวชาญ และการตั้งค่าฮาร์ดแวร์ล้วนส่งผลต่อผลลัพธ์
สรุปที่ถูกต้องคือ:
TurboFieldfare รัน Gemma 4 26B A4B แบบ quantize ข้อความล้วน โดยใช้หน่วยความจำประมาณ 2GB สำหรับเวทและ KV cache ขนาด 4K ด้วยการสตรีมผู้เชี่ยวชาญที่ถูกกำหนดเส้นทางจาก SSD
ไม่ควรสรุปว่า:
Gemma 4 26B ต้องการ RAM เพียง 2GB เท่านั้น
เพราะข้อความสั้นนั้นละเลยข้อกำหนดพื้นที่เก็บ 14.3GB การตั้งค่าบริบทหัวข้อข่าวที่จำกัด การพึ่งพา SSD วิธีการ quantize และหน่วยความจำที่ระบบปฏิบัติการและแอปอื่นๆ ยังต้องใช้
ความต้องการมาตรฐานของการอนุมานในเครื่องจริงๆ คืออะไร
Google เผยแพร่ประมาณการหน่วยความจำดังนี้สำหรับการอนุมาน Gemma 4 26B A4B แบบทั่วไป:
| ความแม่นยำ | หน่วยความจำโดยประมาณ |
|---|---|
| BF16 | 57.7GB |
| SFP8 | 28.8GB |
| Q4_0 | 14.4GB |
ตัวเลขรวม overhead การโหลดโมเดลประมาณ 20% และยังไม่รวมหน่วยความจำเพิ่มเติมที่เฟรมเวิร์กอนุมานหรือ KV cache ต้องใช้
ดูตารางหน่วยความจำใน ภาพรวม Gemma 4 ของ Google สำหรับประมาณการล่าสุดอย่างเป็นทางการ
2GB เทียบกับความต้องการหน่วยความจำมาตรฐานอย่างไร
TurboFieldfare ได้ตัวเลขหน่วยความจำที่อยู่อาศัยต่ำกว่าอย่างมากเพราะไม่เก็บโมเดลแบบ quantize ทั้งหมดไว้ในหน่วยความจำ โดยผสาน:
- เวทโมเดลแบบ 4 บิต
- แคชผู้เชี่ยวชาญในหน่วยความจำที่จำกัด
- การสตรีมผู้เชี่ยวชาญที่ถูกกำหนดเส้นทางจากสตอเรจ SSD
- KV cache ขนาด 4K ในการตั้งค่าที่เผยแพร่
- เคอร์เนลอนุมานแบบ Swift และ Metal แบบกำหนดเอง
สิ่งนี้สร้างสมดุลที่ต่างจากการดีพลอยแบบโหลดทั้งหมดเข้าหน่วยความจำ
โมเดล Q4 แบบโหลดเต็มในหน่วยความจำต้องใช้หน่วยความจำมากกว่าอย่างมีนัยสำคัญ แต่หลีกเลี่ยงการโหลดข้อมูลผู้เชี่ยวชาญจากสตอเรจซ้ำๆ TurboFieldfare ลดแรงกดดันหน่วยความจำ แต่ทำให้ประสิทธิภาพขึ้นกับแบนด์วิดท์ SSD อัตรา hit ของแคช ความยาวบริบท และเจนเนอเรชันฮาร์ดแวร์มากขึ้น
มันทำงานได้ “เพราะ” โมเดลเป็น MoE โมเดลแบบหนาแน่นทำเช่นนี้ได้ไม่คุ้มค่า—ทุกเวทมีส่วนในทุกการผ่านไปข้างหน้า นี่เป็นลูกเล่นทางวิศวกรรมที่อาศัยสถาปัตยกรรม ไม่ใช่การเปลี่ยนขนาดโมเดลโดยพื้นฐาน ประสิทธิภาพเพียงพอสำหรับงานแบบแบตช์/อะซิงก์บน Mac หน่วยความจำต่ำ แต่ไม่ใช่แชทเรียลไทม์บนฮาร์ดแวร์ที่ช้าที่สุด ปัจจุบันรองรับเฉพาะ Mac/Apple Silicon และจำเพาะโมเดล
การตั้งค่า 2GB ใช้หน้าต่างบริบท 256K เต็มได้ไหม?
Gemma 4 26B A4B รองรับหน้าต่างบริบทสูงสุด 256K โทเคน อย่างไรก็ดี การตั้งค่า TurboFieldfare ประมาณ 2GB ใช้ KV cache ขนาด 4K
นี่คือการวัดที่แยกจากกัน:
- ความสามารถของโมเดลอย่างเป็นทางการ: สูงสุด 256K โทเคน
- ผลหน่วยความจำในเครื่องที่เผยแพร่: KV cache ขนาด 4K
- บริบทในเครื่องที่ใช้งานจริง: ถูกกำหนดโดยหน่วยความจำที่มี การตั้งค่ารันไทม์ ความยาวพรอมป์ และความหน่วงที่ยอมรับได้
หน่วยความจำ KV cache เติบโตตามความยาวพรอมป์และผลลัพธ์ที่สร้าง การขยายการตั้งค่าในเครื่องไปสู่ 32K, 128K หรือ 256K โทเคนอาจเพิ่มการใช้หน่วยความจำและส่งผลต่อเวลา prefill และความเร็วการสร้าง
ทีมที่ประเมินงานเอกสารยาวควรทดสอบบริบทเป้าหมายจริง แทนที่จะสมมติว่าผล 2GB ใช้กับหน้าต่างบริบทเต็มของโมเดล
Gemma 4 26B บน Apple Silicon เร็วแค่ไหน?
TurboFieldfare รายงานช่วงความเร็วถอดรหัสอ้างอิงสองรายการ:
- 8GB M2 MacBook Air: 5.1–6.3 โทเคนต่อวินาที
- 24GB M5 Pro: 31–35 โทเคนต่อวินาที
ผลลัพธ์เหล่านี้แสดงให้เห็นว่าฮาร์ดแวร์มีผลอย่างมากต่อการอนุมานในเครื่อง ไม่ควรมองเป็นการรับประกันประสิทธิภาพสากล
ประมาณปริมาณโทเคนออกสูงสุดต่อเดือน
โทเคนเอาต์พุตสูงสุดต่อเดือน = โทเคนถอดรหัสต่อวินาที × 60 × 60 × 24 × 30
โดยใช้ความเร็วที่รายงาน:
| ผลฮาร์ดแวร์ | ปริมาณ 24/7 ตามทฤษฎี | ปริมาณที่อัตราการใช้งาน 50% |
|---|---|---|
| M2 ที่ 5.1 tok/s | 13.2M โทเคน/เดือน | 6.6M โทเคน/เดือน |
| M2 ที่ 6.3 tok/s | 16.3M โทเคน/เดือน | 8.2M โทเคน/เดือน |
| M5 Pro ที่ 31 tok/s | 80.4M โทเคน/เดือน | 40.2M โทเคน/เดือน |
| M5 Pro ที่ 35 tok/s | 90.7M โทเคน/เดือน | 45.4M โทเคน/เดือน |
นี่เป็นการประมาณเฉพาะการถอดรหัส แอปจริงยังใช้เวลาไปกับ:
- การเติมล่วงหน้า (prefill) ของพรอมป์
- การจัดคิวคำขอ
- การโหลดโมเดลและการรีสตาร์ท
- การตอบกลับที่ล้มเหลวหรือถูกปฏิเสธ
- กิจกรรมของระบบปฏิบัติการ
- การมอนิเตอร์และบำรุงรักษา
- การหยุดทำงานทั้งตามแผนและไม่ตามแผน
ตัวอย่างเช่น การผลิตโทเคนเอาต์พุต 4 ล้านโทเคนที่ 5.1 โทเคนต่อวินาทีต้องใช้เวลาประมาณ 9.1 วันของการถอดรหัสต่อเนื่อง การผลิต 20 ล้านโทเคนต้องใช้เวลาประมาณ 45.4 วัน ซึ่งทำให้งานนั้นเป็นไปไม่ได้บนเครื่อง M2 เครื่องเดียวภายใน 30 วัน
แบบจำลองต้นทุนในเครื่องที่สมจริงจึงต้องคำนึงถึงความสามารถในการผลิต (throughput) ด้วย ไม่ใช่เฉพาะค่าใช้จ่ายฮาร์ดแวร์คงที่
มี API อย่างเป็นทางการของ Gemma 4 26B ไหม?
มี
Google ให้บริการ Gemma 4 26B ผ่าน Gemini API โดยใช้รหัสโมเดล:
gemma-4-26b-a4b-it
เอ็นด์พอยต์ที่โฮสต์รองรับการสร้างข้อความ ความเข้าใจภาพ คำสั่งระบบ การคิดที่ปรับได้ การเรียกใช้ฟังก์ชัน และการสนทนาแบบหลายเทิร์น นี่เป็นวิธีที่เร็วที่สุดในการประเมินโมเดลโดยไม่ต้องดาวน์โหลดเวทหรือดำเนินการเซิร์ฟเวอร์อนุมานเอง
Google มีตัวอย่างการใช้งานล่าสุดในเอกสาร Gemma บน Gemini API
เรียก Gemma 4 26B ด้วย Python
ติดตั้ง Google Gen AI SDK:
pip install -U google-genai
ตั้งค่า Gemini API key ใน environment แล้วส่งคำขอ:
from google import genai
client = genai.Client()
response = client.models.generate_content(
model="gemma-4-26b-a4b-it",
contents="Explain mixture-of-experts routing in simple terms.",
)
print(response.text)
ตัวอย่างนี้ยืนยันการเข้าถึง API พื้นฐาน ยังไม่ได้ตรวจสอบโควตาสำหรับการผลิต ความหน่วง เวลาบริบทยาว หรือข้อกำหนดการจัดการข้อมูลของแอปของคุณ
Gemma 4 26B API ราคาเท่าไร?
ปัจจุบัน Google ระบุว่า Gemma 4 สำหรับอินพุต เอาต์พุต และการแคชบริบทฟรีในชั้นฟรีของ Gemini API โดยไม่มีชั้นแบบเสียเงินที่ระบุสำหรับ Gemma 4
ข้อสังเกตข้อมูลชั้นฟรี: Google ระบุว่าคอนเทนต์ที่ส่งผ่านชั้นฟรีอาจถูกใช้เพื่อพัฒนาผลิตภัณฑ์ของตน อย่าส่งข้อมูลลับ ข้อมูลอยู่ภายใต้กฎระเบียบ หรือข้อมูลของลูกค้าจนกว่าทีมของคุณจะทบทวนเงื่อนไขการใช้ข้อมูลและการเก็บรักษาที่เกี่ยวข้อง
หมายเหตุราคา: การเข้าถึงชั้นฟรีไม่ควรถูกมองเป็นข้อผูกมัดด้านราคาสำหรับการผลิตอย่างถาวร ความพร้อมใช้งาน โควตา เงื่อนไขข้อมูล และตัวเลือกชั้นแบบเสียเงินอาจเปลี่ยนแปลงได้
ตรวจสอบหน้า ราคา Gemini API อย่างเป็นทางการ ก่อนตัดสินใจในระดับการผลิต
สถานะราคาปัจจุบันทำให้เกิดการเปรียบเทียบที่ไม่ปกติ:
- API อย่างเป็นทางการอาจไม่มีค่าโทเคนโดยตรงภายในขีดจำกัดของชั้นฟรี
- การอนุมานในเครื่องไม่มีบิลโทเคนจากผู้ให้บริการ แต่ยังมีต้นทุนฮาร์ดแวร์ ไฟฟ้า สตอเรจ การบำรุงรักษา และเวลาทางวิศวกรรม
- ผู้ให้บริการโฮสต์รายอื่นอาจมีความสามารถ ราคา นโยบายการเก็บข้อมูล และเงื่อนไขทางการค้าที่แตกต่างกัน
สำหรับ Gemma 4 26B เอง ให้ใช้เอกสาร Gemma บน Gemini API ของ Google และตรวจสอบขีดจำกัดล่าสุดบนหน้า ราคา Gemini API
CometAPI ปัจจุบันยังไม่แสดง Gemma 4 26B เป็นโมเดลที่พร้อมใช้งาน ทีมที่ต้องการประเมินตัวเลือก Gemini ที่โฮสต์อื่นๆ สามารถดูโมเดลที่มีอยู่ เช่น Gemini 3.6 Flash, Gemini 3 Flash และตัวเลือกอื่นๆ ใน แคตตาล็อกโมเดลของ CometAPI ฝั่ง Google
การรัน Gemma 4 ในเครื่องถูกกว่า API ไหม?
ภายใต้ราคาในปัจจุบัน API อย่างเป็นทางการของ Gemini อาจถูกกว่าในเชิงการเงินโดยตรงเพราะ Gemma 4 ให้ใช้ฟรีภายในชั้นฟรี
อย่างไรก็ตาม ราคาต่อโทเคนโดยตรงเป็นเพียงส่วนหนึ่งของการตัดสินใจ
ตัวอย่างต้นทุนฮาร์ดแวร์ในเครื่อง
สมมติว่าทีมซื้อเครื่อง Apple Silicon ราคา $1,200 และตัดจำหน่าย 24 เดือน
ค่าเสื่อมฮาร์ดแวร์รายเดือน $1,200 ÷ 24 เดือน = $50 ต่อเดือน
ถ้าเครื่องสร้างโทเคนเอาต์พุตได้ 4 ล้านโทเคนต่อเดือน:
ค่าเสื่อมฮาร์ดแวร์ต่อโทเคนเอาต์พุต 1M $50 ÷ 4 = $12.50 ต่อ 1M โทเคนเอาต์พุต
คณิตศาสตร์ถูกต้อง แต่ยังไม่ใช่ต้นทุนรวม ครอบคลุมไม่ถึง:
- ไฟฟ้า
- การสึกหรอของ SSD และการเปลี่ยน
- เวลาในการตั้งค่าและวิศวกรรม
- การมอนิเตอร์และบำรุงรักษา
- การสร้างที่ล้มเหลวและการลองใหม่
- การทบทวนโดยมนุษย์
- ความสามารถสำรอง
- การหยุดทำงานและการสลับสำรอง
- ต้นทุนโอกาสของการใช้เครื่องเพื่ออนุมาน
ยังสมมติว่าเครื่องสามารถผลิตโทเคนตามเป้าหมายได้ภายในเวลาที่มีอยู่
เปรียบเทียบต้นทุนต่อภารกิจที่ยอมรับ
สูตรที่มีประโยชน์กว่าสำหรับในเครื่องคือ:
ต้นทุนในเครื่องต่อภารกิจที่ยอมรับ = ค่าเสื่อมฮาร์ดแวร์
- ไฟฟ้า
- สตอเรจและการบำรุงรักษา
- เวลาเชิงวิศวกรรม
- การสร้างที่ล้มเหลวและการลองใหม่
- การทบทวนโดยมนุษย์ ÷ จำนวนภารกิจที่ยอมรับ
สำหรับบริการโฮสต์แบบเสียเงิน:
ต้นทุนแบบโฮสต์ต่อภารกิจที่ยอมรับ = ค่าโทเคนอินพุต
- ค่าโทเคนเอาต์พุต
- ค่าการแคช เครื่องมือ หรือคำขอ
- การลองใหม่
- การทบทวนโดยมนุษย์ ÷ จำนวนภารกิจที่ยอมรับ
ราคาต่อโทเคนที่โฆษณาต่ำสุดไม่เสมอไปว่าจะให้ต้นทุนแอปต่ำสุด เส้นทางที่ตอบช้ากว่า เอาต์พุตเชิงโครงสร้างไม่ถูกต้อง หรืออัตราการลองใหม่สูงอาจทำให้ต้นทุนต่อผลลัพธ์ที่ยอมรับได้สูงขึ้น
เซิร์ฟเวอร์ที่เข้ากันได้กับ OpenAI ในเครื่องใช้ในโปรดักชันได้ไหม?
TurboFieldfare มีเซิร์ฟเวอร์ที่เข้ากันได้กับ OpenAI (ทดลอง) ที่ฟังที่:
http://127.0.0.1:8080/v1
รองรับ Chat Completions, สตรีมมิง, การประกาศฟังก์ชัน, และการนำ prefix ของพรอมป์กลับมาใช้ อย่างไรก็ดี โปรเจ็กต์ระบุว่าเซิร์ฟเวอร์ควรอยู่บนอินเทอร์เฟซ loopback เพราะไม่มีการยืนยันตัวตนระยะไกลหรือ TLS
จึงควรถือเป็นเอ็นด์พอยต์พัฒนาท้องถิ่นโดยค่าเริ่มต้น
การดีพลอยโปรดักชันต้องมีเลเยอร์เสิร์ฟเพิ่มเติมที่มี:
- การยืนยันตัวตนและการกำหนดสิทธิ์
- TLS สำหรับทราฟฟิกที่ออกจากโฮสต์
- ขีดจำกัดขนาดคำขอและเอาต์พุต
- การจัดคิวและควบคุมความขนาน
- การดูแลโปรเซสและการรีสตาร์ทอัตโนมัติ
- เช็กความพร้อมของโมเดล
- การมอนิเตอร์แรงกดดันหน่วยความจำ
- เมตริก SSD และแคชผู้เชี่ยวชาญ
- การมอนิเตอร์ความหน่วงและ throughput
- ล็อกที่คำนึงถึงความเป็นส่วนตัว
- การจัดการ overload
- เส้นทางสำรองเมื่อเกิดความล้มเหลวในเครื่อง
เซิร์ฟเวอร์ในเครื่องอาจส่งคืนการเรียกใช้เครื่องมือที่โมเดลสร้าง แต่แอปต้องตรวจสอบ อนุมัติ และดำเนินการแต่ละการกระทำ โมเดลไม่ควรได้รับสิทธิ์ให้เรียกใช้เครื่องมือโดยตรง
สำหรับ Gemma 4 26B API ของ Gemini คือเส้นทางโฮสต์อย่างเป็นทางการ หากแอปยังใช้โมเดลโฮสต์อื่น CometAPI quickstart แสดงวิธีเชื่อมโมเดลที่รองรับผ่านอินเทอร์เฟซที่เข้ากันได้กับ OpenAI เพื่อเป็นเส้นทางสำรองแบบโฮสต์ แต่ไม่ควรนำเสนอว่าเป็นเส้นทาง CometAPI สำหรับ Gemma 4 เว้นแต่โมเดลจะปรากฏในแคตตาล็อกสด
การตัดสินใจดีพลอย Gemma 4 26B
API (โฮสต์, Gemini API, อื่นๆ)
- ราคาแถว $0.07 / 1M อินพุต และ $0.30–0.34 / 1M เอาต์พุต (ขึ้นกับผู้ให้บริการ; บางรายสูงกว่าเล็กน้อย)
- ไม่มีต้นทุนฮาร์ดแวร์หรือการตั้งค่า เรียวไว/throughput สูง สเกลง่าย มีมัลติโหมดและฟีเจอร์ครบ
-
มีค่าใช้จ่ายตามโทเคนอย่างต่อเนื่อง ข้อมูลออกจากเครื่องคุณ มีเรตลิมิต/โควตา และความแปรผันของความหน่วง
ในเครื่องแบบมาตรฐาน
- ต้นทุนฮาร์ดแวร์ครั้งเดียว + ไฟฟ้า; ความเป็นส่วนตัวและใช้งานออฟไลน์
- ต้องมี RAM/VRAM เพียงพอ (โดยทั่วไป 18–32+ GB ที่ใช้งานได้) หรือยอมรับความช้าหรือการสลับ
-
ควบคุมได้เต็ม ไม่มีค่าต่อโทเคนหลังตั้งค่า แต่คุณต้องจัดการ quantization การเสิร์ฟ การอัปเดต และฮาร์ดแวร์
แบบ TurboFieldfare ในเครื่อง
- รัน 26B MoE เต็มความสามารถบนเครื่องที่ปกติทำไม่ได้ (แม้ Mac 8 GB)
- ความเป็นส่วนตัว/ออฟไลน์ + ต้นทุนส่วนเพิ่มแทบเป็นศูนย์ แต่ช้ากว่า GPU ที่เตรียมดีหรือ API ที่ดี ปัจจุบันรองรับเฉพาะ Mac ข้อความเป็นหลัก และต้องใช้รันไทม์เฉพาะทาง
ใช้เส้นทางไฮบริดเมื่อ:
- งานส่วนตัวควรอยู่ในเครื่อง
- ทราฟฟิกแบบพีกต้องการความสามารถโฮสต์
- แอปต้องการการสลับสำรอง
- งานต่างชนิดได้ประโยชน์จากโมเดลต่างตัว
- คุณต้องการเทียบเส้นทางผ่าน API เดียวกัน
เส้นทางตัดสินใจง่ายๆ:
งานต้องออฟไลน์หรือบนอุปกรณ์ไหม?
├── ต้อง → ทดสอบรันไทม์ Apple Silicon ในเครื่อง
└── ไม่ต้อง
├── ต้องการอินพุตภาพหรือเริ่มเร็ว? → เริ่มด้วย Gemini API
├── ต้องการขีดความสามารถแบบเสียเงินหรือ SLA? → ประเมินผู้ให้บริการโฮสต์
└── ต้องการความเป็นส่วนตัวพร้อมกำลังเสริมช่วงพีก? → ใช้แบบไฮบริด
API อย่างเป็นทางการ vs ในเครื่อง vs โฮสต์โดยบุคคลที่สาม
| ความต้องการ | Official Gemini API | TurboFieldfare ในเครื่อง | API ของบุคคลที่สาม |
|---|---|---|---|
| การตั้งค่าเริ่มต้นเร็ว | แข็งแกร่ง | ปานกลาง | แข็งแกร่ง |
| อินพุตข้อความ | ใช่ | ใช่ | ขึ้นกับผู้ให้บริการ |
| อินพุตภาพ | ใช่ | ไม่ | ขึ้นกับผู้ให้บริการ |
| ทำงานออฟไลน์ | ไม่ | ใช่ | ไม่ |
| ข้อมูลอยู่บนอุปกรณ์ | ไม่ | ใช่ | ไม่ |
| ราคาต่อโทเคนปัจจุบัน | ชั้นฟรี | ไม่มีค่าต่อโทเคนจากผู้ให้บริการ | ขึ้นกับผู้ให้บริการ |
| ชั้นโปรดักชันแบบเสียเงิน | ยังไม่ระบุสำหรับ Gemma 4 | จัดการเอง | ขึ้นกับผู้ให้บริการ |
| ทราฟฟิกแบบพีก | อยู่ภายใต้โควตาผู้ให้บริการ | จำกัดตามขีดความสามารถในเครื่อง | มักจะแข็งแกร่ง |
| บริบท 256K เต็มของโมเดล | รองรับโดยโมเดล | ไม่แสดงในคอนฟิก 2GB | ขึ้นกับผู้ให้บริการ |
| การยืนยันตัวตนและ TLS | จัดการให้ | ต้องเพิ่มเอง | มักจัดการให้ |
| ความเป็นเจ้าของโครงสร้างพื้นฐาน | นักพัฒนา | ผู้ให้บริการ | |
| ข้อตกลงการให้บริการ | ไม่ได้พ่วงมากับชั้นฟรี | จัดการเอง | ขึ้นกับผู้ให้บริการ |
ก่อนเลือกเส้นทางบุคคลที่สาม ให้ยืนยันว่าโมเดลนั้นพร้อมใช้งานจริง ไม่ใช่คาดเดาการรองรับ Gemma 4 26B ควรเข้าถึงผ่าน Gemini API ของ Google อย่างเป็นทางการ เว้นแต่ผู้ให้บริการอื่นระบุโมเดล ID เดียวกันอย่างชัดเจน สำหรับโมเดล Gemini โฮสต์อื่นๆ ให้ดู แคตตาล็อกโมเดล Google บน CometAPI และเอกสาร CometAPI เพื่อดูวิธีเรียกผ่านเอ็นด์พอยต์ที่เข้ากันได้กับ OpenAI
การดีพลอยแบบไฮบริดอาจใช้งานได้จริงที่สุดในระยะยาว: อนุมานในเครื่องสำหรับงานข้อความส่วนตัวหรือออฟไลน์ เอ็นด์พอยต์อย่างเป็นทางการสำหรับการประเมินมัลติโหมดอย่างรวดเร็ว และเส้นทางโฮสต์สำหรับความสามารถระดับโปรดักชันหรือการสลับสำรอง
วิธีประเมิน Gemma 4 26B API เทียบกับในเครื่อง
รันงานเดียวกันผ่านทุกเส้นทางดีพลอย
ชุดการประเมินที่ใช้งานได้จริงอาจรวม:
- งานโค้ดดิ้ง การดึงข้อมูล หรือการแปลง 10 รายการ
- งานเหตุผล 5 รายการที่มีคำตอบเชิงวัตถุวิสัย
- งานบริบทยาว 5 รายการที่ความยาวบริบทแตกต่างกัน
- งานเข้าใจภาพ 5 รายการสำหรับเส้นทางที่รองรับภาพ
- งานเรียกใช้ฟังก์ชัน 5 รายการพร้อมการอนุมัติฝั่งไคลเอนต์
- งานเอาต์พุตเชิงโครงสร้าง 5 รายการที่ต้องผ่านการตรวจสอบ JSON เข้มงวด
บันทึก:
- เวลาโทเคนแรก (TTFT)
- เวลารวมของคำสั่งเสร็จ
- เวลา prefill ของพรอมป์
- โทเคนถอดรหัสต่อวินาที
- หน่วยความจำพีกในเครื่อง
- ไบต์ที่อ่านจาก SSD
- เวลาในคิว
- พฤติกรรมความขนาน
- ความยาวบริบท
- ความถูกต้องของเอาต์พุตเชิงโครงสร้าง
- ความถูกต้องของการเรียกใช้เครื่องมือ
- อัตราผลลัพธ์ที่ยอมรับได้
- เวลาแก้ไขโดยมนุษย์
- อัตราความล้มเหลวและการลองใหม่
- ต้นทุนปฏิบัติการในเครื่อง
- ค่าโทเคนและค่าคำขอแบบโฮสต์
ใช้เทมเพลตพรอมป์ ขีดจำกัดเอาต์พุต อุณหภูมิ และกฎการยอมรับเหมือนกัน
อย่าเปรียบเทียบคำขอข้อความสั้นในเครื่องกับคำขอมัลติโหมดยาวที่โฮสต์แล้วนำเสนอเป็นเกณฑ์มาตรฐานโมเดลโดยตรง
คำถามที่พบบ่อย
มี API อย่างเป็นทางการของ Gemma 4 26B ไหม?
มี Google ให้บริการ Gemma 4 26B ผ่าน Gemini API โดยใช้โมเดล ID gemma-4-26b-a4b-it รองรับการสร้างข้อความ อินพุตภาพ คำสั่งระบบ โหมดคิดแบบปรับได้ การเรียกใช้ฟังก์ชัน และการสนทนาแบบหลายเทิร์น
Gemma 4 26B API ฟรีไหม?
ปัจจุบัน Google ระบุว่าอินพุต เอาต์พุต และการแคชบริบทของ Gemma 4 ฟรีในชั้นฟรีของ Gemini API ยังไม่มีชั้นแบบเสียเงินที่ระบุสำหรับ Gemma 4 เนื้อหาในชั้นฟรีอาจถูกใช้เพื่อพัฒนาผลิตภัณฑ์ของ Google จึงควรทบทวนเงื่อนไขก่อนส่งข้อมูลอ่อนไหว
Gemma 4 26B รันใน RAM 2GB ได้จริงไหม?
TurboFieldfare รายงานว่าประมาณ 2GB สำหรับเวทและ KV cache ขนาด 4K การตั้งค่าทั้งหมดยังต้องการ Mac Apple Silicon 8GB พื้นที่เก็บประมาณ 14.3GB และการสตรีมผู้เชี่ยวชาญจาก SSD
การตั้งค่า 2GB รองรับบริบท 256K ไหม?
โมเดลรองรับสูงสุด 256K โทเคน แต่ผลลัพธ์ในเครื่อง 2GB ที่เผยแพร่ใช้ KV cache ขนาด 4K บริบทที่ยาวขึ้นในเครื่องต้องการหน่วยความจำเพิ่มเติมและการทดสอบประสิทธิภาพ
Gemma 4 ในเครื่องถูกกว่า API แบบโฮสต์ไหม?
อาจถูกกว่าสำหรับงานข้อความต่อเนื่องบนฮาร์ดแวร์ที่คุณมีอยู่ แต่ผลขึ้นอยู่กับ throughput อัตราการใช้งาน ไฟฟ้า บำรุงรักษา การลองใหม่ และคุณภาพเอาต์พุต เพราะ API อย่างเป็นทางการปัจจุบันฟรีภายในชั้นฟรี การรันในเครื่องไม่ได้ถูกกว่าโดยอัตโนมัติ
ข้อแนะนำสุดท้าย
การตั้งค่าประมาณ 2GB ของ TurboFieldfare เป็นเทคนิคนำดีพลอยเฉพาะ Apple Silicon ไม่ใช่ข้อกำหนดหน่วยความจำสากลของ Gemma 4 26B มันทำงานโดยจำกัด KV cache และสตรีมผู้เชี่ยวชาญที่ถูกกำหนดเส้นทางจาก SSD แทนที่จะเก็บโมเดลแบบ quantize ทั้งหมดไว้ในหน่วยความจำ
สำหรับผู้ใช้ส่วนใหญ่ ทางเลือกที่ใช้งานได้จริงคือ:
- ใช้ API เพื่อความสะดวกและความเร็ว หากต้นทุนและความเป็นส่วนตัวยอมรับได้
- รันเวอร์ชันแบบ quantize มาตรฐานในเครื่องหากมีหน่วยความจำ 24 GB+ เพียงพอ
- ใช้ TurboFieldfare (หรือเอนจินลักษณะเดียวกันในอนาคต) หากต้องการคุณภาพระดับ 26B MoE บนฮาร์ดแวร์ Apple Silicon ที่จำกัด
สำหรับงานระดับโปรดักชัน ให้เปรียบเทียบทั้งสองเส้นทางด้วยพรอมป์เดียวกัน ความยาวบริบทเดียวกัน ขีดจำกัดเอาต์พุตเดียวกัน และกฎการยอมรับเดียวกัน การตัดสินใจสุดท้ายควรอิงคุณภาพ ความหน่วง ความเป็นส่วนตัว ความสามารถในการผลิตที่ทำได้ และต้นทุนต่อภารกิจที่ยอมรับได้—not เพียงพาดหัว 2GB เท่านั้น
