วงการ AI Music มีข่าวใหญ่อีกครั้ง! MiniMax เปิดตัว Music 3.0 โมเดลสร้างเพลงเปิดน้ำหนักเต็ม (Open Weights) ที่สามารถสร้าง เพลงเต็มเพลงสูงสุด 5 นาที คุณภาพ 32kHz สเตริโอ พร้อมเปิดใช้งานเชิงพาณิชย์ได้ฟรีภายใต้ Apache 2.0
MiniMax Music 3.0 คืออะไร?
เป็นโมเดลสร้างเพลงรุ่นใหม่จาก MiniMax ที่ใช้สถาปัตยกรรมแบบ Hybrid-LM ผสม 8B Global LLM (based on Qwen3) กับ 0.6B Local LLM ทำงานร่วมกัน โดย Global LLM รับผิดชอบโครงสร้างเพลงระยะยาว ส่วน Local LLM เรียกความละเอียดเสียงระดับเฟรม แล้วผสมกับ Flow Matching + Flow-VAE เพื่อสังเคราะห์คลื่นเสียงคุณภาพสูง

ภาพ: สถิติเด่น MiniMax Music 3.0 — 5 นาที 32kHz สเตริโอ พร้อมสถาปัตยกรรม 8B+0.6B (ภาพประกอบโทน Yadeep)

ภาพ: สถาปัตยกรรม Hybrid-LM — 8B Global LLM (Qwen3) + 0.6B Local LLM + Flow Matching + Flow-VAE (ภาพประกอบโทน Yadeep)
ฟีเจอร์หลักของ MiniMax Music 3.0
- สร้างเพลงเต็มเพลง: สูงสุด 5 นาที ครอบคลุม Intro, Verse, Chorus, Bridge, Outro
- ขับเคลื่อนด้วยเนื้อร้อง: ใส่เนื้อร้อง + คำอธิบายสไตล์ ได้เพลงพร้อมร้องและบรรเลง
- ควบคุมโครงสร้าง: รองรับแท็ก
[Verse][Chorus][Bridge]ควบคุมอารมณ์และการเรียบเรียงในแต่ละท่อน - ความสม่ำเสมอระยะยาว: รักษาธีม จังหวะ และเสียงร้องให้สม่ำเสมอตลอดเพลง
- เสียงคุณภาพสูง: 32kHz 16-bit สเตริโอ WAV ใกล้เคียงสตูดิโอ
- เพิ่มข้อมูล prompt อัตโนมัติ: มี
music-caption-rewriterขยายคำอธิบายสั้นให้เป็นโครงสร้างมืออาชีพ
เปรียบเทียบกับ Suno v5

ภาพ: เปรียบเทียบระยะเวลาและคุณภาพเสียง MiniMax Music 3.0 vs Suno v5/v5.5 (ภาพประกอบโทน Yadeep)
จะเห็นว่า MiniMax เปิดน้ำหนักโมเดลให้ดาวน์โหลดรันเองได้ ในขณะที่ Suno เปิดเฉพาะบริการคลาวด์ แต่ Suno ยังได้เปรียบเรื่องความถี่เสียงสูงสุด (48kHz 24-bit ในรุ่น Premier) และระยะเวลาสูงสุดของ v5.5 ที่ยาวถึง 8 นาที

ภาพ: กรณีใช้งาน MiniMax Music 3.0 — นักดนตรี วิดีโอ เกม โฆษณา การศึกษา (ภาพประกอบโทน Yadeep)
วิธีใช้งาน
ต้องมี การ์ดจอ NVIDIA CUDA 2 ใบ และติดตั้ง SGLang-Omni จากนั้น:
- ดาวน์โหลดโมเดล:
hf download MiniMaxAI/MiniMax-Music3 --local-dir /path/to/minimax_ttm - เริ่มเซิร์ฟเวอร์:
sgl-omni serve --model-path MiniMaxAI/MiniMax-Music3 --port 8000 - ส่งคำขอ POST ไปยัง
http://127.0.0.1:8000/v1/audio/speechพร้อมเนื้อร้อง + คำอธิบายสไตล์
GPU 0 รับหน้าที่ส่วน Qwen3 + RVQ 8 ชั้น, GPU 1 รับ Flow Matching + Flow-VAE สำหรับ decode เป็นคลื่นเสียง
สรุป

ภาพ: สรุปประเด็นสำคัญ MiniMax Music 3.0 (ภาพประกอบโทน Yadeep)
MiniMax Music 3.0 ถือเป็นหมุดหมายสำคัญของยุค AI Music โอเพนซอร์ส — โมเดลที่เปิดน้ำหนักเต็ม สร้างเพลงเต็มเพลงได้จริง พร้อมควบคุมโครงสร้างแบบมืออาชีพ และใช้เชิงพาณิชย์ได้ฟรี
ความคิดเห็น 0
ยังไม่มีความคิดเห็น — เป็นคนแรกที่แสดงความคิดเห็น!