Yadeep Blog Yadeep Blog
หน้าแรก
หมวดหมู่
AI Models Generative AI Machine Learning Robotics AI Ethics Industry
เกี่ยวกับ ติดต่อ
เข้าสู่ระบบ สมัครสมาชิก
AI Models

MiniMax Music 3.0 — โมเดลเปิดสร้างเพลงเต็มเพลง 5 นาที 32kHz สเตริโอ ฟรี Apache 2.0

MiniMax เปิดตัว Music 3.0 โมเดลสร้างเพลงเปิดน้ำหนักเต็ม สถาปัตยกรรม 8B Global + 0.6B Local LLM ผสม Flow Matching + Flow-VAE สร้างเพลงเต็มเพลงสูงสุด 5 นาที 32kHz สเตริโอ พร้อมโครงสร้าง Verse/Chorus/Bridge ควบคุมได้ละเอียด ใช้เชิงพาณิชย์ฟรี Apache 2.0

MiniMax Music 3.0 — โมเดลเปิดสร้างเพลงเต็มเพลง 5 นาที 32kHz สเตริโอ ฟรี Apache 2.0

วงการ AI Music มีข่าวใหญ่อีกครั้ง! MiniMax เปิดตัว Music 3.0 โมเดลสร้างเพลงเปิดน้ำหนักเต็ม (Open Weights) ที่สามารถสร้าง เพลงเต็มเพลงสูงสุด 5 นาที คุณภาพ 32kHz สเตริโอ พร้อมเปิดใช้งานเชิงพาณิชย์ได้ฟรีภายใต้ Apache 2.0

MiniMax Music 3.0 คืออะไร?

เป็นโมเดลสร้างเพลงรุ่นใหม่จาก MiniMax ที่ใช้สถาปัตยกรรมแบบ Hybrid-LM ผสม 8B Global LLM (based on Qwen3) กับ 0.6B Local LLM ทำงานร่วมกัน โดย Global LLM รับผิดชอบโครงสร้างเพลงระยะยาว ส่วน Local LLM เรียกความละเอียดเสียงระดับเฟรม แล้วผสมกับ Flow Matching + Flow-VAE เพื่อสังเคราะห์คลื่นเสียงคุณภาพสูง

ภาพ: สถิติเด่น MiniMax Music 3.0 — 5 นาที 32kHz สเตริโอ พร้อมสถาปัตยกรรม 8B+0.6B (ภาพประกอบโทน Yadeep)

ภาพ: สถิติเด่น MiniMax Music 3.0 — 5 นาที 32kHz สเตริโอ พร้อมสถาปัตยกรรม 8B+0.6B (ภาพประกอบโทน Yadeep)

ภาพ: สถาปัตยกรรม Hybrid-LM — 8B Global LLM (Qwen3) + 0.6B Local LLM + Flow Matching + Flow-VAE (ภาพประกอบโทน Yadeep)

ภาพ: สถาปัตยกรรม Hybrid-LM — 8B Global LLM (Qwen3) + 0.6B Local LLM + Flow Matching + Flow-VAE (ภาพประกอบโทน Yadeep)

ฟีเจอร์หลักของ MiniMax Music 3.0

  • สร้างเพลงเต็มเพลง: สูงสุด 5 นาที ครอบคลุม Intro, Verse, Chorus, Bridge, Outro
  • ขับเคลื่อนด้วยเนื้อร้อง: ใส่เนื้อร้อง + คำอธิบายสไตล์ ได้เพลงพร้อมร้องและบรรเลง
  • ควบคุมโครงสร้าง: รองรับแท็ก [Verse] [Chorus] [Bridge] ควบคุมอารมณ์และการเรียบเรียงในแต่ละท่อน
  • ความสม่ำเสมอระยะยาว: รักษาธีม จังหวะ และเสียงร้องให้สม่ำเสมอตลอดเพลง
  • เสียงคุณภาพสูง: 32kHz 16-bit สเตริโอ WAV ใกล้เคียงสตูดิโอ
  • เพิ่มข้อมูล prompt อัตโนมัติ: มี music-caption-rewriter ขยายคำอธิบายสั้นให้เป็นโครงสร้างมืออาชีพ

เปรียบเทียบกับ Suno v5

ภาพ: เปรียบเทียบระยะเวลาและคุณภาพเสียง MiniMax Music 3.0 vs Suno v5/v5.5 (ภาพประกอบโทน Yadeep)

ภาพ: เปรียบเทียบระยะเวลาและคุณภาพเสียง MiniMax Music 3.0 vs Suno v5/v5.5 (ภาพประกอบโทน Yadeep)

จะเห็นว่า MiniMax เปิดน้ำหนักโมเดลให้ดาวน์โหลดรันเองได้ ในขณะที่ Suno เปิดเฉพาะบริการคลาวด์ แต่ Suno ยังได้เปรียบเรื่องความถี่เสียงสูงสุด (48kHz 24-bit ในรุ่น Premier) และระยะเวลาสูงสุดของ v5.5 ที่ยาวถึง 8 นาที

ภาพ: กรณีใช้งาน MiniMax Music 3.0 — นักดนตรี วิดีโอ เกม โฆษณา การศึกษา (ภาพประกอบโทน Yadeep)

ภาพ: กรณีใช้งาน MiniMax Music 3.0 — นักดนตรี วิดีโอ เกม โฆษณา การศึกษา (ภาพประกอบโทน Yadeep)

วิธีใช้งาน

ต้องมี การ์ดจอ NVIDIA CUDA 2 ใบ และติดตั้ง SGLang-Omni จากนั้น:

  • ดาวน์โหลดโมเดล: hf download MiniMaxAI/MiniMax-Music3 --local-dir /path/to/minimax_ttm
  • เริ่มเซิร์ฟเวอร์: sgl-omni serve --model-path MiniMaxAI/MiniMax-Music3 --port 8000
  • ส่งคำขอ POST ไปยัง http://127.0.0.1:8000/v1/audio/speech พร้อมเนื้อร้อง + คำอธิบายสไตล์

GPU 0 รับหน้าที่ส่วน Qwen3 + RVQ 8 ชั้น, GPU 1 รับ Flow Matching + Flow-VAE สำหรับ decode เป็นคลื่นเสียง

สรุป

ภาพ: สรุปประเด็นสำคัญ MiniMax Music 3.0 (ภาพประกอบโทน Yadeep)

ภาพ: สรุปประเด็นสำคัญ MiniMax Music 3.0 (ภาพประกอบโทน Yadeep)

MiniMax Music 3.0 ถือเป็นหมุดหมายสำคัญของยุค AI Music โอเพนซอร์ส — โมเดลที่เปิดน้ำหนักเต็ม สร้างเพลงเต็มเพลงได้จริง พร้อมควบคุมโครงสร้างแบบมืออาชีพ และใช้เชิงพาณิชย์ได้ฟรี

แชร์บทความนี้:

ความคิดเห็น 0

ยังไม่มีความคิดเห็น — เป็นคนแรกที่แสดงความคิดเห็น!

แสดงความคิดเห็น