เคยคิดมั้ยว่า ถ้าให้ AI ฟังเสียงเราสัก 3 วินาที แล้วมันจะพูดเลียนแบบเราได้ทั้งวัน? ฟังดูเหมือนนิยายวิทยาศาสตร์ แต่ตอนนี้มันเกิดขึ้นจริงแล้ว! 🎙️
dots.tts คือโมเดล AI สร้างเสียงพูด (TTS) ใหม่ล่าสุดจากทีม dots (Xiaohongshu) ร่วมกับ Shanghai Jiao Tong University — เป็น Open Source ฟรี ใครก็เอาไปใช้ได้ (Apache-2.0) พร้อมโค้ดฝึกโมเดลให้ครบ แถมยังโคลนเสียงคนได้ด้วยคลิปอ้างอิงแค่ 3–10 วินาที เท่านั้น!
dots.tts คืออะไร? เอาง่ายๆ เลย
ปกติโมเดลสร้างเสียงรุ่นเก่า มักจะหั่นเสียงเป็นก้อนๆ (discrete token) ก่อนสร้างใหม่ เหมือนต่อเลโก้ทีละก้อน — เสียงอาจดูแข็งๆ หรือขาดตอนตรงรอยต่อ
แต่ dots.tts เลือกเส้นทางต่าง: สร้างเสียงแบบ ต่อเนื่องลื่นไหล (fully continuous autoregressive) เหมือนวาดเส้นเดียวจบ ไม่มีรอยต่อ — ผลลัพธ์คือเสียงละเอียด ฟังธรรมชาติถึง 48 kHz แทบแยกไม่ออกจากคนจริง แถมเก็บรายละเอียดเล็กๆ อย่างลมหายใจและ texture ของเสียงได้ครบ
หัวใจของโมเดลมี 3 ชิ้นทำงานร่วมกัน:
- Semantic encoder — ย่อยเสียงให้เป็นข้อมูลสั้นๆ ที่โมเดลเข้าใจ
- LLM backbone — สมองหลัก อ่านข้อความ + ฟังเสียงตัวอย่าง (ต่อยอดจาก Qwen2.5-1.5B)
- Flow-matching head — ตัวสร้างเสียงทีละส่วนให้ต่อเนื่องเนียนๆ
เสียงมันดีแค่ไหน? ดูตัวเลข
ทีมวิจัยทดสอบบนชุด Seed-TTS-Eval (มาตรฐานวัด TTS) ด้านความคล้ายเสียงกับเจ้าของเสียงจริง (SIM) dots.tts ทำได้สูงมาก:

ภาพ: คะแนนความคล้ายเสียง (SIM) ของ dots.tts บน Seed-TTS-Eval
ตัวเลข 79.2 นี่แหละ คือ "เสียงที่สร้างออกมา ยังฟังเหมือนเจ้าของเสียงจริงๆ" — วัดแล้วชนะหลายโมเดล Open Source ในตลาด
จุดเด่นที่ทำให้ dots.tts โดดเด่น
1. โคลนเสียงได้ด้วยคลิป 3–10 วินาที
แค่ให้ไฟล์เสียงสั้นๆ + ข้อความที่พูดในไฟล์ โมเดลก็เลียนแบบน้ำเสียงได้ทันที เรียกว่า zero-shot voice cloning — ไม่ต้องเทรน ไม่ต้องรอ ยังโคลนข้ามภาษาได้อีกด้วย!

ภาพ: Zero-shot voice cloning — โคลนเสียงจากคลิปอ้างอิง 3–10 วินาที
2. พูดตอบโต้ได้แบบเรียลไทม์
ด้วยดีไซน์แบบ causal ทำให้สร้างเสียงสตรีมมิงได้ตามธรรมชาติ ยิ่งโหมด 1T1A (ข้อความสลับเสียงทีละ step) เสียงแรกออกมาภายใน 54.4 มิลลิวินาที — ไวพอให้แชตบอต/voice agent คุยตอบโต้กับเราได้แบบไม่สะดุด เหมาะกับผู้ช่วยเสียง เกม หรือบทสนทนาสองทาง

ภาพ: Real-time streaming TTS — first-packet latency ต่ำถึง 54.4 ms
3. สั่ง "แก้เสียงพูด" ได้เหมือนตัดต่อ
dots.tts.edit — ลูกเล่นเด็ด! สั่งแก้ไขเสียงพูดด้วยคำสั่ง XML ง่ายๆ เช่น เปลี่ยนคำศัพท์ ปรับอารมณ์ ระดับเสียง ความเร็ว หรือแทรก/ลบการเว้นวรรค ได้ในคำสั่งเดียว ส่วนที่ไม่ได้สั่งแก้ จะคงเดิม 100% เหมาะกับงานพากย์/ตัดต่อที่ต้องการแม่นยำ

ภาพ: dots.tts.edit — แก้ไขเสียงพูดด้วยคำสั่ง XML ที่แม่นยำ
4. รองรับ 24 ภาษา
บนชุดทดสอบ MiniMax 24 ภาษา โมเดลทำคะแนนความคล้ายเสียงเฉลี่ย 83.9 และได้ที่ 1 ใน 19 ภาษา — ครอบคลุมทั้งไทย อังกฤษ จีน และอีกเพียบ
เทียบกับคู่แข่ง: dots.tts vs CosyVoice 3
| ด้าน | dots.tts | CosyVoice 3 |
|---|---|---|
| เทคนิค | สร้างเสียงต่อเนื่องลื่นไหล (ไม่มีสะเก็ด) | ผสม discrete + continuous |
| พารามิเตอร์ | 2B | 1.5B |
| Seed-TTS-Eval WER/CER เฉลี่ย (อ่านผิดน้อยกว่า = ดีกว่า) | 2.95% | 3.06% |
| Seed-TTS-Eval SIM เฉลี่ย (เสียงเหมือนกว่า = ดีกว่า) | 79.2 | 75.3 |
| มัลติลิงกวล | 24 ภาษา (SIM 83.9) | เน้นจีน-อังกฤษ |
| First-packet latency | 54.4 ms | ไม่ระบุ |
เห็นชัดว่า dots.tts ชนะทั้งด้านอ่านผิดน้อยกว่า และเสียงเหมือนกว่า — โดยเฉพาะเรื่องความคล้ายเสียง:

ภาพ: เปรียบเทียบความคล้ายเสียง dots.tts vs CosyVoice 3
เอาไปลองใช้ยังไง?
ง่ายมาก ติดตั้งผ่าน pip:
pip install dots.tts
จากนั้นโคลนเสียงตัวเองได้เลย:
dots.tts \
--model-name-or-path dots-studio/dots.tts-soar \
--text "สวัสดีครับ นี่คือเสียงที่ถูกสร้างจากคลิปอ้างอิงสั้นๆ" \
--prompt-audio /path/to/reference.wav \
--prompt-text "ข้อความที่พูดในไฟล์อ้างอิง" \
--output clone.wav
หรือใช้ผ่าน Python API ก็ได้:
from dots_tts.runtime import DotsTtsRuntime
import soundfile as sf
runtime = DotsTtsRuntime.from_pretrained("dots-studio/dots.tts-soar")
result = runtime.generate(
text="Hello, this is a quick speech synthesis test.",
prompt_audio_path="reference.wav",
)
sf.write("output.wav", result["audio"], result["sample_rate"])
ยังมี checkpoint ให้เลือก 7 แบบ ตั้งแต่ base (พื้นฐาน) ไปจนถึง soar (คุณภาพสูงสุด) และ mf-1step (เร็วสุด 1 ขั้นตอน)
สรุป: 3 อย่างที่ควรจำ
1. dots.tts สร้างเสียงคุณภาพ 48 kHz แบบต่อเนื่องลื่นไหล — ฟังแล้วแทบแยกไม่ออกจากคนจริง
2. โคลนเสียงได้ด้วยคลิป 3–10 วินาที + สั่งแก้เสียงพูดได้แม่นยำ + รองรับ 24 ภาษา
3. ฟรี Open Source (Apache-2.0) — ใครก็โหลดไปลองได้เลย
ถ้าอยากลอง เริ่มจาก pip install dots.tts แล้วลองโคลนเสียงตัวเองดู — หรือถ้าสนใจด้านแก้ไขเสียง ลอง dots.tts.edit ที่สั่งได้ทั้งเปลี่ยนคำ ปรับอารมณ์ ระดับเสียง และจังหวะพูด
ความคิดเห็น 0
ยังไม่มีความคิดเห็น — เป็นคนแรกที่แสดงความคิดเห็น!