Bỏ qua đến nội dung chính

ElevenLabs' Mati Staniszewski: How Voice Becomes the Interface for AI

TL;DR

  • 11 Labs được thành lập bởi hai người bạn thời thơ ấu từ Ba Lan, với cảm hứng ban đầu xuất phát từ chất lượng lồng tiếng đơn điệu ở quê hương họ, thúc đẩy tầm nhìn tạo ra giọng nói tự nhiên, giàu cảm xúc.
  • Công ty đã áp dụng cách tiếp cận độc đáo khi tập trung vào lĩnh vực AI âm thanh còn ngách vào năm 2022, sử dụng các mô hình nhỏ hơn, phương pháp tìm kiếm nhân tài từ xa và ưu tiên tạo doanh thu sớm để tự tài trợ cho quá trình phát triển.
  • Từ nền tảng text-to-speech, 11 Labs đã mở rộng sang speech-to-text, lồng tiếng, mô hình streaming thời gian thực và voice agent với trí tuệ cảm xúc, nhắm đến các cơ hội chưa được khai thác trong hỗ trợ công dân, giáo dục và chăm sóc sức khỏe.

Điểm chính

  • Khai thác thị trường ngách: Bắt đầu vào năm 2022 khi AI âm thanh còn là một lĩnh vực ít cạnh tranh, 11 Labs đã tận dụng yêu cầu kỹ thuật khác biệt và sự thiếu nhận thức về giá trị của thị trường này.
  • Cách tiếp cận kỹ thuật hiệu quả: Các mô hình âm thanh nhỏ hơn, yêu cầu ít Compute hơn và tập trung vào việc phiên âm, chú thích dữ liệu lớn để đạt hiệu quả.
  • Chiến lược tuyển dụng tài năng toàn cầu: Áp dụng phương pháp làm việc hoàn toàn từ xa và GitHub scraping để tìm kiếm các nhà nghiên cứu giỏi nhất dựa trên công việc của họ thay vì vị trí địa lý.
  • Tạo doanh thu sớm để tự chủ: Nhanh chóng kiếm tiền từ sản phẩm để tài trợ cho hoạt động nghiên cứu và phát triển, duy trì lợi nhuận lành mạnh trước khi huy động vốn từ bên ngoài cho các tham vọng lớn hơn.
  • Mở rộng mô hình theo giai đoạn: Bắt đầu với text-to-speech, sau đó bổ sung speech-to-text, kết hợp chúng để lồng tiếng, phát triển mô hình streamingSoftware Stack cho voice agent, và cuối cùng là khả năng tạo nhạc.
  • Tập trung vào trí tuệ cảm xúc: Thành công trong việc tái tạo giọng nói với tiếng cười, khoảng dừng và các yếu tố phi hoàn hảo, sau đó phát triển voice agent có khả năng hiểu và phản hồi cảm xúc của người dùng.
  • Cơ hội thị trường bị bỏ qua: Ngoài hỗ trợ khách hàng, các voice agent có tiềm năng lớn trong tạo doanh thu (bán hàng), hỗ trợ công dân (chính phủ), giáo dục và chăm sóc sức khỏe.
  • Cấu trúc công ty tinh gọn, đa chức năng: Giữ các nhóm nhỏ, phẳng và nhúng kỹ sư vào cả các nhóm phi kỹ thuật (nhân sự, pháp lý, go-to-market) để tự động hóa, nâng cao kỹ năng và cải thiện chất lượng công việc.

Từ vựng

  • frontier model — mô hình tiên phong
  • Compute — khả năng tính toán
  • GitHub scraping — thu thập dữ liệu từ GitHub
  • text-to-speech — chuyển văn bản thành giọng nói
  • speech-to-text — chuyển giọng nói thành văn bản
  • streaming — truyền trực tuyến
  • Software Stack — bộ công nghệ phần mềm
  • voice agent — tác nhân giọng nói
  • Emotional intelligence — trí tuệ cảm xúc
  • go-to-market — chiến lược đưa sản phẩm ra thị trường

Nội dung chi tiết

Khởi Nguồn 11 Labs và Cảm Hứng từ Ba Lan

Tôi yêu thích biểu đồ đường và biểu đồ cột như bất kỳ ai khác, có lẽ còn hơn thế. Câu chuyện về 11 Labs cũng rất thú vị dưới góc độ con người. Nhưng anh đã thành lập một công ty với một người bạn từ thuở thơ ấu. Vậy, có lẽ anh có thể đưa chúng ta trở lại năm 2022 hoặc sớm hơn và kể về khía cạnh con người trong câu chuyện của 11 Labs lúc ban đầu.

Tôi cảm thấy mình rất may mắn trong câu chuyện của 11 Labs bởi vì, mặc dù nó bắt đầu vào năm 2022, nhưng lại có cảm giác như nó đã bắt đầu từ 17 năm trước khi tôi gặp người đồng sáng lập của mình, Piotr. Tất cả các tên tiếng Ba Lan đều phức tạp, may mắn cho chúng tôi. Nhưng chúng tôi gặp nhau ở trường trung học, trở thành bạn thân, học cùng tất cả các môn, và sau đó qua nhiều năm đã làm mọi thứ cùng nhau. Chúng tôi đã cùng nhau đi du lịch, cùng nhau học tập, cùng nhau làm việc, và thời gian đứng về phía chúng tôi. Chúng tôi vẫn là bạn thân nhất. Mọi việc đang diễn ra tốt đẹp. Và một phần khởi nguồn của 11 Labs là nguồn cảm hứng từ nơi cả hai chúng tôi sinh ra. Cả hai chúng tôi đều đến từ Ba Lan. Vậy, tôi đến từ Warsaw.

Và có một điều rất đặc biệt ở Ba Lan. Nếu bạn xem bất kỳ bộ phim nước ngoài nào bằng tiếng Ba Lan, tất cả các giọng nói, dù là giọng nam hay giọng nữ, đều được lồng tiếng bởi một nhân vật duy nhất. Vì vậy, như bạn có thể tưởng tượng, đó là một trải nghiệm khá tệ. Bạn chỉ có duy nhất một giọng nói tường thuật mọi thứ. Nó thường cũng được giữ ở giọng điệu đơn điệu một cách cố ý. Vì vậy, bạn phải tự diễn giải cảm xúc của mình cho nội dung đó. Và trong khi chúng tôi lớn lên với điều này, nó vẫn đang diễn ra cho phần lớn nội dung ngày nay. Và điều đó đã mở mắt chúng tôi về một trong những điều rõ ràng trên toàn bộ lĩnh vực âm thanh, và trong tương lai: khả năng mọi người có thể nói bất kỳ ngôn ngữ nào với cùng cảm xúc, cùng ngữ điệu.

Và chúng tôi bắt đầu đi sâu hơn vào vấn đề đó và nhận ra rằng vấn đề âm thanh cũng tồn tại trong rất nhiều lĩnh vực khác. Cho dù đó là việc tường thuật nội dung xung quanh chúng ta; cho dù đó là những cuốn sách không có sẵn dưới dạng âm thanh; cho dù đó là những bài báo mà chúng ta có thể đọc; cho dù đó là rào cản ngôn ngữ; hay trong tương lai, như chúng ta đã nghe trong các cuộc trò chuyện trước, tương lai nơi con người và robot vây quanh chúng ta, giọng nói sẽ là giao diện chính cho rất nhiều công nghệ đó, và là điều chúng tôi muốn khắc phục và giải quyết.

Cách Tiếp Cận Đổi Mới trong Phát Triển Mô Hình Âm Thanh

Tuyệt vời. Và 11 Labs xây dựng các frontier model cho âm thanh. Tôi nghĩ hiện nay có một mô hình trong đó để xây dựng một frontier model, bạn phải bắt đầu với hàng trăm triệu hoặc hàng tỷ đô la rồi sau đó mới tính đến những thứ khác. 11 Labs đã không đi theo con đường đó. Anh có thể nói một chút về cách tiếp cận của mình để xây dựng công ty này, tại sao điều này chưa được nhân rộng, và liệu điều đó có còn khả thi vào năm 2026, v.v. không?

Vâng, tôi nghĩ đó tiếp tục là một sự may mắn và đúng thời điểm tuyệt vời bởi vì chúng tôi bắt đầu vào năm 2022. Đối với những ai làm việc trong lĩnh vực này vào thời điểm đó, đó là năm của cryptometaverse. Không ai còn làm việc về phía AI. Hơn nữa, mọi người dĩ nhiên đã bắt đầu làm việc trên các mô hình văn bản và mô hình hình ảnh, nhưng âm thanh là một lĩnh vực vẫn được coi là một thị trường ngách lớn với rất ít nhà nghiên cứu trong không gian này đang làm việc về nó. Vì vậy, đối với chúng tôi, đó là một phần tốt khi chọn lĩnh vực đó, nơi (A) chúng tôi rất hào hứng về tương lai của nó, (B) chúng tôi cảm thấy rằng những người xung quanh chỉ đơn giản là không nhận ra giá trị của lĩnh vực đó, và (C) các yêu cầu về những gì bạn cần giải quyết rất khác.

Các mô hình âm thanh nhỏ hơn, vì vậy bạn không cần nhiều Compute như bạn cần cho một số lĩnh vực chị em khác. Nhu cầu dữ liệu rất lớn, nhưng mặc dù có rất nhiều dữ liệu âm thanh, chúng tôi biết rằng để thực sự làm cho âm thanh hoạt động, bạn sẽ cần tìm cách phiên âm và chú thích rất nhiều dữ liệu đó, điều mà chúng tôi biết chúng tôi có thể làm. Và cuối cùng, tất cả đều quy về khía cạnh kiến trúc: liệu chúng ta có thể giải quyết phần đó một cách tốt đẹp không? Và ở đây, người đồng sáng lập của tôi là một trong những người thông minh nhất mà tôi biết, một nhà nghiên cứu xuất sắc, và đã có thể tập hợp một số người giỏi nhất trong lĩnh vực âm thanh để giúp chúng tôi.

Chúng tôi đã thực hiện một cách tiếp cận hơi khác thường vào thời điểm đó. Chúng tôi bắt đầu ở London. Chúng tôi có nhiều người ở cả London và Warsaw và đã thành lập một công ty hoạt động hoàn toàn từ xa. Vì vậy, chúng tôi muốn thuê những nhà nghiên cứu giỏi nhất dù họ ở bất cứ đâu. Chúng tôi đã thực hiện việc GitHub scraping cổ điển và cố gắng tiếp cận những người dựa trên công việc của họ thay vì sự hiện diện của họ; dựa trên công việc đó, chúng tôi sẽ liên hệ với những người đó. Chúng tôi luôn chia sẻ các ví dụ của mình và cố gắng mời họ tham gia nhóm. Đó là cách chúng tôi tập hợp nhóm người đầu tiên mà chúng tôi cho là những nhà nghiên cứu giỏi nhất trong lĩnh vực âm thanh đó, và qua nhiều năm, họ vẫn giúp chúng tôi đưa nhiều mô hình đó vào sản xuất.

Sau đó chúng tôi đã ra mắt sản phẩm. Tôi nghĩ cách tiếp cận hơi khác mà chúng tôi đã thực hiện là kiếm tiền rất nhanh. Vì vậy, cố gắng có được dòng doanh thu để chúng tôi có thể tài trợ cho nhiều công việc và các mô hình. Chúng tôi đã cố gắng duy trì lợi nhuận lành mạnh để có thể tiếp tục đầu tư với giả định rằng tốt hơn hết là chúng tôi nên tìm ra dòng doanh thu đó và có thể độc lập trong quá trình phát triển. Nhưng sau đó, khi tham vọng lớn hơn, chúng tôi biết rằng chúng tôi cần huấn luyện các mô hình, vì vậy, dĩ nhiên, chúng tôi cũng đã huy động rất nhiều tiền từ bên ngoài. Và tôi nghĩ, nhìn về hôm nay, một điều rõ ràng đối với chúng tôi là vẫn còn rất nhiều thị trường ngách mà mọi người không giải quyết, mà bạn có thể bắt đầu với chúng và sau đó từng bước bắt đầu mở rộng chúng.

Các Mô Hình và Khả Năng Của 11 Labs

Tôi nghĩ nhiều khách hàng nhìn nhận 11 Labs thông qua những nhu cầu hẹp của họ, đúng không? Có lẽ hãy nhìn từ một góc độ rộng hơn. 11 Labs đang nghiên cứu bộ mô hình nào? Anh ưu tiên chúng như thế nào? Anh tổ chức R&D như thế nào? V.v.

Vâng, chúng tôi bắt đầu với mô hình text-to-speech đầu tiên. Tức là, mô hình cuối cùng có thể hiểu Ngữ cảnh của những gì đang được viết và, dựa trên sự hiểu biết Ngữ cảnh đó, tạo ra cảm xúc và ngữ điệu phù hợp từ văn bản. Vì vậy, nếu đó là một câu vui vẻ, bạn sẽ có được sự vui vẻ đó. Nếu đó là một đoạn hội thoại, nó có thể phát âm đoạn hội thoại đó. Và sau đó liên tục bổ sung thêm.

Vì vậy, nó bắt đầu với vấn đề phá vỡ rào cản ngôn ngữ. Những điều bạn cần giải quyết trong lồng tiếng là transcription (để hiểu), sau đó là dịch thuật, và cuối cùng là text-to-speech. Vì vậy, chúng tôi đã giải quyết text-to-speech trước tiên. Sau đó, chúng tôi biết mình cần thêm một thành phần khác, đó là speech-to-text và khả năng phiên âm nội dung một cách tuyệt vời. Sau đó, làm thế nào chúng tôi kết hợp các mô hình đó lại với nhau. Vì vậy, đó là ba mô hình đầu tiên trong vài năm đầu. Và sau đó, dĩ nhiên, những điều khác bắt đầu xảy ra trong không gian này: nhiều mô hình lập luận bắt đầu trở nên đủ nhanh và đủ thông minh cùng lúc, nơi bạn có thể hình dung những trải nghiệm tương tác đó có thể thực hiện được. Và đó là lúc chúng tôi bắt đầu ra mắt các mô hình streaming thời gian thực trên âm thanh, sau đó kết hợp chúng vào các trải nghiệm hội thoại. Vì vậy, chúng tôi thực sự đã thêm toàn bộ Software Stack, tất cả các cơ chế luân phiên và điều phối để tạo ra một công cụ giọng nói cho một voice agent.

Và sau đó, ở khía cạnh khác, khi chúng tôi nhận ra rằng cảm xúc là thứ chúng tôi có thể giải quyết, chúng tôi đã thêm một số phương thức khó nhất trong âm thanh: âm nhạc và khả năng tạo ra âm nhạc. Vì vậy, ngày nay, chúng tôi đã mở rộng toàn bộ nghiên cứu về âm thanh, bao gồm text-to-speech, speech-to-text, kết hợp các mô hình đó lại với nhau để bản địa hóa bằng lồng tiếng, điều phối với công cụ giọng nói của voice agent, và sau đó cũng có thể làm điều đó với âm nhạc.

Khoảnh Khắc "Ồ, Tuyệt Vời" và Trí Tuệ Cảm Xúc

Và với tất cả những điều đó và công việc phát triển thú vị đó, anh có nhớ khoảnh khắc 'ồ, thật tuyệt vời' nào về khả năng của những sản phẩm này không?

Vâng, có rất nhiều khoảnh khắc như vậy và tiêu chuẩn dường như thay đổi đối với tất cả chúng tôi. Khoảnh khắc đầu tiên đối với chúng tôi là, họ luôn sử dụng giọng của tôi làm giọng thử nghiệm vì nó có một chất giọng lạ. Và lần đầu tiên, khi chúng tôi có thể tái tạo giọng nói của tôi dựa trên một mẫu tốt, đó là một khoảnh khắc 'wow' đầu tiên đối với chính tôi. Bạn luôn có khoảnh khắc kiểu như, "đây không phải là giọng của mình," và sau đó bạn nghe lại mình và thấy, "đây chắc chắn là giọng của mình rồi."

Thật không may, khoảnh khắc thứ hai là khi chúng tôi lần đầu tiên làm cho nó cười được, và mọi người đã nói, "Ồ, đây thực sự là điều làm cho toàn bộ trải nghiệm trở nên giống con người hơn: tiếng cười, những khoảng dừng, những tiếng 'ừm', 'à', những sự không hoàn hảo." Vì vậy, chúng tôi bắt đầu đưa những điều đó ra ngoài, và đó là những khoảnh khắc quan trọng đối với chúng tôi bởi vì chúng tôi đã lọt vào top Hacker News với mô hình AI đầu tiên có thể cười, đó là một khoảnh khắc rất đáng tự hào đối với chúng tôi. Một trong những đỉnh cao của hiệu suất giọng nói, tôi cảm thấy, là Matthew McConaughey đọc bản tin của mình và những câu thoại mang tính biểu tượng của anh ấy bằng tiếng Tây Ban Nha và tiếng Bồ Đào Nha, nơi lần đầu tiên gia đình anh, những người nói ngôn ngữ đó, có thể nghe anh nói những ngôn ngữ đó.

Nhưng đối với những sản phẩm gần đây hơn, hai điều mà chúng tôi rất hào hứng khi đưa vào sản xuất, tôi nghĩ điều đầu tiên là cuối cùng đã tìm ra trí tuệ cảm xúc trong trải nghiệm tương tác đó. Vì vậy, trong trải nghiệm voice agent, nơi nó không chỉ có được ngữ điệu và cảm xúc phù hợp, mà còn có thể hiểu được phía bên kia. Nếu ai đó căng thẳng, nó sẽ nhận biết và truyền tải cảm xúc nhẹ nhàng, trấn an đó. Nếu ai đó phấn khích, có thể nó sẽ khớp với cảm xúc đó. Nếu ai đó nói chậm, nó sẽ đảm bảo nói chậm lại. Và trí tuệ cảm xúc đó là thứ mà chúng tôi cuối cùng cũng thấy được một con đường để giải quyết nội bộ, điều này sẽ là một bước thay đổi liên tục đối với những gì có thể thực hiện được.

Và sau đó, điều thứ hai, điều sẽ được áp dụng ở đó, nhưng cũng áp dụng vào các không gian âm thanh tổng quát – trí tuệ tổng quát âm thanh – nơi bạn có thể kết hợp các mô hình âm thanh lại với nhau trong một luồng. Vì vậy, về lý thuyết, bạn có thể có một mô hình tường thuật, sau đó tạm dừng và, giả sử, bắt đầu hát với cùng giọng nói liên tục đó. Và đó là điều cực kỳ khó kết hợp ngày nay, và là điều có thể thực hiện được, tôi nghĩ, rất sớm thôi.

Cơ Hội trong Thế Giới Voice Agent

Và hãy tưởng tượng, các voice agent. Và có vẻ như mọi người, ít nhất là về phía khách hàng, đang mua một voice agent. Và tôi nghĩ một cách trực quan bạn sẽ nghĩ đến hỗ trợ khách hàng, bạn biết đấy, việc thay thế cây điện thoại cũ. Điều gì thực sự đang diễn ra trong thế giới của các voice agent? Và theo anh, đâu là những cơ hội bị bỏ qua thú vị nhất, những điểm mà các nhà sáng lập startup nên tập trung?

Vâng, dĩ nhiên, hỗ trợ khách hàng có lẽ là điều mà mọi người đều đã nghe và biết rất rõ. Tôi nghĩ điều thứ hai, và xu hướng thứ hai mà chúng tôi đang thấy, là sự dịch chuyển ngày càng tăng sang các cơ hội tạo doanh thu nơi các voice agent có thể hoạt động trong bán hàng, dù là bán hàng đến hay bán hàng đi. Nó không thay thế toàn bộ trải nghiệm, nhưng nắm bắt và khuếch đại một phần của trải nghiệm đó.

Có lẽ một ví dụ điển hình là Deliveroo, nơi Deliveroo sẽ có các voice agent liên hệ với các nhà hàng để ghi nhận thời gian mở cửa của họ. Và dựa trên thời gian mở cửa của họ, họ có thể cập nhật cho các shipper và tài xế. Và dĩ nhiên, những người đặt hàng về thời điểm nhận đơn hàng. Cho đến cả bán hàng inbound, nơi ngày càng nhiều người (một ví dụ điển hình là Deutsche Telekom) sẽ liên hệ để hỏi về dịch vụ, hỏi mua một sản phẩm. Và thay vì duyệt qua danh sách thả xuống, thay vì điền vào biểu mẫu, bạn có thể nói chuyện với voice agent để cung cấp thông tin đó. Chúng tôi cũng tự làm điều đó, vì vậy chúng tôi có các số liệu tốt và sự hiểu biết về những gì đang diễn ra ở đó. Một là, dĩ nhiên, nó đơn giản và nhanh hơn rất nhiều so với việc điền vào biểu mẫu đó.

Tối Ưu Hóa Trải Nghiệm Khách Hàng và Ứng Dụng Tiềm Năng

Thứ hai, luồng bán hàng trực tiếp đã mang lại cho chúng tôi nhiều thông tin hơn đáng kể. Khách hàng bắt đầu chia sẻ chi tiết về trường hợp sử dụng họ đang gặp phải, bao gồm cả những vấn đề họ gặp phải, những gì đang hoạt động hiệu quả và một số trường hợp sử dụng khác mà họ đang đánh giá. Chúng tôi có thể tổng hợp những thông tin này để cung cấp trải nghiệm tốt hơn nhiều sau đó.

Về các lĩnh vực bị bỏ qua, tôi nghĩ ví dụ yêu thích của tôi là hỗ trợ công dân, giáo dục và chăm sóc sức khỏe sẽ thay đổi hoàn toàn. Trong hỗ trợ công dân, tất cả chúng ta sẽ được hưởng lợi từ việc tiếp cận chính phủ tốt hơn nói chung, cho dù đó là hiểu cách điền tờ khai thuế (mà tôi nghĩ nhiều bạn đã làm vào đầu tháng này), cho đến việc tìm hiểu chính sách đi lại nước ngoài là gì và nó có thể ảnh hưởng đến bạn như thế nào.

Gần đây, chúng tôi đã thấy công việc này được triển khai tại chính phủ Ukraine. Chúng tôi nghĩ đây là một trong những chính phủ tiên tiến nhất ở mặt trận này. Chúng tôi đã đến Ukraine làm việc với nhóm của họ. Vấn đề họ đang cố gắng giải quyết là họ có một ứng dụng chính phủ mà mọi công dân có thể truy cập để nhận thông tin về những gì đang xảy ra, nhưng do chiến tranh, do tiền tuyến và thiếu quyền truy cập đó, họ muốn tìm ra một kênh mới để mọi người có thể gọi điện và nhận thông tin. Vì vậy, họ đã tạo ra một voice agent (tác nhân giọng nói) hiệu quả, nơi bạn có thể gọi điện và nhận thông tin về những gì đang diễn ra ở tiền tuyến. Bạn có thể nhận được sự giúp đỡ về giáo dục và một số bài giảng được gửi đến con cái của mình, cho đến việc tham gia chủ động về việc giữ an toàn và bảo vệ bản thân.

Và có lẽ ví dụ cuối cùng về mặt giáo dục, đây có lẽ là ví dụ yêu thích của tôi khi tôi nghĩ về sự thay đổi đó. Sẽ thật tuyệt vời nếu có một giáo viên xuất sắc luôn sẵn sàng 24/7 mà chúng ta có thể hỏi bất kỳ câu hỏi nào, cho dù đó là Karpathy hay Richard Feynman, và bạn có thể học vật lý với họ qua tai nghe khi bạn đang giảng dạy hoặc học môn học đó. Và đó là điều mà chúng ta đang thấy ở một số nơi. Một ví dụ tuyệt vời là MasterClass, nơi MasterClass tất nhiên cộng tác với những giáo viên xuất sắc để cung cấp các bài giảng tĩnh, nhưng gần đây họ đã ra mắt một phiên bản tương tác. Tôi không biết liệu đây có phải là một ví dụ tốt cho đối tượng này không, nhưng chúng tôi gần đây đã làm việc với họ để đưa Gordon Ramsay có thể dạy bạn nấu ăn. Vì vậy, khi bạn ở trong bếp, anh ấy có thể "hét" vào bạn một cách hiệu quả để bạn nấu ăn ngon hơn. Hoặc có lẽ một ví dụ tốt hơn là Chris Voss, nơi bạn có thể học cách đàm phán, nhưng bạn có thể học bằng cách đàm phán trực tiếp với Chris qua điện thoại để trở nên tốt hơn, điều mà tôi nghĩ là một chủ đề phi thường. Sau khi đàm phán với Mati vài lần về các vòng tài trợ, giờ tôi đã hiểu. Tôi nghĩ điều này giúp bạn nói điều này, nhưng tôi nghĩ điều ngược lại mới đúng. [tiếng cười]

Bài Học Xây Dựng Công Ty trong Kỷ Nguyên Foundation Model

Chúng tôi có hơn 400 người và doanh thu hơn 400 triệu USD, nhưng vẫn giữ các nhóm cực kỳ nhỏ. Ví dụ, mỗi nhóm sản phẩm nghiên cứu chỉ có ít hơn 10 người, ngay cả các nhóm go-to-market, vận hành và nhân tài cũng nhỏ hơn con số đó. Hầu hết mọi người có khoảng 10 báo cáo trực tiếp, điều này giữ cho cơ cấu tương đối phẳng và cho phép chúng tôi di chuyển nhanh hơn một chút.

Một điều chúng tôi đã làm, theo mô hình này và rất đáng ngạc nhiên, mô hình này rất giống với mô hình chúng tôi thấy ở chính phủ Ukraine, là mỗi nhóm, ngay cả các nhóm không phải kỹ thuật, cũng sẽ có kỹ sư trong đó. Vì vậy, nhóm nhân sự, nhóm go-to-market, nhóm pháp lý của chúng tôi đều sẽ có một kỹ sư trong nhóm đó để giúp xây dựng tự động hóa, nâng cao kỹ năng cho những người còn lại. Gần đây, điều này thực sự hữu ích vì như tôi chắc chắn nhiều bạn đang trải qua, mọi người đều sẽ vibe coding (lập trình dựa trên cảm hứng/linh cảm) và viết code rất nhiều, ngay cả khi họ không phải là kỹ thuật viên. Vì vậy, điều này đã thay đổi trách nhiệm, không phải trách nhiệm, mà là yêu cầu về chất lượng của việc đánh giá cho tất cả công việc đó.

Đối với các tác động về bảo mật và cơ sở hạ tầng, bạn sẽ muốn đảm bảo rằng đầu ra là chính xác. Và mọi thứ về mặt kỹ thuật, bạn có thể đặt kỳ vọng đó, nhưng đối với mặt phi kỹ thuật, khả năng thực hiện điều đó là tương đối khó. Vì vậy, nghiên cứu kỹ thuật trong các nhóm đó đã giúp chúng tôi rất nhiều để tìm ra điều này.

Và nói chung, có rất nhiều công việc đáng kinh ngạc bạn có thể làm bằng cách có điều đó, cho dù đó là thu thập dữ liệu về tuyển dụng hay phân tích những gì đã hiệu quả trong quá khứ để cải thiện trong tương lai, cho dù đó là nâng cao kỹ năng cho nhóm pháp lý về cách sử dụng các công cụ đó và sau đó tìm ra các cách để gần đây đã giới thiệu một hệ thống chấm điểm cho những điều đó về mặt go-to-market và bán hàng. Bạn thường xuyên sẽ kết thúc trong cuộc đàm phán này với nhóm bán hàng của mình về việc "Tôi có thể cung cấp các điều khoản bồi thường không? Giới hạn trách nhiệm là gì? Tôi có thể cung cấp bộ điều khoản này không?". Và sau đó bạn cần phải vạch ra ranh giới về số lượng điều bạn đưa ra. Và tôi đã tham gia vào rất nhiều cuộc trò chuyện đến nỗi chúng tôi đã đưa ra quá nhiều hoặc không. Vì vậy, giờ đây chúng tôi đã giới thiệu một hệ thống chấm điểm mà bạn có thể đưa ra điểm cho mỗi kích thước khách hàng. Chúng tôi chỉ làm cho nó dễ dàng hơn nhiều và tất nhiên, điều đó hiện đã được tự động hóa hoàn toàn với cách chúng tôi làm việc trong nhóm đó.

Đó là một trong những điều không trực quan: các nhóm nhỏ mang tài năng kỹ thuật vào các nhóm phi kỹ thuật, giữ cho cơ cấu tương đối phẳng. Chúng tôi cũng không có chức danh, điều này cho phép chúng tôi tuyển dụng mọi người và thực sự tối ưu hóa tác động mà họ đang tạo ra, và sau đó bạn có thể phát triển nhanh chóng tùy thích. Thâm niên sẽ không định nghĩa điều này và nhiều hơn nữa. Vì vậy, chúng ta sẽ xem. Đây là một công ty bốn năm tuổi. Vì vậy, chúng ta sẽ xem liệu điều đó có giúp ích không.

Voice Agent và Đàm Phán Giữa Các Agent

Sonia hỏi: Bạn có thấy mọi người triển khai các voice agent để thực sự đàm phán thay mặt họ không? Và khi đó, bạn có bắt đầu thấy các agent thực sự đàm phán với các agent không? Và xin lỗi, tôi có một câu hỏi ba phần. Khi thế giới đó xảy ra, bạn có nghĩ các agent thực sự nói chuyện với nhau theo cách con người nói chuyện để giao tiếp và đàm phán, hay bạn nghĩ đó là beep boop beep boop? Bạn có nghĩ rằng tất cả được thực hiện ngay lập tức không? Thế giới đó sẽ trông như thế nào?

Chúng tôi chưa thấy bất kỳ thành công thực sự nào trong việc đàm phán. Nó giống như việc "nhận đơn hàng" nhiều hơn: "Giá bao nhiêu? Chúng ta có thể thu thập thông tin đó không?" và sau đó quay trở lại với nhóm. Vì vậy, không phải là đàm phán thực sự. Nhưng có một vài công ty khởi nghiệp mà chúng tôi thấy, đặc biệt là trong các thay đổi tổ chức, ví dụ: "Tôi có thể tổ chức sự kiện này không?", gọi điện đến nhiều nơi, nhận giá, và sau đó gọi lại với ngân sách của chúng tôi. Vì vậy, điều đó đang xảy ra, và tôi nghĩ điều này sẽ thay đổi. Tôi nghĩ emotional intelligence (trí tuệ cảm xúc) sẽ là một phần lớn bắt đầu trở nên quan trọng trong nhiều công việc đó, nơi không chỉ nội dung quan trọng mà còn cách bạn truyền đạt, khi bạn dừng lại, công việc đó. Và có lẽ phiên bản cực đoan của điều đó, mà các agent không giống như hầu hết mọi người sẽ làm, và họ không giỏi điều đó, là ngày nay bạn sẽ thấy rất nhiều khả năng gián đoạn được tích hợp sẵn, nơi con người có thể làm gián đoạn agent. Nhưng với đàm phán, bạn cũng muốn điều ngược lại, nơi agent sẽ làm gián đoạn con người. Đó là một phiên bản cực đoan của điều đó.

Về phần thứ hai, về phần agent-to-agent, một số bạn có thể đã thấy điều này: chúng tôi đã tổ chức một hackathon hơn một năm rưỡi trước, và đó chính xác là trường hợp agent nói chuyện với một agent khác. Chúng phát hiện ra rằng cả hai đều là agent, và chúng đã chuyển sang một ngôn ngữ khác, và đó là một cách truyền tải thông tin hiệu quả hơn so với lời nói cổ điển. Và tôi nghĩ điều này sẽ xảy ra. Tôi hoàn toàn tin rằng câu hỏi lớn sẽ thực sự là giọng nói, liệu đó có phải là cách truyền tải thông tin khác không? Điều đó thực sự phụ thuộc vào cơ sở hạ tầng được xây dựng cho mục đích gì, và tôi nghĩ điều này sẽ định nghĩa trải nghiệm đó.

Vai Trò Của Giọng Nói và Sự Tin Cậy Trong Tương Lai

Có một câu hỏi về cách chúng ta đang suy nghĩ về nhu cầu về giọng nói trong tương lai, nơi các agent sẽ thực hiện ngày càng nhiều công việc. Về cơ bản, những trường hợp sử dụng nào mà cuộc trò chuyện của con người vẫn cần thiết?

Đầu tiên, tất cả chúng ta sẽ có rất nhiều thiết bị xung quanh mình, và sau đó là robot xung quanh chúng ta. Vì vậy, tất nhiên, giọng nói sẽ là một giao diện quan trọng để hướng dẫn và có thể tương tác với những thiết bị đó. Theo nhiều cách, tôi cảm thấy rằng chúng ta thấy rất nhiều phát triển về trí thông minh, nhưng bottleneck thực sự của tương lai sẽ là cách chúng ta giao tiếp với trí thông minh đó. Và tôi nghĩ phần giọng nói và hình ảnh sẽ là một "mở khóa" lớn để thực sự tận dụng tối đa giá trị trí thông minh đó trong các cài đặt mà hiện chưa thể thực hiện được.

Nhưng mặt khác, giá trị của tương tác giữa người với người sẽ chỉ tăng lên. Vì vậy, dù đó là các sự kiện như thế này hay các sự kiện với nghệ sĩ yêu thích của bạn, giá trị sẽ tăng lên với khả năng có giọng nói xung quanh bạn. Nhưng sự tin cậy sẽ là một phần rất lớn và là điều chúng tôi tối ưu hóa, như giữa agent và con người. Trong tương lai, nơi tất cả chúng ta sẽ có một voice agent để gọi và đặt bàn tại nhà hàng hoặc cung cấp thông tin cho cuộc hẹn chăm sóc sức khỏe. Tất cả những điều đó sẽ đòi hỏi mức độ tin cậy rất cao rằng đây là bạn và một người dùng đã được xác thực. Sẽ có một cấp độ mã hóa và giải mã cho "thật" và sau đó mã hóa và giải mã cho "có thể là con người đã chọn tham gia", và sau đó mặc định mọi thứ khác sẽ là giả mạo, điều này hơi ngược lại so với hiện nay. Bạn phát hiện AI nhưng bạn sẽ phát hiện AI được xác thực thực sự trong tương lai và giả định nó là giả mạo.

Trí Tuệ Lởm Chởm (Jagged Intelligence) Trong Âm Thanh

Andre đã nói trước đó về jagged intelligence (trí tuệ lởm chởm). Bạn có thấy những điểm kỳ lạ tương tự trong âm thanh nơi các mô hình tốt và xấu theo cách bạn có thể không mong đợi không, và chúng là gì?

Vẫn còn rất nhiều điều về mặt "xấu". Tôi nghĩ chúng ta đã nói một chút về nơi chúng ta thấy các voice agent hoạt động. Vì vậy, sự kết hợp các mô hình này cùng nhau trong cài đặt hỗ trợ hoạt động rất tốt, hoạt động đáng tin cậy. Và việc bán hàng ban đầu bắt đầu hoạt động, nhưng ngay khi bạn bắt đầu chuyển sang một tương tác cảm xúc thực sự, nó vẫn chưa hoạt động. Nó không nắm bắt được cảm xúc tốt lắm. Nó hơi chậm. Vì vậy, đó vẫn là một bước thay đổi lớn mà cần phải thực hiện.

Điều tương tự cũng sẽ áp dụng cho một lĩnh vực rất khác về mặt âm nhạc. Tôi nghĩ trong lĩnh vực âm nhạc, bạn có thể tạo ra âm nhạc sản xuất tốt. Bạn không thể tạo ra âm nhạc đứng đầu bảng xếp hạng ngay cả khi có sự đóng góp của nghệ sĩ. Tôi nghĩ điều này sẽ thay đổi trong một hoặc hai năm tới.

[transcript bị gián đoạn]

Ưu tiên đào tạo mô hình và đầu tư dài hạn

Chúng tôi cố gắng đào tạo các mô hình, xây dựng sản phẩm và một hệ sinh thái để tạo ra tác động lớn nhất cho tất cả khách hàng và người dùng của chúng tôi. Điều này, về lâu dài, sẽ tương quan với doanh thu. Vì vậy, với tầm nhìn dài hạn này, nó sẽ chỉ ở mức tối thiểu trong vài năm tới, không phải chỉ trong năm sau. Do đó, chúng tôi thường xuyên đào tạo các mô hình có thể không mang lại giá trị trong ngắn hạn. Hoặc thậm chí trước đó, chúng tôi dành rất nhiều thời gian để gán nhãn dữ liệu, không chỉ là "nội dung" của âm thanh mà còn là "cách thức" của âm thanh. Ví dụ, tôi đã sử dụng những cảm xúc nào? Giọng nói của tôi được mô tả ra sao? Bản nhạc này được mô tả thế nào?

Chúng tôi đã tập hợp một đội ngũ hiện có hơn một nghìn người, những người trước đây từng là voice coaches (huấn luyện viên giọng nói), musicians (nhạc sĩ), artists (nghệ sĩ), những người có thể giúp chúng tôi chú thích dữ liệu hậu trường. Việc này sẽ không mang lại giá trị trong 6 đến 12 tháng tới, nhưng chúng tôi tin rằng nó sẽ có giá trị trong 10, 12 đến 24 tháng tới. Và sau đó, tất nhiên, bạn cần thu thập dữ liệu mà thường không dễ dàng tiếp cận được.

Lợi thế cạnh tranh (Moat) trong các mô hình âm thanh

Một câu hỏi về lợi thế cạnh tranh (moat) trong các mô hình âm thanh từ góc độ lớp mô hình. Đâu là những phần cốt lõi có khả năng phòng thủ chính trong quá trình "làm xúc xích" để tạo ra một mô hình âm thanh tiên tiến thực sự tốt?

Speech-to-Text là Công nghệ, Text-to-Speech là Nghệ thuật

Chúng tôi thực hiện nhiều loại mô hình khác nhau. Gần đây, tôi có vinh dự được gặp Jensen (Huang) và ông ấy đã bình luận về một vài mô hình của chúng tôi. Ông ấy nói rằng các mô hình speech-to-text của chúng tôi là công nghệ, còn text-to-speech là nghệ thuật, và chúng tôi đều là những nghệ sĩ. Vì vậy, ông ấy đã trở thành một khách hàng trọn đời.

Nhưng tất nhiên, chúng tôi tin rằng có một phần nào đó sự thật trong điều này để thực sự hoàn thiện text-to-speech và khắc phục tính biểu cảm. Bạn sẽ cần phải thực sự tập trung vào không gian đó. Bạn thực sự cần tiếp cận người dùng, thu thập dữ liệu, thu thập sở thích, sử dụng chúng để fine-tune (tinh chỉnh) các mô hình.

Tính đặc thù theo lĩnh vực và Thu thập dữ liệu

Có một sự đặc thù theo lĩnh vực trong cách bạn đưa các mô hình này vào sản xuất. Trong health care (chăm sóc sức khỏe), nó rất khác so với financial services (dịch vụ tài chính), rất khác so với education (giáo dục) hoặc các experiences (trải nghiệm) khác. Đó là ở lớp mô hình. Tôi nghĩ sẽ có một lợi thế liên tục nếu bạn thực sự quan tâm đến chất lượng, việc dành thời gian cho công việc mô hình sẽ giúp bạn duy trì lợi thế đó.

Xây dựng hệ sinh thái sản phẩm và agentic workflow

Nhưng theo quan điểm của bạn, các mô hình và nhiều trường hợp sử dụng sẽ chỉ xem một mô hình như một phần nhỏ trong ngăn xếp phần mềm của họ. Và đó là nơi chúng tôi dành rất nhiều thời gian, vượt ra ngoài nghiên cứu về phía sản phẩm, về cách bạn hiểu vấn đề của người dùng, workflow (luồng công việc) mà họ cần.

Voice agents (tác nhân giọng nói) là sự kết hợp các mô hình âm thanh với kiến thức và đưa nó vào bên trong hệ thống; cách bạn đưa nó ra bên ngoài với telephony systems (hệ thống điện thoại) để bạn có thể tương tác qua các kênh; cách bạn đánh giá, thử nghiệm và giám sát.

Và sau đó, khi bạn tạo ra, dù là trong không gian agent (tác nhân) hay không gian creative (sáng tạo), đó là một sự hiểu biết, bạn xây dựng hệ sinh thái. Và đó là điều chúng tôi hy vọng xây dựng trên 11 Labs, một nơi mà dù là distribution (phân phối) và brand (thương hiệu) mà mọi người có thể tin tưởng, platform (nền tảng) nơi bạn có sẵn một bộ công việc để bắt đầu, dù đó là một template (mẫu) để tạo một agent, template để tạo một workflow trong không gian sáng tạo, hay đó là một giọng nói. Và chúng tôi hiện có hơn 20.000 giọng nói mà mọi người đã tạo, đóng góp, mà bạn có thể sử dụng trên các language styles (phong cách ngôn ngữ) và giọng nói khác nhau. Và tôi nghĩ đó sẽ là một lớp ngày càng quan trọng về cách bạn có thể đáp ứng sự đa dạng đó, giúp mọi người dễ dàng bắt đầu và thực sự hiểu workflow đó.

Lời cảm ơn và Kết thúc

Được rồi, tôi sẽ chuyển lại cho Konstantin Mali. Cảm ơn bạn. Andrew, cảm ơn vì đã là đối tác. Vâng. [tiếng vỗ tay] Tuyệt vời. [tiếng reo hò] Cảm ơn các bạn.

Góp ý / Báo lỗiPhát hiện sai sót hoặc có ý tưởng cải thiện?