Bỏ qua đến nội dung chính

Why Data Is the Real AI Bottleneck: Flapping Airplanes' Ben and Asher Spector

TL;DR

  • Tương lai của AI nằm ở hiệu quả dữ liệu, giúp mở rộng ứng dụng AI sang các lĩnh vực kinh tế có lượng dữ liệu hạn chế, vượt ra ngoài các thị trường đã bão hòa dữ liệu như tìm kiếm và lập trình.
  • Việc tập trung vào hiệu quả dữ liệu là rất quan trọng vì tài nguyên tính toán dễ mở rộng hơn nhiều so với việc thu thập dữ liệu chất lượng cao, đồng thời giúp dân chủ hóa và tăng cường cạnh tranh trong ngành AI.
  • Flappy Airplanes tiếp cận mục tiêu này bằng cách khám phá các nguyên thủy phần cứng mới và xây dựng các hệ thống tùy chỉnh để kiểm soát chi tiết GPU, cho phép phát triển các thuật toán hiệu quả dữ liệu mà các framework học máy truyền thống không thể thể hiện hiệu quả.

Điểm chính

  • Hiệu quả Dữ liệu mở khóa các thị trường mới: Trong khi LLM đã thành công ở các lĩnh vực giàu dữ liệu, nhiều ngành khác của nền kinh tế (robotics, giao dịch, khoa học) có lượng dữ liệu hạn chế và cần các mô hình hiệu quả dữ liệu để khai thác tiềm năng AI.
  • Tính kinh tế của Tài nguyên so với Dữ liệu: Tài nguyên tính toán ngày càng rẻ hơn và dễ mở rộng theo cấp số nhân, trong khi việc thu thập dữ liệu chất lượng cao rất phức tạp, phân mảnh và bị ràng buộc bởi quy định, khiến hiệu quả dữ liệu trở thành chiến lược bền vững hơn.
  • Thúc đẩy sự tham gia rộng rãi vào AI: Dữ liệu là một "hào chắn" lớn trong AI hiện nay; hiệu quả dữ liệu sẽ giúp nhiều công ty và nhà nghiên cứu hơn có thể đào tạo các mô hình frontier, thúc đẩy cạnh tranh và đổi mới.
  • Vượt qua giới hạn của Framework hiện tại: Các framework học máy phổ biến hiện nay tổng hợp một mô hình lập trình đơn luồng, gây khó khăn và bất hiệu quả tiệm cận khi thực hiện các tác vụ GPU phức tạp, chi tiết hoặc được đường ống sâu.
  • Khám phá Nguyên thủy Phần cứng mới: Để phát triển các thuật toán AI mới và hiệu quả dữ liệu, cần phải tìm kiếm các cách thức mới để tương tác với phần cứng (GPU) vượt ra ngoài khả năng thể hiện của các framework hiện có.
  • Xây dựng Hệ thống tùy chỉnh để kiểm soát GPU: Flappy Airplanes phát triển một framework nội bộ dựa trên máy ảo để kiểm soát toàn bộ GPU, cho phép họ thực hiện các hoạt động tùy chỉnh và tối ưu hóa hiệu suất cho các khối lượng công việc đặc biệt.
  • Đồng tối ưu hóa Hệ thống và Thuật toán: Hiệu quả dữ liệu cao nhất đạt được thông qua việc đồng thời phát triển cả hệ thống mới (cho phép sử dụng chi tiết phần cứng) và các thuật toán mới (được thiết kế để tận dụng những khả năng hệ thống này).

Từ vựng

  • Hiệu quả dữ liệu — Data efficiency
  • Mô hình ngôn ngữ lớn (LLMs) — Large Language Models
  • Tài nguyên tính toán — Compute resources
  • Nguyên thủy phần cứng — Hardware primitives
  • Sử dụng chi tiết (GPU) — Fine-grained use (of GPU)
  • Framework học máy — Machine learning framework
  • Mô hình lập trình đơn luồng — Single-threaded programming model
  • Máy ảo — Virtual machine (VM)
  • Đồng tối ưu hóa — Co-optimization
  • Hào chắn (trong AI) — Moat (in AI)

Nội dung chi tiết

Giới thiệu Diễn giả và Công ty

Xin mời hai diễn giả nổi bật, đầu tiên là Ben và Asher, hai anh em tài năng. Vâng, xin mời họ lên sân khấu. Họ là những nhà sáng lập của swimming submarines. Chờ đã, không phải. Chờ một chút, flapping airplanes. À, và chúng tôi rất hào hứng được nghe về hiệu quả dữ liệu (data efficiency). Cảm ơn rất nhiều. Cảm ơn Konstantin.

  • [tiếng vỗ tay]

Được rồi, vâng. Rất vui được có mặt ở đây. Cảm ơn vì đã mời chúng tôi. Chúng tôi rất hào hứng chia sẻ lý do tại sao tương lai là hiệu quả dữ liệu. Vậy thì, hãy bắt đầu thôi.

Trước tiên, tôi nghĩ cần giới thiệu một chút. Về nền tảng của mình, tôi đã dành 3 năm làm PhD, đi sâu vào các nhân kernel, viết các hệ thống GPU cấp thấp, trước khi giúp khởi nghiệp Flappy. Và tôi cũng phải nói thêm rằng, tôi từng giúp khởi nghiệp một vườn ươm tên là Prod, làm việc với nhiều công ty đã phát triển tốt. Đó cũng là một phần trong nền tảng của tôi.

Tuyệt vời. Còn tôi là Asher. Nếu bạn chưa nhận ra, tôi là anh trai lớn hơn, khôn ngoan hơn và kém đẹp trai hơn một chút của Ben. Trước đây, tôi cũng là PhD tại Stanford, từng làm việc tại Cursor, Mercor. Cuối cùng, nhà đồng sáng lập thứ ba của chúng tôi là Aiden Smith. Anh ấy là một Thiel fellow. Hiện tại anh ấy đang bận làm việc. Nhưng anh ấy đã dành 3 năm di chuyển liên tục giữa trường đại học và phòng thí nghiệm của chúng tôi. Vì vậy, anh ấy hiểu rất nhiều về cả bộ não và machine learning.

Flappy Airplanes: Phòng thí nghiệm AI, không phải Hàng không

Trước khi chúng tôi bắt đầu một cách nghiêm túc, tôi muốn làm rõ một số nhầm lẫn. Chúng tôi ra mắt công ty 3 tháng trước. Chúng tôi rất vui mừng khi nhận được nhiều liên hệ, nhưng một lượng đáng ngạc nhiên trong số đó lại đến từ ngành hàng không. Bạn biết đấy, mọi người cố gắng bán cho chúng tôi những thứ như đường băng – không phải đường băng theo nghĩa venture capital mà là đường băng đúng nghĩa đen. Linh kiện máy bay, hầm gió, v.v. Vì vậy, tôi muốn tuyên bố rõ ràng một lần và mãi mãi: chúng tôi không phải là một công ty máy bay, chúng tôi là một phòng thí nghiệm AI, và hy vọng điều đó sẽ trở nên rõ ràng hơn vào cuối buổi nói chuyện này.

Tổng quan Buổi nói chuyện

Được rồi, tuyệt vời. Đầu tiên là một dàn ý nhanh. Trong buổi nói chuyện này, chúng tôi sẽ cho bạn biết hai điều. Thứ nhất, luận điểm của chúng tôi về lý do tại sao đây là một vấn đề thực sự quan trọng. Và thứ hai, chúng tôi sẽ kể cho bạn một chút về cách tiếp cận của chúng tôi, kết hợp cả công việc về hệ thống và công việc về thuật toán.

Luận điểm: Tương lai của Hiệu quả Dữ liệu

Vậy thì, về phía luận điểm trước. Nếu chúng ta nhìn vào tình hình thế giới hiện tại, các mô hình ngôn ngữ lớn (LLMs) đã trở nên cực kỳ giỏi trong một vài nhiệm vụ thực sự có giá trị. Ví dụ: tìm kiếm (search), lập trình (coding). Cùng nhau, đây là một thị trường trị giá ít nhất một nghìn tỷ đô la có thể tiếp cận được ở đây. Một phần lớn lý do tại sao chúng lại giỏi các nhiệm vụ này đến vậy – và điều này có liên quan đến những gì Andre, tôi nghĩ, đã nói sáng nay – là vì đây là những nhiệm vụ được cung cấp rất nhiều tài nguyên về lượng dữ liệu có sẵn cho chúng. Đối với tìm kiếm, về cơ bản đó là toàn bộ internet. Đối với lập trình, đó là một phần lớn của internet. Lập trình cũng là một môi trường rất thân thiện, vì rất dễ tạo ra hàng núi dữ liệu tổng hợp nếu bạn muốn.

Vì vậy, khi chúng ta nói về hiệu quả dữ liệu, câu hỏi chúng tôi đang đặt ra là: liệu có thể đạt được những khả năng này với ít dữ liệu hơn nhiều không? Trực giác cho thấy điều đó có thể. Bạn biết đấy, con người có thể trở nên khá giỏi lập trình với, có lẽ, ít dữ liệu hơn 10.000 hoặc 100.000 lần so với những gì các mô hình hiện tại cần. Vậy đây là câu hỏi cốt lõi. Và một lý do tại sao điều này quan trọng là nếu chúng ta nhìn về tương lai, có rất nhiều lĩnh vực khác của nền kinh tế mà lượng dữ liệu có sẵn ít hơn nhiều. Ví dụ, Jim đã nói sáng nay về việc trong robotics, có rất nhiều công việc phải thực hiện để cố gắng tạo dữ liệu. Nó phức tạp hơn nhiều so với trong lập trình và tìm kiếm. Trong giao dịch, chỉ có bấy nhiêu dữ liệu tài chính thôi. Khám phá khoa học, rõ ràng là rất ít dữ liệu. Nhưng tiềm năng ở đó là vô hạn. Và quan trọng nhất trong tất cả, tất nhiên, là chuỗi cung ứng máy nướng bánh mì đầu cuối đến đầu cuối (end-to-end). Lý do tôi đưa ra điều này không phải vì bản thân nó; mà là vì những gì nó đại diện, đó là có hàng chục nghìn những thứ tương tự như vậy tạo nên nền kinh tế rộng lớn. Và nền kinh tế rộng lớn không chỉ giống như tìm kiếm và lập trình; nó giống như rất nhiều thứ thực sự không được cung cấp đủ tài nguyên.

Vâng, Ben đã đưa ra cho bạn một lý do kinh tế để tin rằng tương lai là hiệu quả dữ liệu. Tôi nghĩ một lập luận thứ hai là tài nguyên tính toán (compute) thực ra dễ mở rộng hơn dữ liệu. Chúng ta đều biết rằng FLOPS ngày càng rẻ hơn theo cấp số nhân theo thời gian. Và tôi nghĩ rằng dữ liệu có lẽ không trở nên rẻ nhanh như tài nguyên tính toán, mặc dù nó vẫn đang rẻ hơn. Tôi nghĩ, lý do thứ hai là việc thu thập dữ liệu chất lượng frontier rất phức tạp. Thị trường tài nguyên tính toán đồng nhất hơn thị trường dữ liệu. Giống như, bạn biết đấy, Greg đã nói với chúng tôi sau khi GPT ra mắt, họ có thể cố gắng mua tất cả tài nguyên tính toán. Và không có nhà cung cấp dữ liệu tập trung nào cả. Nếu bạn muốn đi vào nền kinh tế và thu thập các tác vụ thuộc long tail, bạn phải đối phó với các quy định, bạn phải đàm phán với các doanh nghiệp về điều khoản sử dụng (terms of use). Điều đó thực sự rất khó chịu. Vì vậy, kết quả là, nếu bạn có thể tạo ra một mô hình hiệu quả dữ liệu hơn một nghìn lần, tôi nghĩ nó sẽ dễ triển khai hơn một nghìn lần.

Hiệu quả Dữ liệu và Sự Tham gia Rộng rãi vào AI

Đó là hai lý do kinh tế mà chúng tôi nghĩ rằng hiệu quả dữ liệu là quan trọng. Lý do cuối cùng thực ra mang tính triết học. Tôi nghĩ rằng, nếu bạn nhìn vào thế giới ngày nay, không có nhiều công ty có thể đào tạo các mô hình AI. Và một phần của điều này là do sự tập trung của tài nguyên tính toán. Nhưng tôi nghĩ nó cũng là do sự tập trung của dữ liệu. Giống như, tôi đã nghe tin về Neo Labs, khi cố gắng tạo ra các khả năng mới, họ theo đúng nghĩa đen đã mua lại các hiệu sách đang gặp khó khăn để tìm tất cả dữ liệu mà họ có thể tìm thấy. Họ đến các thư viện hiếm để tìm tất cả các ngóc ngách dữ liệu nhỏ mà bạn cần để thực sự tạo ra một mô hình frontier. Và tôi nghĩ rằng trong một thế giới hiệu quả dữ liệu, các công ty thực sự có thể tham gia rộng rãi hơn vào cuộc cách mạng AI. Giống như, chúng tôi đã nghe hôm nay rằng trong cuộc thăm dò về hào chắn (moat) trong thế giới AI, câu trả lời phổ biến nhất là dữ liệu. Nếu điều đó đúng, thì hiệu quả dữ liệu là thứ thực sự cho phép cạnh tranh rộng rãi hơn. Vì vậy, tôi nghĩ nếu bạn quan tâm đến hình thái của thế giới sắp tới, bạn thực sự nên quan tâm đến hiệu quả dữ liệu vì nó điều chỉnh ai có thể thực sự tham gia vào những phần nào của nền kinh tế AI.

Cách tiếp cận của Flappy Airplanes: Khám phá các Nguyên thủy Phần cứng Mới

Tuyệt vời. Bây giờ chúng ta sẽ nói về cách tiếp cận của chúng tôi. Mục tiêu của chúng tôi là thiết kế AI hiệu quả dữ liệu (data-efficient AI). Chúng tôi thiết kế các thuật toán cho việc này. Chúng tôi sẽ không nói về chúng vì chúng là sở hữu trí tuệ (IP) cốt lõi của chúng tôi. Nhưng tôi sẽ cho bạn biết về một khía cạnh quan trọng trong cách tiếp cận của chúng tôi, đó là cách chúng tôi cố gắng tìm kiếm ở những nơi mới. Giống như, nếu bạn muốn có những khả năng mới, bạn có thể tìm thấy chúng ở đâu?

Luận điểm của chúng tôi là, về cơ bản, nếu bạn muốn phát triển các thuật toán mới, bạn nên tìm kiếm các nguyên thủy mới để tương tác với phần cứng. Có một số thứ mà GPU có thể làm hiệu quả. Và sau đó có một tập hợp nhỏ hơn những thứ mà các framework hiện tại như PyTorch chẳng hạn, có thể thể hiện hiệu quả. Và, bạn biết đấy, vòng tròn màu xám đó, chúng ta đã thấy rất nhiều nghiên cứu về vòng tròn đó. Chúng ta thực sự biết những loại thuật toán nào hoạt động. Nhưng nếu bạn đang tìm kiếm những khả năng mới, bạn có thể muốn tìm kiếm ở những nơi mới này. Và đó là nơi chúng tôi hoạt động tại Flappy Airplanes. Đó là điều chúng tôi cố gắng làm. Và bạn biết đấy, Ben sẽ nói chi tiết hơn một chút sau này, ví dụ, về những thứ như fine-grainedness, những thứ thực sự khó thực hiện với các framework hiện tại, nhưng một GPU thực sự có thể làm được.

Lịch sử cho thấy đây là một lựa chọn tốt, nói một cách công bằng. Rất nhiều sự phát triển của machine learning trong 15, 20, thậm chí 100 năm qua, thực sự là những nguyên thủy mới để tương tác với phần cứng. Không nhất thiết phải thiết kế chip mới, điều này cũng quan trọng, mà chỉ đơn giản là tìm cách tận dụng tối đa công nghệ hiện có đã phổ biến.

Khám phá Kỹ thuật: Vượt qua Giới hạn Framework

Vâng, tôi đoán một chút ngữ cảnh (context) là cần thiết. Trong quá trình học PhD của tôi, tôi đã thực hiện một số công việc ban đầu về mega kernels, nhằm mục đích khiến các GPU thực hiện những điều kỳ lạ. Tại Flappy, tôi có thể nói rằng chúng tôi đang đi xa hơn theo những hướng tương tự về mặt tinh thần, cụ thể là cố gắng tận dụng tối đa GPU theo những cách chưa từng được thực hiện trước đây. Điều này đã mang lại rất nhiều niềm vui. Vì vậy, tôi thực sự khuyên bạn nên thử nếu bạn thích mày mò với phần cứng. Và tôi đoán một phần lý do tôi hào hứng trong buổi nói chuyện này là vì, bạn biết đấy, đây nói chung là một diễn đàn khá cấp cao, nhưng tôi thực sự muốn đi sâu vào chi tiết của một số thứ vì tôi nghĩ nó thú vị.

Vì vậy, nếu chúng ta nhìn vào cách các hệ thống hiện tại hoạt động – và điều này sẽ hơi trừu tượng một chút, nhưng tôi hy vọng khái niệm sẽ được truyền tải. Điều làm cho các machine learning frameworks hiện tại dễ sử dụng là chúng tổng hợp một mô hình lập trình đơn luồng (single-threaded programming model) từ các bộ xử lý rất song song. Về cơ bản, khi bạn viết PyTorch, bạn viết matmul, rồi attention, rồi matmul, rồi RMS norm. Và bên dưới, có đủ loại sự biến đổi xảy ra, nơi phần mềm điều phối nó song song trên một tập hợp các bộ xử lý rất song song. Nhưng dù sao, đối với lập trình viên, điều này trông rất tự nhiên.

Nhưng điều gì sẽ xảy ra nếu bạn muốn chạy những thứ trông như thế này? Hoặc có lẽ bạn muốn chạy những thứ trông như thế này? Đột nhiên, những loại này không dễ dàng thể hiện trong các framework hiện tại. Vì vậy, một điều tôi rất hào hứng muốn giới thiệu, như một chút hé lộ, là framework nội bộ của chúng tôi mà chúng tôi sử dụng, được xây dựng dựa trên một máy ảo (virtual machine) mà về cơ bản chiếm quyền kiểm soát toàn bộ GPU, và chúng tôi tự mình làm mọi thứ chúng tôi muốn trên đó. Trong trường hợp cụ thể này, đây không phải là một khối lượng công việc (workload) thực tế mà tôi đang trình bày. Đây là một loại thứ được cách điệu hóa (stylized thing), tương tự, nhưng là một ví dụ về một thứ cũng bất hiệu quả tiệm cận (asymptotically inefficient) khi chạy trong PyTorch. Đây là một batch rất nhỏ, một loại vòng lặp huấn luyện (training loop) kiểu hogwild được đường ống sâu (deeply pipelined). Đây là loại thứ rất khó thực hiện với các framework hiện tại.

Vì vậy, điều mà tôi muốn truyền tải ở đây là khi bạn xây dựng những loại hệ thống mới này, bạn cho phép các thuật toán mới. Nhiều thuật toán này, chúng tôi nghĩ, thực sự rất phù hợp với các vấn đề về hiệu quả dữ liệu. Đây là lý do tại sao chúng tôi quan tâm đến nó. Và đó chính là loại đồng tối ưu hóa (co-optimization) những thứ đó mà chúng tôi thấy thực sự thú vị.

Lời kêu gọi hành động và Tóm tắt

Tuyệt vời. Vậy là chúng ta gần hết thời gian rồi. Tôi chỉ thực sự có một điều nữa muốn nói, đó là nếu bạn thấy điều này thú vị, xin hãy đến nói chuyện với chúng tôi. Bạn biết đấy, chúng tôi làm việc với rất nhiều người đã huấn luyện các mô hình lớn trước đây, nhưng chúng tôi cũng đang cố gắng làm những điều mới mẻ, sáng tạo. Chúng tôi đang cố gắng thay đổi mô hình điện toán (computing paradigm). Và chắc chắn kinh nghiệm của chúng tôi khi chứng kiến một số công ty mà Ben đã giúp ươm tạo là, bạn biết đấy, những người sáng tạo với nền tảng độc đáo thực sự có thể làm những điều tuyệt vời và thay đổi thế giới. Vì vậy, nếu bạn có nền tảng như vậy, xin hãy đến trò chuyện với chúng tôi.

Được rồi, tôi đoán có lẽ là một bản tóm tắt rất nhanh, và sau đó tôi nghĩ chúng ta có lẽ có thời gian cho một câu hỏi hoặc hơn. Trước hết, hiệu quả dữ liệu. Nếu bạn quan tâm đến hình thái của thế giới sắp tới, nếu bạn quan tâm đến việc triển khai rộng rãi AI vào nền kinh tế, bạn nên quan tâm đến việc làm cho các mô hình hiệu quả dữ liệu hơn nhiều. Và phát hiện của chúng tôi là việc xây dựng các hệ thống mới để cho phép sử dụng chi tiết (fine-grained use) hơn các GPU thực sự rất phù hợp với việc xây dựng những loại hệ thống này. Và như Asher đã nói, nếu bạn thấy điều này thú vị, xin hãy đến nói chuyện với chúng tôi. Cảm ơn tất cả mọi người. Cảm ơn.

  • [tiếng vỗ tay]
Góp ý / Báo lỗiPhát hiện sai sót hoặc có ý tưởng cải thiện?