Talian Khidmat
Sebab bagi ramalan yang begitu berani ialah, dengan keluaran siri produk AI yang tercanggih baru-baru ini, rasa krisis dalam kalangan pengaturcara telah menjadi semakin kuat. Evolusi AI telah menyebabkan banyak tugas dalam pengekodan boleh diganti.
Terutama, Claude 3.7, yang sekali lagi telah menolak sempadan keupayaan pengekodan, dan Windsurf's Wave 4 adalah contoh utama. Sebelum ini, model o3 dan Kursor OpenAI, yang telah menjadi klasik dalam kalangan pembangun bebas, adalah produk penanda aras yang telah menyebabkan beberapa orang berkata: pekerjaan pengaturcara berisiko.
Perlu diserlahkan bahawa dalam penarafan Penilaian Pengekodan Agen yang terkini, Sonnet 3.7 mencapai skor 67%, menduduki tempat pertama dalam kalangan semua model dalam penilaian kecekapan pembangun junior. Tempat kedua dan ketiga, GPT-4.5 dan Sonnet 3.5, juga hampir di belakang, kedua-duanya melebihi 60%. Ini menunjukkan keupayaan pengaturcaraan yang menggerunkan model ini.
Pada hakikatnya, kedua-dua model utama mempunyai fokus yang sedikit berbeza dalam pengaturcaraan. GPT-4.5 cemerlang dalam tugas yang melibatkan seni bina dan interaksi silang sistem, manakala Claude 3.7 Sonnet berprestasi lebih baik dalam pengekodan mentah dan penyuntingan kod.
Sekadar menyatakan skor mungkin tidak secara intuitif menyampaikan keupayaan model besar ini, jadi mari kita gunakan contoh praktikal untuk menggambarkan.
Sebelum ini, model o3 mencapai skor Elo sebanyak 2727, sepadan dengan kedudukan ke-175 dalam pertandingan ujian pengaturcaraan manusia. Ini serupa dengan peperiksaan kemasukan kolej di mana tiada siapa yang mengetahui soalan terlebih dahulu, jadi tidak ada kemungkinan model telah mempraktikkan soalan terlebih dahulu.
Pertandingan ini melibatkan sejumlah 168,076 pengaturcara di seluruh dunia, dan kedudukan tempat ke-175 o3 dalam 0.1% peserta teratas (1 - 175/168,076 = 99.9%). Dalam erti kata lain, o3 telah pun mengatasi 99.9% pengaturcara di dunia dalam pertandingan pengaturcaraan, dan Claude 3.7 Sonnet berkemungkinan berprestasi lebih baik.
Pengekodan AI bukan sahaja telah mencapai lonjakan yang ketara pada peringkat model, tetapi terdapat juga peningkatan besar dalam pembangunan produk.
Trae versi luar negara ByteDance telah menyepadukan model besar antarabangsa seperti Claude-3.7-Sonnet dan GPT-4o, dan juga mempunyai keupayaan IDE. Matlamat untuk membolehkan pemula untuk membuat kod hampir dapat dicapai, seterusnya mengurangkan halangan kemasukan untuk pengaturcara.
Paling penting, versi luar negara Trae adalah percuma sepenuhnya, membolehkan pengguna mengakses semua cirinya tanpa sebarang kos. Sebaliknya, Kursor memerlukan langganan berbayar berharga $20 sebulan.
Seorang pengguna di luar negara menggunakan Trae dan Claude 3.7 terbina dalamnya untuk menjana kod secara automatik bagi dunia animasi 3D dengan hanya lakaran reka bentuk dan gesaan yang sangat mudah.
Malah ada yang memperoleh keuntungan sebenar daripada ini. Seorang guru teknologi di luar negara bernama Pieter Levels membangunkan permainan sepenuhnya menggunakan AI dalam masa 3 jam sahaja. Dalam tempoh 13 hari selepas pelancarannya, permainan itu telah memperoleh $67,000, bersamaan dengan hampir 500,000 RMB. Malah Elon Musk memberinya tanda tangan!
Keupayaan model besar dalam pengekodan semakin bertambah baik dan menghampiri prestasi peringkat manusia dalam beberapa aspek:
Sonnet 3.5 boleh mengeluarkan 200 baris kod, manakala Sonnet 3.7 kini boleh mengeluarkan 1,000 hingga 1,500 baris, menjadikannya model pertama yang mampu menjana kod yang boleh dipercayai merangkumi ribuan baris.
Pada masa hadapan, banyak pengaturcaraan yang membosankan dan berulang tidak memerlukan menaip baris demi baris, dan banyak jawatan pengaturcara peringkat permulaan akan diganti. Mempraktikkan Leetcode juga akan kehilangan kepentingannya. Rakan yang dahulunya bergantung pada Sider untuk bantuan pengekodan, membelanjakan lebih seribu yuan setiap tahun, tidak lagi memerlukannya dan kini secara langsung menggunakan model besar.

Satu lagi keupayaan kritikal ialah Penskalaan Tindakan, yang membolehkan panggilan fungsi berterusan dan penggunaan alat, berulang berdasarkan maklum balas alam sekitar sehingga masalah terbuka diselesaikan. Potensi evolusi ini tidak boleh dipandang remeh pada masa hadapan.
Sudah tentu, beberapa rakan bertanya: Bolehkah AI membincangkan keperluan dengan pelanggan? Bolehkah AI berdebat dengan PM? Bolehkah AI dipersalahkan?
Selepas keluaran Claude 3.7, seseorang berkata bahawa pekerjaannya mungkin berisiko. Syarikat penyumberan luarnya telah pun memberhentikan beberapa pekerja sepanjang tahun lalu kerana AI dan faktor kompleks lain.
Tidak dapat dinafikan bahawa AI masih belum wujud lagi, tetapi produk seperti Devin sudah pun menunjukkan keupayaan Ejen AI tertentu. Keupayaan mereka untuk memahami dan melaksanakan tugasan semakin bertambah baik, dan era di mana semua orang boleh menjadi pengurus produk semakin hampir.




粤公网安备44030002007346号