runesleo

vip
Usia 8.5 Tahun
Tingkat Puncak 6
Belum ada konten
Banyak orang melihat bahwa kejadian dunia nyata sudah berakhir, lalu judul pasar tertulis sangat jelas—bahkan harga yang ditampilkan mendekati 0 atau 1—sehingga mereka mengira pasar Polymarket ini sudah resmi terselesaikan secara final.
Namun, sinyal-sinyal itu sendiri sebenarnya tidak bisa membuktikan bahwa pasar sudah benar-benar diselesaikan final. Judul hanya mendeskripsikan pertanyaan, dan harga yang ditampilkan juga hanya mencerminkan harga saat ini di pasar tersebut.
Pertimbangan saya hanya membatasi dengan satu kalimat: dulu lewati enam pertanyaan ini. Jika ada salah satu yang tidak bi
Lihat Asli
  • Hadiah
  • Komentar
  • Posting ulang
  • Bagikan
Saya memberi kebutuhan UI yang sama ke model yang sama sebanyak 9 kali: tanpa Skill, apple-design, ui-ux-pro-max masing-masing 3 kali.
Hasilnya membuat saya mengubah cara menilai: satu set Skill yang sama bisa sekali bagus, sekali gagal.
Setelah 9 hasil tersebut dianonimkan lalu diberikan ke dua orang untuk menilai secara independen, rata-rata untuk tiga kelompok adalah:
apple-design 91,3
ui-ux-pro-max 89,0
tanpa Skill 85,8
Tapi ketiganya juga tidak mencapai 3/3 tanpa cacat.
apple-design dan tanpa Skill masing-masing punya satu kejadian tombol utama di halaman detail ponsel penye
Lihat Asli
post-image
  • Hadiah
  • Komentar
  • Posting ulang
  • Bagikan
Kegagalan paling berbahaya dalam workflow AI bukan langsung error.
Yang jatuh adalah model utama, cadangannya juga gagal,
tetapi sistem tetap mengeluarkan rangkaian hasil yang tampak lengkap, membuat orang mengira semuanya sudah selesai.
Saya pernah mengalaminya: saat pemrosesan informasi harian, model utama terpotong pada 60 detik, cadangan juga tidak berhasil, namun akhirnya tetap mendapatkan sebuah teks ekstraksi yang tampak rapi.
Masalahnya bukan pada “ganti jalur dan coba lagi”, melainkan setelah ganti jalur, tidak ada yang menjelaskan dengan jelas.
Belakangan saya menambahkan tiga bukti
Lihat Asli
post-image
  • Hadiah
  • Komentar
  • Posting ulang
  • Bagikan
Bagaimana membangun secara terbuka (in public)?
Hari ini, AI membuat saya kerja dari pagi sampai malam—mendorong tugas, riset, skrip, dan antrian jauh ke depan, tapi di X tetap saja tidak ada banyak hal yang bisa diposting. Sistem kontennya seperti tidak memilih topik sama sekali.
Pada tanggal 16, saya memublikasikan 8 potongan konten; pada tanggal 17, saya melakukan lebih banyak kerja nyata, namun pasokan justru turun dengan jelas.
Karena itu, saya membuat Work → Surface v1.
Ini lulus 19/19 pengujian, serta membaca dan memverifikasi 99 live task card. Saat ini hanya ada satu reusable object y
Lihat Asli
post-image
  • Hadiah
  • Komentar
  • Posting ulang
  • Bagikan
Baru saja saya memindai 14 market MLB moneyline di Polymarket dan Kalshi, semuanya, memakai pengumpul baca-saja yang saya rakit sendiri. 14/14 match semuanya cocok; tanggal, tim, dan pertandingan spesifik di tiap market juga bisa dipetakan dengan tepat.
Harga tengah hasil padanan di kedua platform, selisih absolutnya selalu antara 0 sampai 2,0 poin persentase. Kalau membeli hasil yang berlawanan di kedua platform, biaya total sebelum fee termurah pun hanya pas 1,00; belum menghasilkan profit.
Setelah benar-benar mengestimasi biaya di kedua sisi berdasarkan taker fee yang dipublikasikan, estima
KALSHI-7,33%
Lihat Asli
post-image
  • Hadiah
  • Komentar
  • Posting ulang
  • Bagikan
一个人 + AI 到底能干多少活?
很多人以为关键是多开几个 agent,让它们并行跑。结果真正决定你每天能交出多少东西的,往往是几件更基础的事。
任务立卡
超过 10 分钟的活,我现在不会直接丢给 AI 就开工,而是先花几分钟写一张轻量卡,写清楚目标、边界、验收标准和最多试几次。AI 必须按卡上的标准做到位才算完成,不能自己觉得「差不多」就交。卡存成 JSON 文件,关掉聊天窗口、换模型、第二天回来,都能直接读着继续。
没有这张卡,活很容易做到一半就糊弄过去,或者永远停在「再改改」。
多模型按活分工
我不会让同一个模型从头包到尾。Claude 主要负责判断和总控方向,Codex 用来做交叉验证和技术审,Cursor 接 spec 已经说清楚的工程实现,Grok 专注写公开内容的正文。切换是按阶段,而不是每轮都重新挑。不是谁便宜就用谁,而是看这个阶段哪个模型的水平能把质量打到该有的样子。
用错模型,后面返工的时间比省下的还多。
状态全部写进文件
任务进度、决策理由、交接要点,我几乎不留在聊天记录里。全部写到仓库的 Markdown 和 JSON 文件里,作为唯一事实来源。新开一个会话,或者直接换一个模型,先读这些文件就知道现在到哪一步了。聊天窗口随时能关,系统状态不会丢。
靠聊天窗口记东西,迟早会因为窗口重置或者模型换了而断掉。
质量门 + 数据回收环
内容发之前要先过质量门。只有
  • Hadiah
  • Komentar
  • Posting ulang
  • Bagikan
Ini bisa diterima?! Cursor, Codex, dan Claude berturut-turut langsung melipatgandakan pemakaian model, atau mereka mereset kuota.
Persaingan antar vendor—pengguna diuntungkan 😁
Lihat Asli
  • Hadiah
  • Komentar
  • Posting ulang
  • Bagikan
Setelah ronde pertama meme di Robinhood Chain mengalami kenaikan luas, pengujian tekanan yang sesungguhnya baru dimulai untuk pertama kalinya.
Beberapa hari lalu saya ikut berpartisipasi dan terus memantau sekumpulan koin ini. Saat saya menulis ini, $CASHCAT sudah turun dari puncak senilai sekitar 200 juta dolar AS kembali ke kisaran 120 juta dolar AS, turun sekitar 31% dalam 24 jam; $VEX turun sekitar 21%, $4.663 turun sekitar 83%. Namun ini bukan berarti semua koin ambruk bersama. $MARIAN masih naik dalam 24 jam terakhir, hanya saja dalam satu jam terakhir juga mulai mengalami penurunan y
MEME0,05%
Lihat Asli
post-image
  • Hadiah
  • Komentar
  • Posting ulang
  • Bagikan
Saat menggunakan AI untuk membantu menulis, meneliti suatu masalah, atau mengambil keputusan, sekarang saya terbiasa bertanya ke beberapa model sekaligus.
Tapi ini bukan sekadar menanyakan beberapa kali, atau memilih jawaban mana yang terdengar lebih didukung banyak orang.
Nilai sesungguhnya ada pada membuat berbagai model menilai secara independen, mengungkap perbedaan pendapatnya, lalu kembali ke bukti awal untuk memverifikasinya.
Baru-baru ini saya menjalankan proses ini lagi, dan baru sadar bahwa sebelumnya saya hampir melewatkan langkah paling penting. Saya mengira ketiga model dilibatkan
Lihat Asli
post-image
  • Hadiah
  • Komentar
  • Posting ulang
  • Bagikan
Pernah nggak kalian mengalami model yang tiba-tiba menjawab pertanyaan yang sebenarnya tidak kalian tanyakan sama sekali? Awalnya aku mengira Claude Ultra lagi drift.
Ternyata setelah dicek, di harness yang aku buat sendiri, ada pengguna kedua yang tidak terlihat.
Hook latest-intent yang semula dipakai untuk mencegah drift, malah membuat notifikasi tugas dari Subagent terbaca sebagai instruksi baru milikku. Ini sudah dikonfirmasi sebagai salah deteksi di log.
Setidaknya kali ini, di sistem kompleks buatan sendiri di mesin lokal, aku menemukan sumber kontaminasi yang pasti. Fragmen tugas lama,
Lihat Asli
  • Hadiah
  • Komentar
  • Posting ulang
  • Bagikan
Ingin membuat Codex Ultra tidak terlalu banyak menghabiskan kuota, tetapi juga tidak menumpuk sistem pembagian kerja yang kompleks hanya untuk menghemat Token.
Saya baru saja melakukan eksperimen minimal: model utama tetap GPT-5.6 Sol Ultra, dengan tugas hanya untuk penilaian yang rumit, pemecahan tugas, dan verifikasi akhir. Pencarian referensi, pemindaian kode, dan pekerjaan sejenis diserahkan ke Terra Medium yang lebih cepat dan lebih hemat, dengan akses baca saja tanpa mengubah apa pun; untuk tugas yang jelas batasnya dan jalur eksekusinya pasti, langsung diberikan ke Sol Medium; bagian ya
Lihat Asli
post-image
  • Hadiah
  • Komentar
  • Posting ulang
  • Bagikan
Setelah komputer Mac dipakai cukup lama, desktopnya dipenuhi banyak aplikasi yang berserakan dan tidak pernah dirapikan. Lalu saat lagi nganggur, dia minta Cursor untuk merapikannya—hasilnya mulus banget, cukup dengan satu perintah. Gambar 1 sebelum dirapikan, Gambar 2 setelah dirapikan.
Kapan di ponsel juga ada agent seperti ini yang bisa kerja?
Lihat Asli
post-image
post-image
  • Hadiah
  • Komentar
  • Posting ulang
  • Bagikan
哦, itu juga tidak sepenuhnya seperti itu. Karena saat kamu ingin membuka percakapan baru lewat aplikasi ponsel untuk mengontrol Cursor di Mac-mu secara remote, kamu tetap perlu ada repo privat yang sesuai, jadi tutorial ini masih berlaku. Ha
Lihat Asli
  • Hadiah
  • Komentar
  • Posting ulang
  • Bagikan
  • Disematkan