Fast Mode dan Effort Level Claude Code: Cepat lawan Murah

Sebuah konfigurasi berkecepatan tinggi untuk Claude Opus yang membuat balasan sampai dua setengah kali lebih cepat dengan harga per token lebih tinggi. Ia bukan model berbeda dan tidak ada pertukaran kualitas — Opus yang sama berjalan dengan konfigurasi API yang mengutamakan kecepatan ketimbang efisiensi biaya. Ia didukung hanya di Opus 5 dan Opus 4.8.
Kali pertama Anda menyalakannya di sebuah percakapan, Anda membayar harga input fast mode tanpa cache secara penuh untuk seluruh konteks yang sudah ada. Makin jauh Anda di dalam percakapan itu, makin mahal. Ia berlaku sekali per percakapan, jadi mematikan lalu menyalakan lagi tidak mengulanginya — nyalakan di awal sesi saja.
Fast mode memberi kualitas model yang sama dengan latensi lebih rendah dan biaya lebih tinggi. Effort level yang lebih rendah berarti waktu berpikir lebih sedikit, yang lebih cepat dan lebih murah tapi bisa mengurangi kualitas di tugas rumit. Keduanya bisa digabung: fast mode dengan effort rendah adalah konfigurasi tercepat untuk pekerjaan yang lurus.
Paling sering karena pemeriksaan ketersediaannya. Claude Code memeriksa fast mode dengan permintaan langsung ke Anthropic API, dan permintaan itu tidak mengikuti base URL yang dikonfigurasi, jadi jaringan yang mengarahkan lalu lintas model lewat gateway dan memblokir egress langsung menggagalkan pemeriksaannya sementara inferensinya tetap jalan. Dua environment variable melewati pemeriksaannya dengan cara berbeda.
Tidak. Di paket berlangganan, fast mode ditagihkan dari usage credits dan tidak termasuk dalam rate limit paket Anda, serta menarik dari kredit itu bahkan ketika pemakaian paket masih tersisa. Usage credits harus dinyalakan sebelum ia bekerja, dan di Team serta Enterprise seorang Owner harus menyalakan fast mode untuk organisasinya lebih dulu.

Ringkasan Utama
Fast mode bukan model yang berbeda. Ia menjalankan Claude Opus dengan konfigurasi API yang mengutamakan kecepatan ketimbang efisiensi biaya — sampai dua setengah kali lebih cepat, dengan sepuluh dolar per juta token input dan lima puluh per juta output. Kualitasnya identik, harganya lebih tinggi. Effort level adalah tuas satunya, dan ia bekerja ke arah sebaliknya.
Saya menyalakan fast mode empat puluh menit di tengah sesi debugging, melihat balasannya jelas lebih cepat, lalu menemukan tagihan lebih besar dari yang saya kira untuk perubahan yang terasa kecil. Kecepatannya nyata. Yang saya lewatkan adalah bahwa menyalakannya di tengah percakapan menagihkan harga input fast mode tanpa cache untuk seluruh percakapan sejauh itu, dan di menit keempat puluh percakapan itu tidak kecil.
Itulah satu hal paling berguna yang perlu diketahui soal fitur ini, dan perbaikannya satu baris: nyalakan di awal sesi, bukan di tengah. Tulisan ini membahas apa sebenarnya fast mode, cara menyalakan dan menguncinya, mekanisme biayanya, bedanya dengan menurunkan effort, syarat yang memblokirnya, pemeriksaan ketersediaan yang gagal di balik gateway, dan apa yang terjadi saat kena rate limit.
Fast mode memakai Claude Opus dengan konfigurasi API yang menukar efisiensi biaya demi latensi. Anda mendapat kualitas dan kemampuan yang identik dengan balasan lebih cepat — ia bukan model yang lebih kecil, dan bukan pertukaran kualitas. Ia didukung di Opus 5 dan Opus 4.8, dan tidak di model lain: Sonnet, Haiku, dan sisanya sama sekali tidak menawarkannya.
Ia juga sebuah research preview, dan itu layak dinyatakan terang-terangan: fiturnya, harganya, dan ketersediaannya bisa berubah berdasarkan masukan. Bangun kebiasaan memakainya kalau ia membantu, tapi jangan bangun proses yang mengandaikan harga hari ini permanen.
Perintahnya menyalakan-mematikan dan, kalau dijalankan lagi, memberi tahu keadaan saat ini. Menyalakannya memindahkan Anda ke Opus kalau Anda sedang di model lain, dan mematikannya meninggalkan Anda di Opus ketimbang kembali. Secara bawaan preferensinya bertahan lintas sesi, yang merupakan bawaan masuk akal untuk perorangan dan buruk untuk organisasi yang membayar beberapa sesi bersamaan per orang.
/fast # toggle on or off; run again to check state
# a small lightning icon sits by the prompt
# while it is on
{ "fastMode": true } # user settings
{ "fastModePerSessionOptIn": true } # every session starts OFF
# Non-interactive: /fast only works in a session launched with
# fast mode already in its settings, and applies to that session
# only — it is not saved as your default.
claude -p --settings '{"fastMode": true}' "…"
# It follows your model switches in BOTH directions:
# switch to a model without fast mode -> fast mode OFF
# switch back to a supported Opus -> ON again, if your
# saved preference is on
CLAUDE_CODE_DISABLE_FAST_MODE=1 # turn it off entirelyKali pertama Anda menyalakan fast mode di sebuah percakapan, Anda membayar harga input fast mode tanpa cache secara penuh untuk seluruh konteks yang sudah ada. Makin jauh Anda di dalam percakapan itu, makin mahal biayanya. Ia berlaku sekali per percakapan, jadi mematikan lalu menyalakan lagi nanti tidak mengulanginya — tapi penyalaan pertama itulah yang mahal, dan ia makin mahal makin lama Anda menunggu.
Di paket berlangganan, fast mode ditagihkan dari usage credits dan tidak termasuk dalam rate limit paket Anda — dan ia menarik dari kredit itu bahkan ketika pemakaian paket Anda masih tersisa. Sampai usage credits dinyalakan, perintahnya menolak dengan pesan yang menyatakan itu. Di Team dan Enterprise ia mati sepenuhnya sampai seorang Owner menyalakannya, dan organisasi Console butuh aksesnya disediakan lebih dulu.
Keduanya sering tertukar karena sama-sama membuat balasan tiba lebih cepat. Keduanya bukan alternatif — mereka mengubah hal berbeda, dan bedanya penting karena satu bisa memakan kualitas Anda dan satunya tidak.
Yang sebenarnya diubah tiap tuas:
| Tuas | Efeknya |
|---|---|
| Fast mode | Kualitas model sama, latensi lebih rendah, biaya per token lebih tinggi. Tak ada yang berubah soal penalarannya |
| Effort level yang lebih rendah | Waktu berpikir lebih sedikit, balasan lebih cepat, kualitas berpotensi lebih rendah di tugas rumit. Ini pertukaran sungguhan |
| Keduanya bersamaan | Kecepatan maksimum di pekerjaan lurus — kombinasi yang diraih untuk tugas mekanis, dan dihindari di tugas sulit |
Keputusannya lebih sederhana dari kelihatannya. Fast mode untuk kerja interaktif ketika Anda sedang menunggu: iterasi cepat, debugging langsung, tenggat. Kecepatan standar untuk tugas otonom panjang, pemrosesan batch, dan pipeline CI, tempat tak seorang pun menonton kursornya dan latensinya tidak memakan apa-apa. Kalau Anda tak akan menyadari balasan tiba dua detik lebih cepat, Anda membayar untuk tidak apa-apa.
Fast mode butuh setiap satu dari ini, dan masing-masing punya pesan penolakannya sendiri supaya Anda bisa tahu mana yang memblokir Anda:
Yang satu ini layak diketahui karena pesannya menunjuk ke jaringan padahal penyebabnya sering di tempat lain. Claude Code memeriksa ketersediaan fast mode dengan permintaan langsung ke Anthropic API, dan pemeriksaan itu tidak mengikuti base URL yang Anda konfigurasi — jadi jaringan yang mengarahkan lalu lintas model lewat gateway dan memblokir egress langsung menggagalkan pemeriksaannya sementara inferensinya tetap bekerja sempurna.
# Before offering fast mode, Claude Code checks availability with
# a request DIRECTLY to api.anthropic.com. That check does not
# follow ANTHROPIC_BASE_URL — so on a network that routes model
# traffic through a gateway and blocks direct egress, the check
# fails even though inference works fine.
#
# "Fast mode unavailable due to network connectivity issues"
# It DOES use a configured HTTP proxy, so a block only bites where
# api.anthropic.com is unreachable even through the proxy. A check
# that succeeded once keeps working from its cached result, which
# is why this mostly hits new installations.
CLAUDE_CODE_SKIP_FAST_MODE_NETWORK_ERRORS=1
# treat a FAILED check as available; still honours a real
# "disabled by your organization" answer
CLAUDE_CODE_SKIP_FAST_MODE_ORG_CHECK=1
# skip the check entirely — for a proxy that INTERCEPTS the
# request and answers with its own page, and for a session
# authenticating with a bearer token aloneAda dua pintu darurat dan keduanya tidak bisa saling menggantikan. Satu memperlakukan pemeriksaan yang gagal sebagai tersedia, dan tepat ketika jaringan Anda menolak sambungannya atau ketika kredensial gateway ditolak. Satunya melewati pemeriksaannya sama sekali, dan itulah yang Anda butuhkan ketika sebuah proxy mencegat permintaannya lalu menjawab dengan halamannya sendiri, atau ketika sesinya berautentikasi dengan bearer token saja. Keduanya hanya memengaruhi pemeriksaan sisi-klien — kalau organisasi Anda memang mematikan fast mode, API-nya menolak permintaannya bagaimanapun.
Fast mode punya kolam rate limit sendiri, dibagi ke setiap model Opus yang didukung. Menabraknya tidak menghentikan pekerjaan Anda: fast mode jatuh ke kecepatan standar, indikatornya memudar untuk menunjukkan cooldown, dan ia menyalakan dirinya lagi ketika cooldown-nya habis. Anda juga bisa mematikannya manual ketimbang menunggu.
Kehabisan usage credits di tengah sesi berperilaku berbeda dan lebih lembut. Tiap permintaan yang ditolak dicoba ulang di kecepatan dan harga standar, jadi Anda terus bekerja tanpa cooldown. Di sesi interaktif Anda mendapat notifikasi dan fast mode mati untuk sisa sesinya, tanpa mengubah preferensi tersimpan Anda; di run non-interaktif yang streaming, teks yang sama datang sebagai notifikasi sistem sekali per giliran.
Nyalakan fast mode di awal sesi atau tidak sama sekali, karena penyalaan di tengah percakapanlah tempat uangnya pergi. Pakai ia ketika Anda duduk menunggu dan kecepatan standar ketika tidak. Dan kalau Anda menjalankan organisasi tempat orang membuka beberapa sesi, setel opt-in per sesi supaya masing-masing mulai dalam keadaan mati — preferensi permanen dikalikan empat sesi bersamaan adalah tagihan yang tak seorang pun memutuskan menyetujuinya.
Sumber & bacaan lanjutan