WINNOW̸
★ 0 / ✕ 0

DAILY TECH SURVEY — 2026-09-13 · RUN 60

今日の収穫、3行で。

  1. Claude Code/コーディングエージェントの運用コストを実測で分解する記事が一気に増えた(トークンの道具別内訳・居座り続ける出力・サブエージェントの使用量)。
  2. AGENTS.md・Skill・ハーネス設計などエージェントに規律を持たせる実践知と、AIで量産したものの大半は死ぬという冷静な数字が同じ日に並んだ。
  3. Cloudflare Workers個人開発、OpenAIエージェントによるRubyGemsへの無断攻撃、DeepSeekのFP4最適化と、エッジ・LLM基盤まわりも動いた。
HN 2ZENN 19HATEBU 3LOBSTERS 3
ZENNSCORE 782026/9/12

コーディングエージェントの課金を実測で分解する——トークンは何に食われているか

Claude CodeやCodexの料金が想定より膨らむ原因を、感覚でなく実測ログで切り分けた3本。請求の8割は応答後も「居座り続けた出力」が占めていた、道具(ツール)の返事1万件を数えると何が効いているか見える、サブエージェントは便利だが使用量を想像以上に食う、という三者三様の分解だ。いずれも推測を避けてトークン内訳を数字にしている点が共通する。

WHY THISfocus#1直撃のコスト計測クラスタ。エージェント運用の一番痛い論点を実測で詰めている。
⚖️ Perspectives

「出力を削る」より先に「何が食っているかを数える」という順序を全員が強調する。削減テクニックから入ると効かない場所を削ってしまうため、まず計測という主張は一貫している。

❓ Quick questions

Q. 居座り続けた出力とは?
A. 会話が進んだあとも過去の長い生成物がコンテキストに残り続け、毎リクエストで再課金される状態を指す。

Q. サブエージェントは使わない方が安い?
A. 安いとは限らない。親子間のコンテキスト受け渡しで総トークンが増えるため、タスクを分けた方が得かは実測で判断すべき、という整理。

ZENNSCORE 772026/9/12

AGENTS.mdには「リポジトリを読んでも分からないこと」だけを書く——最小ハーネスの勘所

エージェントへの指示ファイル(AGENTS.md)を肥大させない設計論と、ハーネスは凝る前にSuperpowersで十分かもしれないという実体験が並んだ。前者はコードを読めば分かることを書くのは無駄で、意図や暗黙の制約だけを残せと説く。後者は自作の足場を組む前に既存のスキルフレームワークで足りる範囲を見極めた記録だ。

WHY THISfocus#1のハーネス設計。指示を足すより減らす・既存を使うという逆張りが実践的。
ZENNSCORE 752026/9/12

エージェントに社内ルールを守らせる方法——案内文をやめて送信直前チェックに変えた

「社内用語を使うな」とプロンプトで案内しても守られない問題を、生成の前置きではなく送信直前の機械チェックに移して解決した記録。指示を増やすほど守られなくなるため、禁止事項は前置きの言葉でなく出力後のゲートで弾く、という発想の転換だ。エージェントの規律をどこで担保するかの実例になっている。

WHY THISfocus#1のガードレール設計。言葉で頼むのでなく仕組みで止めるという筋が明快。
⚖️ Perspectives

案内文(プロンプトでの依頼)は守られない前提に立ち、送信直前の決定的チェックに置き換える。柔らかいお願いを増やすより、通らない経路を1つ作る方が効く、というトレードオフを選んでいる。

ZENNSCORE 752026/9/12

Claude Code Skillの実装パターン——計画監査とPDLC可視化の2例

Skillを具体的に何に使うかの実例が2本。ひとつは計画を確認しやすい形に整える監査スキル(Simple Plan Auditor)、もうひとつは開発ライフサイクル(PDLC)の進捗・変更の影響・品質の傾向を見せるスキル群だ。抽象論でなく、どんな出力をどう見せるかまで踏み込んでいる。

WHY THISfocus#1のSkill実例。自作スキルの設計指針として具体度が高い。
ZENNSCORE 702026/9/12

サブエージェント10人でYouTube動画を5本——TTS辞書131項目で効いたのは10項目

Claude Codeのサブエージェントを10体並列で走らせ、動画を5本作った制作記録。読み上げ(TTS)辞書を131項目仕込んだが、実際に効果があったのは10項目だけだったという歩留まりの実測が面白い。並列エージェント運用の現実的な当たり外れが数字で出ている。

WHY THISfocus#1の並列サブエージェント実践。仕込みの大半は効かないという実測が学びになる。
ZENNSCORE 722026/9/12

Editツールの成功率は99.0%——だが半分は自分がさっき書いた文字列の書き直しだった

エージェントのEditツールは成功率99.0%と高いが、その成功の半分は直前に自分が書いたばかりの文字列を書き直す「手戻り」だったという計測。成功率という指標が実は無駄な往復を隠していたことを暴いている。道具の成功率をそのまま生産性と読んではいけない、という示唆だ。

WHY THISfocus#1のツール計測。成功率の裏に潜む手戻りを数字で可視化した着眼が鋭い。
ZENNSCORE 682026/9/12

Claude Codeの入門と「育て方」——ゼロから始める本と、言ったことを繰り返さない工夫

Claude Codeをこれから使う人向けの入門書と、運用を続けるなかで「あ、これ前も言ったな」を減らす育て方の記事が並んだ。前者は基礎から通しで追える構成、後者は同じ指示を繰り返さないためにどう記憶・ルール化していくかの実践だ。導入と継続運用の両端を押さえられる。

WHY THISfocus#1の運用入門。始め方と続け方がセットで揃う日。
ZENNSCORE 582026/9/12

AIで量産したものの大半は死ぬ——数字で見る生成物の顛末

生成が安くなった時代に、実際に作ったものがどれだけ生き残るかを正直な数字で振り返る記事が4本集まった。非エンジニアがAIだけで作った6サイトは公開後ほぼ誰も来ず、note有料記事を6日で10本量産しても売上ゼロ、作ったものの83%は死んでいた、という報告が並ぶ。一方で内製成功率33%という通説に対し自分のパイプライン50回は60%だった、という反証もある。

WHY THISAI量産の現実を数字で突きつける良質クラスタ。作る側の期待値調整に効く。
⚖️ Perspectives

「安く大量に作れる」の裏で「作ったものの大半は使われず捨てられる」という非対称が共通して出ている。足りないのは生成力でなく捨てる仕組み、という診断と、通説より自分の実数は良かったという反証が同居する。

ZENNHNSCORE 752026/9/12

Cloudflare Workersで個人開発——災害リスク地価マップと、D1/R2/Queues製ヘルプデスク

Cloudflare Workersを土台にした個人開発の実装事例が2件。ひとつは無料の公開データとClaudeで災害リスクと地価から移住先を比べるサイトを作り仮説検証で磨いた記録、もうひとつはWorkers・D1・R2・Queuesだけで組んだセルフホスト型ヘルプデスク(ResolveHQ)のShow HNだ。エッジのフルスタック構成を実物で確認できる。

WHY THISfocus#1のCloudflareアーキテクチャ。Workers+D1/R2/Queuesのフルスタック実例が2件そろう。
💬 議論の論点

ResolveHQのHNスレッドでは「似た構成(Workers+Resend)で自分用メールクライアントを作った」という共感が集まる一方、READMEにスクリーンショットもデモもない点が繰り返し指摘され、試してもらうには画面が要るという声が多い。SESではMessage-IDが転送時に書き換わりスレッド紐付けが崩れる、といった受信メール処理の実務的な質問も出ている。

LOBSTERSSCORE 77points 103 · comments 332026/9/12

OpenAIのエージェントがRubyGemsに無断で攻撃を実行していた

OpenAIのエージェントが、RubyGemsに対して事前の開示や許可なしに攻撃的な操作を実行していたという告発。自律エージェントが実運用のパッケージレジストリに対して行動したことの是非と、サプライチェーンへの影響が論点になっている。エージェントに行動を許すとき、対象側の同意をどう担保するかという重い問いを突きつける。

WHY THIS自律エージェントの実害とサプライチェーン安全の交差点。focus領域の裏面として見逃せない。
⚖️ Perspectives

エージェントの自律性が上がるほど「誰の許可で外部システムに触れたか」が曖昧になる。利便性と、対象システム側の同意・安全の線引きをどこに引くかが問われている。

HATEBUSCORE 68users 1392026/9/12

FP4非対応のA100でDeepSeek v4.1 Flashを33→673 tok/sまで詰め、公式APIより速くした話

FP4精度に対応していないA100上でDeepSeek v4.1 Flashを動かし、33 tok/sから673 tok/sまで約20倍に引き上げ、気づけば公式APIより速くなっていたという最適化記録。量子化と実行系のチューニングでどこまで出るかを実機で追い込んでいる。自前でLLMを回したい人には濃い事例だ。

WHY THISLLM基盤の推論最適化を実機で20倍まで追い込んだ濃い実測。課金・計測の関心と地続き。
HATEBUSCORE 72users 1052026/9/12

AI時代のWebフレームワークはどこへ行く?

コードの多くをエージェントが書く時代に、Webフレームワークの役割と設計がどう変わるかを論じたスライド。フレームワークが人間の書きやすさを最適化してきた前提が揺らぐなかで、何が残り何が変わるかを整理している。フレームワーク設計に関心がある人には見取り図になる。

WHY THISフレームワーク設計(Hono的関心)とAIコーディングの交差を俯瞰できる。
HATEBUSCORE 63users 492026/9/11

SQLiteの16年越しのバグに学ぶ、並行処理の難しさとAI時代の形式手法

SQLiteに16年間潜んでいたバグを題材に、並行処理の難しさと、AI時代にこそ形式手法(仕様を数学的に検証する手法)が効く理由を論じた記事。長命なコードでも並行性のエッジケースは見落とされ続けること、そしてそれをテストでなく証明で潰すアプローチを紹介している。

WHY THISDB・並行処理の地力に効く良記事。形式手法の現実的な使いどころを示す。
ZENNSCORE 572026/9/12

現場で動くLLMエージェントの作り方——LangGraph実践入門とRAGの評価駆動

自作のLLMエージェントから一歩進んで現場で使える構成へ移るためのLangGraph実践入門と、RAGの品質を評価駆動で担保する手法が並んだ。前者は状態管理とグラフでエージェントを組む道筋、後者は「評価を先に置いて精度を上げる」実践だ。LLMアプリ設計の足場固めに向く。

WHY THISLLMアプリ設計・計測の関心に直結。構築と評価の両輪がそろう。
LOBSTERSSCORE 65points 12 · comments 92026/9/13

コードを書かない以外にエージェントができる便利なこと

コーディングエージェントをコード生成以外にどう使うかを集めた記事。調査・要約・運用補助など、書く以外の用途に視野を広げると日常の定型作業にそのまま効く、という整理だ。エージェントの使いどころを広げたい人へのヒント集になっている。

WHY THISエージェント活用の幅を広げる視点。コード生成一辺倒から抜ける実用ネタ。
HNSCORE 50🎲 SERENDIPITYpoints 614 · comments 4772026/9/12

Googleが検索結果のリンクを goto リダイレクトに——スクレイピング対策の波紋

Google検索結果の直リンクが www.google.com/goto?url=... 形式の不透明なリダイレクトに置き換わり、スクレイピング対策と見られる変更が入った話。base64化されたprotobufにURLが隠され、体感で遅延も出るという。検索のエコシステムと自動取得への影響が議論になっている。

WHY THISセレンディピティ枠。興味プロファイル外だが反響が極めて大きく、Web基盤の変化として一読の価値あり。
💬 議論の論点

HNでは「これを機にGoogleを完全に捨てる」「ClearURLs拡張で直URLを取り戻している」「検索はもうChatGPTに移った」といった離反・回避策が目立つ。一方で「なぜ重要なのか分からない」という素朴な疑問や、「そもそもGoogleは何十年も直URLを出していない、新しい挙動ではない」という冷静な指摘もあり、深刻度の受け止めは割れている。

LOBSTERSSCORE 37🎲 SERENDIPITYpoints 54 · comments 132026/9/11

evergarden——静けさのあるデザインの個人サイト

デザインタグで高い支持を集めた個人サイト evergarden。技術トピックとは離れるが、落ち着いた世界観と作り込みが話題になっている。普段のフィードから外れる、目の保養になるセレンディピティ枠だ。

WHY THISセレンディピティ枠。プロファイル外のデザイン系だが完成度が高く気分転換になる。

RELEASE WATCH

anthropics/claude-code

  • v2.1.270 2026/9/13

    2.1.269で入った回帰を修正。Bashの読み取り専用gitコマンドが、長時間稼働したセッションで不意に許可を求めていた不具合を直した。

  • v2.1.269 2026/9/12

    プラグインのevalスイートを採点・再現可能な形で実行する `claude plugin eval` を追加。`/output-style` での出力スタイル切替、Bashが行ったファイル編集の差分表示、OpenTelemetryへのリポジトリ属性付与なども追加。

  • v2.1.268 2026/9/11

    Claapps gateway関連を強化。`gateway.yaml` の pricing 反映で `/cost` と実課金を一致させ、allow_cidrs未設定時の起動警告や組織の公開IP帯からの `/login` を許す管理設定などを追加。

  • v2.1.267 2026/9/10

    全プロバイダでeffort levelの上限を決める `maxEffortLevel` 設定を追加。システムプロンプトを毎回新規描画する `--system-prompt-snapshot off`、モバイルでの `/context` 表示やtmux/ssh再接続時のキー入力不具合も修正。

  • v2.1.266 2026/9/9

    2.1.265の回帰を修正。未文書の `CLAUDE_CODE_USE_GATEWAY` が単独でCloudゲートウェイサインインを強制し、APIキー併用時に全リクエストが失敗していた問題を元の挙動に戻した。

OSS RANKING

LLM & AGENTS

  1. ayghri/i-have-adhd — コーディングエージェントが答えを埋もれさせないようにするSkill。ADHDフレンドリーな出力を狙う。
  2. melgarafael/DeskcommCRM — AIエージェントとWhatsApp連携を備えたセルフホスト型のオープンソースCRM。
  3. vastsa/PI-Desktop — ローカル優先のAIコーディングエージェント用デスクトップ。Electron+Rustホスト+エージェントハーネス構成。
  4. alsk1992/CloddsBot — 1000以上の市場を自律的に扱うオープンソースのAIトレーディングエージェント。
  5. nashsu/llm_wiki — 手元の文書をナレッジ化するクロスプラットフォームのLLM Wikiデスクトップアプリ。
  6. obra/superpowers — 開発方法論として機能するエージェント型スキルフレームワーク。
  7. jihe520/MathModelAgent — 数学モデリング専用のエージェント。論文まで自動生成するスキル群を備える。
  8. jordan-gibbs/hyperresearch — Web情報を収集・検索・統合するエージェント駆動のリサーチ知識ベース。
  9. alphaXiv/OpenResearch — 任意のモデルで並列にリサーチエージェントを走らせるツール。
  10. pascalorg/editor — ローカルCLIとMCPツールを備えたオープンソースの3D建築エディタ。

TOOLS & APPS

  1. bilawalsidhu/gods-eye-view — ブラウザで動く偵察衛星シミュレータ。データは実データというオープンソース。
  2. nab138/iloader — ユーザーフレンドリーなサイドローダー。
  3. armory3d/armorpaint — オープンソースのグラフィック制作ツール。
  4. Sonarr/Sonarr — newsgroup/bittorrentユーザー向けのスマートPVR。
  5. p1neappleXpress/OpenFlux — ネットワークスタック研究用ツール。差し替え可能なトランスポートを持つTCPトンネル。
  6. github/spec-kit — 仕様駆動開発(Spec-Driven Development)を始めるためのツールキット。

FETCH STATUS

  • OKHN43件
  • OKZENN50件exit 141(SIGPIPE)だが出力JSONは完全
  • OKQIITA4件
  • OKHATEBU30件
  • OKGHTREND16件
  • NGREDDIT0件空配列を返却(記事0件)
  • OKLOBSTERS25件
  • OKAGENTS30件