ZENNSCORE 822026/9/29
「Claude Codeが言うことを聞かない」を、AI自身に自分を縛る道具を作らせて解くハーネスエンジニアリング
Claude CodeやCodexが指示を無視する問題に対し、人間がルールを書くのではなくエージェント自身にhookや検証スクリプトを生成させて自律を制約する「ハーネスエンジニアリング」の実践が複数投稿された。skill-creatorが自らの500行制限や全大文字ルールを破っている事例、実装をAIに任せつつ人間が握るべき3つの役割など、運用の失敗と勘所が具体的に語られている。9月開催のハーネス設計入門セミナーの要点メモも出ており、テーマとして急速に立ち上がっている。
WHY THISfocus最優先のcoding agentハーネスそのもので、学習プロファイルのskills/parallel-agents傾向とも一致するため
ZENNSCORE 782026/9/29
サブエージェント間はファイル経由で受け渡す ── 2台のPCをまたぐ引き継ぎで足りなかったのは「履歴」だった
Claude Codeのサブエージェント同士が情報を渡す際、コンテキスト共有ではなくファイルを介した受け渡しが有効だという知見が共有された。別の投稿では2台のPCのエージェント間で引き継ぎを試み、共有すべきは状態そのものではなく判断に至った履歴だったと結論している。エージェント分業の設計パターンとして通底する話題である。
WHY THISsubagent設計はfocus#1の中核で、学習プロファイルのparallel-agents/worktree傾向に直結するため
HNZENNSCORE 83points 212 · comments 852026/9/29
「文章を書かず判定だけ返すAI」Jevを追う ── PostHogの対抗馬Jeevesが2週間で登場
自然言語を生成せず、yes/noの校正済み確率だけを高速・低コストで返す決定特化モデル「Jev」が注目を集めている。PostHogはその対抗としてGemma系9BにReasoningを載せたJeevesを公開したが、HNでは「推論を入れると単一forward passという安さと速さが失われるのでは」と本末転倒を指摘する声が相次いだ。日本でもJevを実際に触った使いどころの検証や、Jev監視プラグインを1週間で外した記録が出ている。
WHY THIS判定専用APIというエージェント基盤の新しい部品で、focus#1のcoding agentツール群に直結するため
💬 議論の論点
HNでは「Reasoningで精度は上がってもJevの真価だった単一forward passの安さ・速さを捨てている」「p90で17秒かかるならLLMでいい」と、速度とコストの喪失への批判が優勢だった。実機ベンチでも独サッカーtweetsの皮肉検出でJeeves 68問正解に対しJev 79問正解と、本家Jevが上回る結果が報告された。一方で「一部をJev、一部を従来LLMに振り分けるハイブリッドが筋」という擁護もあった。
ZENNSCORE 712026/9/29
AIに書かせた文書を同じAIに採点させない ── 生成と検証を分けて「言い切り」を止める
AIが書いた文書を同じAIに評価させても甘い判定になるため、書き手と検証役を分離してローカルLLMだけで差し戻しが起きるかを実測した報告が出た。関連して、公式発表と異なる断定を生成の段階で止める仕組みや、「エラーの出ない失敗」を検知する話題も並んでいる。生成物の品質保証を役割分担で担保する発想が共通している。
WHY THISLLMアプリの検証設計というinterest領域で、単体AIの自己評価バイアスという実務的な論点を扱うため
ZENNSCORE 772026/9/29
指示ファイルはどう読まれるか ── Claude Code / Codex / Copilot / Cursor / Kiro を2026年9月時点で横並び比較
CLAUDE.mdやAGENTS.mdといったエージェントへの指示ファイルが、各ツールでどのタイミング・優先順位で読み込まれるかを5製品横断で整理した記事である。ツールごとにファイル名の慣習も読み込み順も異なり、乗り換えや併用時の落とし穴を可視化している。
WHY THIScoding agentツールの指示ファイル仕様の比較で、focus#1に真正面から該当するため
ZENNSCORE 722026/9/29
複数AIエージェントをリアルタイム監視するデスクトップツール「tomarigi」をOSSで公開
Claude CodeとCodexなど複数のAIエージェントの稼働状況を一画面でリアルタイム監視するデスクトップツールがOSSとして公開された。並行して走らせるエージェントが増えるほど状態把握が難しくなる問題への回答として位置づけられている。
WHY THIS並列エージェントの運用ツールで、学習プロファイルのparallel-agents傾向とfocus#1に一致するため
ZENNSCORE 772026/9/29
Cloudflare Birthday Week 2026 が開幕 ── Day1の発表まとめ
Cloudflareが毎年恒例のBirthday Weekを開始し、初日の新発表を日本語でまとめた記事が出た。エッジ・Workers周辺の新機能が順次公開される週であり、初日分の要点を追える。
WHY THISfocus#3のCloudflareの新発表で、学習プロファイルのcloudflare/workers/edge傾向にも合致するため
ZENNSCORE 652026/9/29
ローカルLLMの天井を実測 ── MacBook Air M4 16GBは12.7GBで頭打ち、GPU枯渇は「正常に見える」まま失敗する
MacBook Air M4 16GBでローカルLLMを1日試し、実効の天井は12.7GBで24B・31Bモデルは完走しなかったという実測が報告された。別の投稿では2つのAIセッションがVRAMを取り合い、GPU枯渇時もエラーを出さず正常動作に見えるまま失敗する挙動が指摘されている。Claude CodeにローカルLLM環境の構築を丸投げしたら想像以上に自力で組み上げたという体験談も出ている。
WHY THISローカルLLMの計測というinterest領域で、無音の失敗という運用上の実害を具体的な数値で示すため
HNSCORE 80points 397 · comments 1262026/9/29
会話型AIエージェントのプライバシー実測 ── チャット内容が広告トラッカーに筒抜けだった
WebとモバイルのAIチャットについて、会話由来のデータ(タイトル・プロンプト・スクショ)が永続IDとともに第三者へ渡っている実態を分析した論文がHNで注目された。GrokのURLがアクセス制御なしで会話全体を露出し、TikTokにチャットのスクショが渡るなど、具体的な流出経路が特定されている。
WHY THIS会話型AIエージェントのプライバシーという、LLMアプリ設計と直結する実測研究のため
💬 議論の論点
HNでは「これはleakではなくsell(意図的な販売)だ、盗人の主体性を奪う表現だ」とタイトルの言い換えを求める声が上位に来た。Metaの手法に触れ「自社でデータを囲い込む方が広告事業として強いのに、競合の広告網に渡しているのは実装が急ごしらえだからでは」という分析もあった。ChatGPTが送信前の未完成プロンプトをconversation/prepareへ送っている挙動への警戒も投稿された。
HNQIITAHATEBUSCORE 74points 122 · comments 902026/9/30
Anthropicが警告する「GLM-5.3とサイバー能力の拡散」に、利益相反とオープンウェイト規制の思惑という猛批判
Anthropicは、中国製オープンウェイトモデルGLM-5.3が「これまで公開された中で最もサイバー能力が高い」とし、abliteration後も能力が落ちず安全策を回避できたと報告した(自社Claudeは同タスクを拒否したとも記す)。HNでは「IPOを控えたAnthropicが規制を競合潰しに使う楔だ」「ガードレールはblue teamやマルウェア調査の邪魔で、むしろオープンモデルが必要だ」と反発が優勢だった。Qiitaには「AI攻撃は結局AIでしか守れないのか」とGoogle・Anthropicの動きから5つの変化を読む記事も出ている。
WHY THISLLMのセキュリティ能力とオープンウェイト規制という論点で、interest領域かつHNで賛否が激しく割れているため
💬 議論の論点
批判の中心は利益相反で、「IPO目論見書で存亡リスクを警告するAnthropicが、規制当局を競合排除に動かそうとしている」との見方が多数を占めた。技術面でも「ガードレールはマルウェア解析やblue teamの妨げになる、nmapやmetasploitが違法でないのと同じでhacker toolは防御に要る」という反論が支持を集めた。一方でCAISIの評価として「GLM-5.3は米フロンティアに約4か月遅れ」という定量的な引用も共有されている。
ZENNSCORE 682026/9/29
LLMにURLを1文字も書かせない ── 内部リンクはプレースホルダで受けてDBから組み立てる
LLMにハイパーリンクを直接生成させると誤ったURLを吐くため、本文にはプレースホルダだけを書かせ、実URLはDBから後段で差し込む設計が共有された。生成と事実(リンク先)を分離してハルシネーションの混入経路を断つ実装パターンである。
WHY THISLLMアプリの実装でハルシネーションを構造的に防ぐ具体策で、interest領域に該当するため
ZENNSCORE 612026/9/29
3分で読むトランザクション設計のコツ ── 操作の順序で整合性を守る
データベーストランザクションで整合性を崩さないための、操作順序に着目した設計の勘所を短くまとめた記事である。ロックや競合を避けるうえで実務的に効く基本を確認できる。
WHY THISバックエンド設計の基礎で、interest領域のDB・API設計に該当するため
ZENNSCORE 582026/9/27
SOLID原則と型が持つ責務 ── 型システムで原則を表現する
SOLID原則を、型が担う責務という観点から読み直した設計論の記事である。原則を掛け声で終わらせず型設計に落とし込む視点を提示している。
WHY THISバックエンド設計全般に含まれる型・責務の設計論のため
ZENNSCORE 632026/9/29
RAGの精度を自己進化させる ── 知能が安くなった時代の検索改善
RAGの検索精度を、運用しながら自己進化させる手法を解説した記事である。LLMの推論コストが下がった前提で、検索段の改善に計算を回す発想を示している。
WHY THISLLMアプリ設計のRAG精度改善というinterest領域に該当するため
ZENNSCORE 722026/9/29
Claude Code / Codexで「limit減りすぎ」と感じたら ── 長いセッションでの使用量の見方
Claude CodeやCodexで利用上限の減りが早いと感じたときに確認すべき、長時間セッションでの使用量の内訳と考え方を整理した記事である。コンテキストの膨張が消費に効く仕組みを踏まえた実務的な節約の指針になる。
WHY THIScoding agentのコスト・計測で、学習プロファイルのcost傾向とfocus#1に一致するため
LOBSTERSSCORE 49🎲 SERENDIPITYpoints 82 · comments 582026/9/28
Lispはなぜ読みにくいのか ── 括弧ではなく「視覚的な手がかりの少なさ」が原因という分析
Lispが読みにくいとされる理由を、括弧の多さそのものではなく構文上の視覚的手がかりの乏しさから分析した記事である。言語設計と可読性の関係を考える題材になっている。
WHY THIS興味の外だが、可読性という切り口が普段のツール志向とは違う言語設計の視点を与えるため(quality94の高評価記事)
LOBSTERSSCORE 38🎲 SERENDIPITYpoints 134 · comments 252026/9/29
ビル・ゲイツがMovie Makerのインストールに悪戦苦闘 ── 流出社内メールが描くソフトの使いにくさ
かつてビル・ゲイツ自身がWindowsのMovie Makerを入れようとして手こずった様子を、流出した社内メールから紹介する記事である。トップ自らがユーザー体験の悪さに直面していた歴史的エピソードとして読める。
WHY THIS興味の外だが、UXとドッグフーディングの古典的教訓として示す価値があるため(quality99の高評価記事)
RELEASE WATCH
anthropics/claude-code
- v2.1.285 2026/9/30
WebFetchを無効化する環境変数、`claude --desktop`でのデスクトップ起動、APIプロバイダを制限する`allowedProviders`、プラグイン設定の`configure`を追加。
- v2.1.284 2026/9/29
Claude Sonnet 5.5(1Mコンテキスト、$2/$10 per Mtok)を追加しデフォルトSonnetに。使用量へのドル金額表示、`/rate-limit-options`、`/mcp reconnect all`も追加。
- v2.1.283 2026/9/26
CLAUDE.md・skills・agentsを旧モデル向け記述で監査する`/doctor prompt-audit`、モデルを個別ブロックする`deniedModels`設定などを追加。
- v2.1.282 2026/9/25
広い端末でプローズ幅を制限する`maxProseWidth`設定を追加。resume時に過去の拡張思考が落ちる不具合など複数を修正。
- v2.1.281 2026/9/24
コミット/PRのattribution表示を隠す`"attribution": false`、BedrockアップストリームのIAMロールassume、`/insights`のauto mode推奨などを追加。
openai/codex
FETCH STATUS
- OKHN41件
- OKZENN50件
- OKQIITA7件
- OKHATEBU30件
- OKGHTREND8件
- OKREDDIT0件取得成功・対象期間に該当なし
- OKLOBSTERS25件
- OKAGENTS30件