Incident with Github.com
GitHub 全体で
コメントの要約
GitHub の
コメントで目立つのは、ステータスページが全面緑のままだったため障害の有無を HN で確認するはめになった、という報告。ブルガリアを含む各地から同時に同じ症状が上がり、リリースを push しようとした矢先に止まった、という声も出ている。
月曜朝の
Incident with Github.com
GitHub 全体で
GitHub の
コメントで目立つのは、ステータスページが全面緑のままだったため障害の有無を HN で確認するはめになった、という報告。ブルガリアを含む各地から同時に同じ症状が上がり、リリースを push しようとした矢先に止まった、という声も出ている。
Ask HN: Alternatives to GitHub
障害が
投稿者は
Forgejo を私設 VPS で運用しているという回答では、AI クローラー対策以外はほとんど手がかからないと報告されている。一方で、既に大規模な GitHub organization を運用しているなら機能面で最も近いのは GitLab で、オープンソースの Community Edition をセルフホストできる点が利点だという指摘もある。自前でインフラを維持する手間を払えば頭痛の種は減る、という運用側の声も出ている。
A Preview of DuckDB v2.0
DuckDB v2.0 の
DuckDB の
コメントでは、ここ1年の機能追加がインプロセスの実行エンジンからクラウドデータウェアハウスの基盤へ軸足を移しているように見える、という観測が繰り返されている。メモリを超えるサイズのデータを低スペック機で処理できる点と可搬性を評価する報告が多い一方、PL/pgSQL のような手続き型機能が欲しい、ブラウザで動かすため WASM 版のランタイムサイズが気になる、という要望も並ぶ。
AI;DR (AI; Didn't Read)
本人が
著者は
コメントでは、AI に長文を書かせるくらいなら元のプロンプトや使った出典をそのまま公開すべきだ、という意見が出ている。一方で、コピーライターや編集者が手を入れた文章を何世代も読んできたのだから、後工程を AI がやったという理由だけで読まないのは筋が通らない、という反論もある。TL;DR はもっと敵意のない別物だとして擁護する声も並んだ。
GPT 5.6 Sol is the best "vision" model OpenAI ever released
Roboflow が
Roboflow が
コメントではベンチマーク画像そのものへの指摘が複数ある。3番目の例はモデル側が正解で期待値の方が1つ誤っている、次の例は bounding box が90度回転しており EXIF の向き情報の処理漏れではないか、といった内容。
実利用の評価は割れている。ガラス越しのポスターに映った微かな反射を認識できた、入れ子になった画面内のモーダルを文脈ごと正しく捉えた、という報告がある一方、依然として細部への注意がなく、画像の拡張を指示しても同じ失敗を繰り返す、という声もある。
On AI regulation and messaging
Anthropic の
規制は
コメントは懐疑的なものが多い。営利企業の CEO の発言として割り引くべきだという指摘、長文の割に「実際の世界観」が示されていないという批判、IPO を控えて世論を煽っているという見方が並ぶ。AI が権力を集中させるのはスケーリング則の帰結だという本人の主張に対し、では3年経って AI がもたらした大きな成果物はどこにあるのか、と問い返す声もある。
AI-Generated GitHub Copilot “Autofix” Allowed Compromise of Snowflake's Jira
Wiz の
issue の
コメントで注目されたのは、防御的に見える if 条件が実際には機能していなかった点。issues イベントでは github.event.pull_request が常に null になるため、条件式が意図した絞り込みになっていなかった、という指摘。
責任の所在についても議論があり、autofix を無条件に受け入れる運用を敷いた側の問題だという意見と、2026年になっても引用符インジェクションが生きていること自体への嘆きが並ぶ。変更のピアレビューは依然として必要だ、という点は共通している。
Qwen3.8 27B scores 52 on Artificial Analysis
オープンウェイトの
27B の
比較として、前世代の Qwen3.6 27B は38点で 4B〜40B のカテゴリ首位だったのに対し、今回はそれが 40B〜150B の中型モデルを全て上回り、150B 超のカテゴリで5位の DeepSeek V4 Flash 0731 と同点になる、という整理が挙げられている。
一方で、各種ベンチマークはスコア最適化されすぎて意味を失いつつあるのではないか、Artificial Analysis のランキングは相対比較の目安として今も妥当か、という疑問も出ている。
How to disable or avoid intrusive AI
主要な
利用者が
コメントでは、Google 検索の AI 概要を消す方法や、Apple CarPlay が Siri の有効化を前提にしている件など、個別の困りごとが持ち寄られている。AI 機能を切ったときのフォールバックが実装されておらず、機能ごと使えなくなる例が今後増えるだろう、という予測も出ている。
運用面の要望として、変更履歴を追い修正を投げられるよう GitHub リポジトリで管理してほしい、という提案が挙がっている。
1日を
現在地の
コメントでは、位置を手動で選ばせてほしい、12時ではなく南中時刻を文字盤の真上に置きたい、という要望が挙がっている。同じ発想のものを自作したという報告が複数あり、24時間を12進数で表し1分を72秒とした時計や、p5.js で作った自分用の版が共有された。
さらに、地図上の任意の地点をクリックして自分の場所との差を見たい、カレンダー表示で任意の時刻の盤面を見たい、という案も出ている。Apple Watch で文字盤を自作できないことへの不満も並んだ。
Does it make sense to switch to a Github Alternative ?
障害を
障害の
中心にあるのは、多くのプロジェクトは GitHub の全機能を必要としていないのに一式揃ったものを前提に選んでしまっている、という指摘。必要なのはむしろ Web アーカイブ付きのメーリングリストで、public-inbox などを含む小さな共同インフラをプロジェクト単位で立てるほうが実態に合う、という意見が続く。GitHub 以前によく見られた共同運営の集まりを再評価する声も出た。
ホスティングの選択肢としては Codeberg(オープンソース限定・非営利)と、その条件に合わない場合の Fjord が挙がっている。ベアリポジトリと git の dumb protocol だけで公開する構成例も共有された。
I thought I was building a C replacement. I was wrong
C3 の
「C の
コメントの多くは Zig の扱いに集中した。Zig の作者が「自分の C++ 利用を置き換えるために作った」と述べてきた一方、0.1.1 のリリースノートには C を置き換えると書かれていた、という食い違いが引かれている。
作者本人が「勝手に言わせないでほしい」と反応し、それに対して、断定ではなく外からどう見えるかの記述だという応答が続いた。C3、Zig、Odin といった新興のシステム言語をまとめて語ること自体は普通だ、という擁護も出ている。
Every Fucking Website
AI に
生成された
コメントで語られているのは、こうしたページは配色もフォントもレイアウトも整っていて professional にすら見えるのに、労力がかかっていない印だと分かった途端に印象が反転する、という感覚。
同じ現象として em ダッシュの話に流れ、AI 生成の指標と見なされるようになったため意図的に二重ハイフンを使うようになった、という報告が続く。途中から en ダッシュと em ダッシュの使い分けや、Markdown の --smart 変換が二重ハイフンをどちらに変換するか、という話題に移った。
GitHub has alternatives, but no replacement
Codeberg、
SourceHut の
最も議論されたのは tangled の基盤である ATProto。Bluesky の VC マネー次第になるという懸念に対し、tangled の appview は完全にセルフホストでき、ATProto は IETF で標準化作業に入っており、Bluesky のインフラに強く依存するのは PLC ディレクトリだけで、それも web did で回避できる、という反論が並ぶ。
なお tangled 自体も VC 資金で動いている、という指摘もある。GitHub 側も「代替はあるが置き換えはない」ことを自覚しているはずで、新規参入の余地がある市場だ、という見方も出た。
A faster way to calculate the day-of-the-week
日付から
日付から
コメントでは Go への移植を試みるという反応があり、著者は移植版へのリンクを記事に追記すると応じている。日付時刻まわりの記事は今後も続く予定とのこと。アプリケーション層の日付の扱い、たとえば「次の営業日」を求める関数の設計も扱ってほしい、という要望も出た。
ベンチマークの表記についての指摘もあり、単位がナノ秒で小さいほど速いことが分かりにくい、という声を受けて注記が追加された。著者は、Neri-Scheider の論文が確立した慣習に合わせていると説明している。
Protecting the Rust standard library from accidental breakage
cargo-semver-checks で
cargo-semver-checks を
コメントでは、安定化済みかつ doc(hidden) な項目、たとえば std::vec::from_elem はどう扱われるのかという質問が出た。著者は、そうした項目が削除されても破壊とは報告されない、from_elem は vec! マクロの展開を支えるもので internal と記されたセクションに置かれている、と回答している。
再エクスポートと安定性・doc(hidden) の相互作用については別途モデルを立てる必要があり、これはまだ半分の話で続きの記事になる予定とのこと。
A Preview of DuckDB v2.0
DuckDB v2.0 の
Passphrase-less reboots using kexec under NixOS
暗号化ディスクの
フルディスク暗号化した
コメントの最初の疑問は「なぜ TPM を使わないのか」。これに対し、TPM のリセット攻撃はバス暗号化を有効にしていても厄介であること、TPM だけで解錠する構成では rootfs を差し替えて鍵を引き出す攻撃があることが挙げられた。
防御としては PIN のような対話的な要素を足すのが要点で、netboot と OOB を組み合わせる案が出ている。また Hetzner のような VPS では TPM も vTPM も提供されないため、そもそも選択肢に入らないという事情も指摘された。記事に TPM への言及がないこと自体が分かりにくい、という声もある。
When the Down Arrow is not an Upside-Down Up Arrow (2022)
Unicode の
Unicode の
短いコメント欄では、回転で代用する解法はスクリーンリーダーにとって不親切ではないか、という疑問が出た。適切な aria 属性を付ければ対応できる、という返答があり、ラベル付けされた UI 部品の一部として扱うなら問題は小さい、という整理になっている。
AI Software Development – What Does The Data Say?
LLM を
「LLM に
コメントは批判的なものが目立つ。書きぶりが結論を先に置いていて信用しにくい、リポジトリ直下の .md ファイルが性能を下げるといった主張は現行の運用や既知の対処法を踏まえていない、という指摘。要約された主張と元論文の対応や発表年が示されていない点も問題視されている。
一方で、LLM は隙間を埋める作業や定型部分には強いが設計とアーキテクチャは従来どおり人間の仕事だ、という結論そのものは自分の実感と一致する、という同意も複数ある。ベンチマークの向上をもって性能向上の証拠とする議論への慎重論についても、おおむね賛同が集まった。
Nothing like a Monday morning GitHub outage
r/programming に
障害発生中に
最も多い見方は AI ツールによる負荷増。2025年の総コミット数が10億だったのに対し2026年は直近6か月だけで140億という数字が挙げられ、Ruby on Rails のモノリスがその量を想定していない、という説明が付く。コーディングエージェントが GitHub の issue をメモリ代わりに使い API 利用が激増している、という指摘もある。GitHub 自身が4月にトラフィック増について言及していた、という補足も出た。
単一サービスの停止ではなく広範囲に及んでいることから、連鎖障害ではないかという推測も並んでいる。
A Preview of DuckDB v2.0
Hacker News、
同じ
手持ちのツールの上位5本に入るという評価がある一方、Go から使う場合に CGO が必要になりプロファイリングが難しくなる、という不満が挙がっている。これは Go 製ではないことに起因するのかという問いに対し、必ずしもそうではなく Linux のライブラリに依存しているためだ、という返答があった。
並行処理まわりのサポートがもう少し欲しい、という要望も出ている。それ以外は極めて満足している、エンジニアリングとプロダクト管理の両面で優れている、という評価が並ぶ。
Faster algorithms to compute weekday for date libraries
Lobsters にも
Lobsters にも
コメントは2件と少なく、曜日計算を速くする必要を感じたことはなく可読性が落ちるほうが気になる、という反応と、そもそも日付ライブラリで可読性が成立したことがあるのか、という返しが並んでいる。
Fractal Architecture, Cognitive Load, Vertical Slices and other terms that do(n't) fit your head
設計まわりで
Can Haskell Become a Great Language for Data Science?
Haskell を
Haskell を
反応はほぼ否定的で、型システムは確かに優れているが Python とのエコシステムの差が実務では致命的、というのが最も具体的な指摘。ツールチェーンへの不満も強く、Cabal の依存解決に10分ほどかかる、Cardano のリポジトリのビルドに30〜60分かかった、という経験が挙げられている。
タイトルが疑問形である時点で答えは no だという Betteridge の法則への言及もある。一方で、Haskell 風の型システムをもっと多くの言語が採り入れてほしい、という声も出た。
Stop Rebuilding Your Kubernetes Platform: How kubara Catalogs Make Architecture Reusable
Kubernetes 基盤を
テーマか
テーマまたは
README の相当部分はスポンサー枠で、Moonshot AI の Kimi K3、字節跳動の火山引擎、Claude Code の代替として API 中継を提供する CCSub が並んでいる。Kimi K3 は 3T 級のオープンモデルでネイティブの視覚能力と100万トークンのコンテキストを持つと説明され、本ツール内では台本執筆に加えて素材検索用のキーワード抽出や採用する画面の判断まで担うとされている。
時
アプリケーションの
セルフホスト型の
自宅サーバーなどで
検索はメタデータ、物体、顔、CLIP に対応し、RAW 形式、EXIF と地図のメタデータ表示、OAuth 認証も扱える。管理者向けのユーザー管理機能は Web のみでモバイルには無い、という具合に機能ごとの対応状況が表で整理されている。
README の冒頭には、大切な写真や動画は必ず 3-2-1 バックアップの方針に従うようにという警告が置かれている。デモ環境が公開されており、モバイルアプリからも同じエンドポイントで試せる。
HTTP/FTP/BitTorrent に
HTTP、
ダウンロードの中核が UI から独立しており、ブラウザ拡張やコマンドラインツールは JSON-RPC 2.0 上に構築した MDXP というオープンなプロトコルでアプリと通信する。プラグインは隔離されたサンドボックスで動く。同じ中核から、デスクトップアプリと、NAS や家庭内サーバー向けのヘッドレスサーバー(Node.js 直接または Docker、Web UI 付き)の2形態が動く。
v2 は現在ベータで、v1 からのデータ移行はまだ検証されていないため、v1 データの唯一のコピーをベータに使わないよう README で注意されている。
手元の
システムの
新たに加わったのがベンチマークと共有の機能。モデルを取得して起動し実測の tok/s を測ったうえで、その結果を TUI からそのまま PR として本体に還元できる。gh CLI も第三者のアカウントも要らない。
計測値はまずローカルに保存され、自分の実測値が推定値を置き換える。マージされた投稿は次のリリースに載るため、同じ構成のハードウェアを使う人は自分でベンチマークを走らせる前から実測値を参照できる、という設計になっている。
コーディングエージェントの
AI エージェント向けに
求人の
任意の
職務経歴書は求人ごとに ATS を意識した PDF として生成され、10件以上の求人はサブエージェントで並列に評価できる。応募状況は単一の情報源として整合性チェック付きで追跡され、企業調査と連絡すべき人物の特定まで含む。
README では「数を撃つためのツールではない」と明示され、数百件の中から時間を割く価値のある数件を見つけるフィルターだと位置づけられている。スコアの低い求人への応募は強く非推奨とされる。
Rust で
Git Gud!
GitHub Desktop しか
GitHub Desktop の
まず Git と GitHub は別物だという確認から入り、UI とコマンドラインの両方を理解したいという動機を述べる。記事の主眼は解説ではなく、他にどのコマンドを覚えるべきかをコミュニティに問うことに置かれている。
新しいことを学ぶのは難しい場合もあるという前置きの上で、これから始める人と既に使っている人の両方にとっての復習になれば、という意図が示されている。
How to Reach Your Full Potential as a Programmer (It's Probably Not What You Think)
上達に
「どうすれば
年単位で伸び続ける開発者に共通するのは、学習を日々の習慣に組み込んでいることだとする。第1の習慣として挙げられるのが、チュートリアルの外へ出て基礎を学ぶこと。チュートリアルは最初のアプリを作り、新しいフレームワークを理解する出発点としては良いが、学習戦略そのものにしてはいけない、という位置づけになっている。
PawMatch: Finding the Dog That Matches Your Personality 🐾
DEV の
DEV の
出発点にあるのは、多くの人は写真の可愛さで犬を選ぶが、何時間もの運動が必要な犬、集合住宅で静かに過ごせる犬、遊び好きで騒がしい犬、独立心の強い犬と、犬種ごとに性格が大きく異なるという観察。犬種はデータではなく性格だ、という言い方をしている。
データベースを眺めるのではなく、それぞれの相手に会っていくような体験にすることを狙っており、Vercel 上でデモが公開されている。
Shipping Assumptions: A Reliability Stack for AI-Generated Code
AI が
lint も
筆者は、AI 支援開発の代表的な失敗はもはや個別の関数や明白な構文の誤りではなく、コンポーネントの間、つまり境界、状態遷移、失敗モード、不変条件にあると位置づける。出荷しているのはコードではなく、もう自分では見えなくなった前提だ、と表現する。
対策として持ち出されるのは新しい手法ではなく、以前からあるモデリングの規律。きれいなコードであることと、系として整合していることは別だ、という主張が軸になっている。
People Liked My Product. They Just Didn't Need It.
link-in-bio 型の
link-in-bio 型の
実際にはプロフィール、カスタマイズ、コイン、通知、実績、コミュニティチャットなど、静的なリンクページ以上のものにするための機能を積み上げた。作り終えて「あとは見つけてもらうだけ」と考えたが、そこは簡単な部分だったという。Product Hunt や SaaSFrame に登録すると、数日は実際に反応があった。
そこから引き出された結論が表題で、プロダクトを気に入られることと、必要とされることは別だ、という話になっている。
Using AI to Code Isn't the Risk. Not Understanding What It Shipped Is
AI 支援開発の
デモでは、
筆者は前者を cognitive assistance(AI が奪うのはタイピングであって思考ではない)、後者を cognitive offloading(AI が思考を奪い、開発者には accept を押す作業だけが残る)と呼び分ける。両者はプルリクエスト上では見分けがつかず、何かが壊れて誰かが説明を求められたときに初めて分岐する。
具体例として、外部キーを2本持つテーブルを追加するマイグレーションを AI に生成させ、ローカルで動きテストも通ったので出荷したが、書いた本人を含め誰もそのスキーマについて考えていなかったケースが挙げられている。
The Kitchen Doesn't Care About Your Excuses
業務用厨房で
業務用厨房で
その場での指示は営業続行だった。スプリンクラーの技術者が到着して復旧するまで4時間、終わってから靴を乾かした。全体会議も、水についての振り返りも開かれなかった。
筆者は厨房から技術業界に移ったあともこの日のことを繰り返し思い出すという。目撃した中で最も奇妙な出来事だったからではなく、その場の反応が本能的に正しかったからで、業界が変わっても根底の問いは驚くほど変わらない、という前回の記事の主張につながっている。
Banx Walk Safe: same sidewalk, two heat loads
短頭種の
DEV の
犬は主にパンティングで体を冷やすが、短頭種はその効率が低く、しかも個体差が大きい。そのため同じ午後、同じ日差し・同じ路面・同じ湿度でも、ある犬にとっては散歩でも、この犬にとっては別のものになる。外見からはそれが分からない、というのが出発点。
アプリは場所を入力すると気温と湿度を取得して heat index を計算し、短頭種と長い口吻の犬について1日の熱負荷の推移を並べて表示する。散歩に出すかどうかを考えるための材料にすることを狙っている。
Supabase in Vue Made Simple
Vue から
Supabase は
useSupabaseClient() でクライアントを取得でき、Supabase の API はそのまま使える。記事はインストールと設定、データベースへの問い合わせ、TypeScript の使い方、認証の扱い、Realtime、そして composable としての構成の順に進む。
Coding agents got boring the moment we built a really good one.
Terminal-Bench 2.1 で
backboard.io の
公開の理由は価値がなかったからではなく、作ってみて価値の所在が別の場所へ移りつつあると確信したから、と述べる。最前線のエージェント性能に手が届くまでの時間が想定よりはるかに短くなり、小さなチームが桁違いの資本と人員と計算資源を持つ組織の製品と競合できるようになっている、という観察が根拠。
そこから、小さなチームが数か月で最前線のコーディングエージェントを作れるなら、エージェントそのものは技術的な堀としてどれだけ持つのか、という問いを立てる。筆者の答えは「たいして持たない」で、それでもコーディングエージェントを軸に巨大な企業は生まれる、流通と製品は難しいままだ、と続けている。
Filing: Nvidia agrees to spend up to $105B to support SB Energy's new Ohio data center campus OpenAI is set to lease; Nvidia agrees to invest $1.5B in SB Energy
Nvidia が
Sources: the US DOJ has been investigating a16z for nearly a year over whether its partners are improperly serving on the boards of competing AI companies
a16z の
OpenAI signs a 20-year, 10GW data center deal in Ohio with SoftBank's SB Energy; Nvidia agrees to backstop a portion of the value of the completed data center
OpenAI が
Cursor says it is rolling out its code hosting service Origin in early beta on all paid plans, featuring support for repos, pull requests, GitHub sync, and more
Cursor が
YouTube will start counting a view as soon as a video starts to play, from August 24, lining up with the system used by Instagram, TikTok, and its Shorts videos
YouTube が
Sources: Anthropic's revenue run rate reached $65B by the end of July, up from $47B in May and $9B in late 2025
Anthropic の
Opening arguments begin Tuesday in the state AGs' social media addiction lawsuit against Meta; New Mexico AG says the consequences could be “astronomical”
各州の
A German regulator says Apple will make changes to ATT, after finding Apple gave its apps more favorable consent prompts than those of third-party developers
Apple が
Uber and Zipline partner to launch Uber Eats drone deliveries in Dallas and Houston by late 2026, aiming to scale nationwide and hit 1M daily deliveries in 2029
Uber と
Google wins a bankruptcy auction with a $10M bid to acquire deidentified business data, software code, and more from Spirit Airlines to improve its AI models
Google が
Can We Defend Against AI-Generated Video Attacks on Real-World Crisis Events? A Systematic Evaluation of Detectors, Generators and Social Dissemination
危機的事象を
戦争、
評価軸は3つ。従来型の検出器7種、3つの審査設定でのゼロショットのマルチモーダルモデル10種、AI 生成動画検出向けにファインチューニングした MLLM 2種を比較したところ、どの系統も一貫しては汎化しなかった。
さらに、人間が騙される動画は現行の検出器にとっても難しく、SNS 上での拡散を経ると検出はより困難になることが示された。生成品質や条件付け情報によって検出しやすさは変わるが、生成元ごとの検出傾向はサンプリングシードによらず安定するという。
Self-Supervised Visual On-Policy Distillation
教師に
視覚の
拡張の設計空間を網羅的に調べた結果、4系統すべての拡張で性能が上がる一方、対称な自己蒸留は性能を下げること、強度は中程度で最良になること、問いに関係する証拠を消し去る拡張は大きいが無意味な差を生むことが分かったという。
6つの細粒度知覚ベンチマークで Qwen3.5-4B を 70.7% から 77.4% に改善し、比較した公開モデル(235B の Qwen3-VL まで)と GPT-5.4 を上回った。学習データを揃えた条件で、特権情報を使う手法の改善幅の96%を回収したとしている。
Beyond Final Scores: A Systematic Evaluation of Agents for Long-Horizon AI Research and Development
7つの
長期に
結果として現行のエージェントは、完全に自律した研究者というよりエンジニアリングの最適化器として振る舞う。実用的な解を立てて実装できる一方、実行ごとの性能の振れが大きく、最良の解も既存手法の適応や組み合わせが中心で、方法論としての新規性はまれだという。
詳細分析では、同じ最終結果の裏に異なる工程のボトルネックがあること、経験の再利用が後の判断を助けることも誤らせることもあること、ハーネスの設計が性能の安定性に影響することが指摘され、学習・推論時戦略・経験管理・ハーネス設計それぞれへの改善方向が示されている。
Intern-S2-Mobius: Foundation Model with Decoupled Knowledge and Reasoning
知識を
知識ベクトルを
この知識と推論の分離により、知識圧縮と推論効率が改善したと報告する。ゼロから学習した 7B モデルは、7B の Transformer ベースラインと同等の下流スコアを、ベースラインの 62.6% の学習データで達成した。
Qwen3.5-35B から継続事前学習した Intern-S2-Mobius は、同等の下流スコアを保ちながら end-to-end の推論で約4倍の高速化を実現したとしている。
Apodex Discovery: Reality Benchmarks and Environments for Evaluating and Building Discoverative Artificial Intelligence
実世界の
アポロ計画が
提案する Apodex Discovery は、基盤モデル・ハーネス・道具・制御方針からなる heavy-duty solver を軸にした枠組み。16 セクター 561 業種を調査して 423 件の実課題を集め、初回リリースに 20 件を選定した。環境・タスク・エピソードという共通の抽象が、データ、道具、制約、フィードバック、軌跡の記録、中間成果物と最終提出の検証を提供する。
AAV カプシド設計では、生存性・指向性・構造予測・生成設計にわたって公表済みの最高水準を7%上回った。薬剤の再利用と再製剤化では、専用の生物医学環境が GPT-5.5 と GPT-5.6-sol の平均正規化予測スコアをそれぞれ 2.5 ポイント、7.6 ポイント押し上げたという。
SimpleOPD: Simple Tokenizer-Agnostic On-Policy Distillation for Long-Context Reasoning
長文脈の
長文脈の
トークナイザの違いは共有テキスト空間で蒸留し、生徒と教師の双方で同一のテキスト区間を占めるトークンだけを対応づけることで扱う。生成長の暴走と打ち切りの多発に対しては、生徒の参照 KL 損失を導入し、終端トークンのアドバンテージをマスクして初期方針からの逸脱を抑える。
Qwen3、Qwen3.5、Intern-S2、GLM-4.7、Gemma-4 という同系・異系の生徒で数学推論、特に自然言語での数学証明が一貫して改善した。Intern-S2-Preview は ProofBench で 21.2 ポイント改善して 55.2 に達し、Gemini-2.5-Pro を上回った。HLE や HiPhO といった科学系ベンチマークにも波及している。
DFM Mimir v1: An Open HRM Delivering Frontier Performance at 1B Parameters Using Only Permissible Post-Training Data
許諾の
現行の
提案する Mimir v1 は Hierarchical Reasoning Model(HRM)アーキテクチャに基づく10億パラメータのモデルで、ゼロから学習し、事後学習には許諾済みのデータのみを用いる。161 のデータセットを混合して学習した。
英語、数学とコード、デンマーク語の20のベンチマークで評価し、元の HRM-Text 1B を上回り、Qwen 3.5 4B や Gemma 4 E2B といったより大きなモデルと競合する結果を出した。デンマーク語では新たな最高水準としている。モデルは Hugging Face Hub で公開されている。
MobileMem: Learning from a Year of Mobile Experiences
端末上の
個別の
MobileMem は1年規模で集めたモバイル体験を土台にした、端末上の長期記憶のためのベンチマークと枠組み。知識に基づく合成パイプラインで、ユーザーとアプリのセッションから時間的に整合した長期の軌跡を構築する。
テキストのみとマルチモーダルの2設定があり、マルチホップ推論、時間推論、知識更新、暗黙の嗜好推定を扱う。孤立した事実ではなく体験をモデル化することで、記憶を情報検索から継続的な個人学習へ広げることを狙うとしている。
HumanTracker: Towards Comprehensive and Human-Aligned Motion Tracking Benchmark
ヒューマノイドの
ヒューマノイドの
HumanTracker のベンチマークは、複数のプロの演者による約153時間の光学式モーション軌跡を、4つの動作系統とテキストラベルで整理したもの。細かい診断ができるようになっている。
加えて、24,000 の動作を含む 12,000 の動作ペアで学習した選好整合の指標 HumanScore を提案する。代表的な最新の追跡手法を横断した評価で、人間の選好をより良く予測し、運動学的指標が見落とす接地と安定性の破綻を明らかにしたとしている。
CPI-Bench: A Comprehensive,Practical and Intelligent Benchmark for Real-World Image Editing
画像編集モデルの
画像編集モデルの
CPI-Bench は3つの部分集合から成る。多様な編集タスクを網羅し複数画像編集の評価を初めて含む CPI-General-Bench、実際の利用頻度が高い場面に絞った CPI-Practical-Bench、推論を要する編集に特化した CPI-Intelligent-Bench。
主要な画像編集モデルの評価では、モデル間の性能差がより明確に分かれた。順位の分析では Arena Image Edit Leaderboard との一致度が最も高く、人間の評価者の選好と知覚判断をよく捉えた代理指標になっているとしている。
日本各地の
地図に
コメントでは、知らなかったライブカメラが多いという反応と、どうやって位置情報と紐付けたのかという技術面の疑問が並ぶ。歌舞伎町のカメラ密度への驚きがある一方、名古屋は4か所しか登録がない、大番寿司前や大ガードのカメラが無く座標がずれているものもある、といった指摘も出ている。
類似のものとして、各地の森の環境音を聞ける forestnotes が挙げられた。オホーツクのとっかりセンターでアザラシが見えた、といった具体的な報告もある。
OAuth に
OAuth の
172 ユーザーのブックマークに対してコメントは2件のみで、内容に踏み込んだ言及はない。順番に試していく、という反応が付いている程度で、あとで読む用途の登録が中心となっている。
味の
味の
コメントで多いのは謝罪の是非をめぐる議論。誰も謝罪を求めていないのに謝罪させたと表現するのはおかしい、必要のない場面で謝罪を強いる風土は自分にも跳ね返る、という指摘がある一方、確認不足で想定外の品質のものを出したなら謝るのは普通だ、という反論もある。
技術面では、iPhone のデジタルズームで元の解像度が足りず文字が補完されて崩れる現象ではないか、という推測が挙がっている。ロゴや商品の扱いを大切にしてきた社内に対してこそ詫びるべきだ、という意見も出た。
うんこミュージアムの
ウェブサイトが
コメント欄はほぼ全てが施設名にかけた言葉遊びで、技術的な言及はない。見出しが「漏洩」ではなく「漏れた」になっている点への指摘が繰り返されており、公式発表側がその表現を使っていたなら敬意を表したのに、という反応もある。
調査・実装計画・PR レビューを
ChatGPT と
コメントは3件と少ない。会話をそのまま渡せることを知らず、引き継ぎ用の文書を貼り付けたりファイルを渡したりしていた、という反応が付いている。
ほぼ個人で
Chaomoon が
コメントでは、絵柄が Terraria に近い、メイプルストーリーの雰囲気がある、といった見た目への反応が並ぶ。求めていたものだ、という好意的な声が多い。
運営面への心配も目立ち、個人制作の MMORPG を基本無料でどう回していくのか、サーバー費用は大丈夫なのか、という声が出ている。Remnant という語自体を知らなかった、という反応もあった。
Xperia が
ハイエンドの
コメントは賛否が割れている。USB-C が1つしかない端末をオーディオデバイスで塞ぐのもハブを噛ませるのも、ゲーマーを含む利用者の体験を損なう、既にあるものを削るのは劣化でしかない、という支持の声。
一方で、USB 接続のほうが音質は良くレイテンシも人間が知覚できない水準でオフセット調整もできる、という反論や、オーディオメーカー側が Type-C 端子の有線イヤホンを出している、という指摘もある。iPhone にも復活してほしい、という声も並んだ。
JTC の
JTC に
コメントでは、お伺いと調整とのらりくらりという JTC の描写の的確さが評価されている。作中の言葉選びが行間を読ませる形になっており、社内資料で鍛えられた強者の雰囲気がある、もはや文学だ、という反応も並ぶ。
AI で出し抜くという筋立てについては、スカッと系の読み物に近いという見方も出ている。
防衛省が
防衛省が
候補として名前が挙がっているのは Palantir の Maven Smart System で、衛星や偵察機から集めた膨大な機密データを統合・分析し作戦立案まで担えるとされる。コメントでは、この会社が候補である点への忌避感が最も強く表れている。
AI は中立でも公正でもない、情報を抜かれるだけでなく肯定ばかり返して判断できなくなるのではないか、といった懸念のほか、実戦経験を積めない以上、純国産の作戦指揮 AI の開発は難しいという見方も出ている。
NEC の
NEC の
コメントの多くは、同じ日に本社の AI 画像加工が炎上していたこととの対比に集まっている。本社が生成 AI で商品ラベルを崩して謝罪する一方、グループ企業は AI 活用の成功事例として取り上げられている、という構図。
掲載のタイミングが狙ったものではないか、という反応や、100年以上の歴史がある会社として何をしているのか、という声も並んでいる。
小規模な
Cloudflare Workers、
最初にやるのはコードを書くことではなく終了方針を決めること、というのが主張。最終終了日、新規登録と購入を止める日、終了日まで既存ユーザーに許可する操作、購入済みコンテンツの扱い、データの削除期限、決済履歴を残すか、問い合わせ先の維持期間、ソースコードの扱いを先に決める。決めていないと削除ボタンを押すたびに判断を迫られ、しかもセーブデータは本番環境になる。
実際の方針は、新規登録と購入を先に停止、終了日までは既存データの閲覧のみ許可、本番データのバックアップは残さず DB 構造とマイグレーションのみ Git に残す、リポジトリは秘密情報を無効化してから非公開でアーカイブ、というもの。停止は依存関係を踏まえて段階的に行ったとしている。
EC サイトの
その
例として小さな EC サイトが出てくる。注文の明細に配送状態を持たせた Order 型を作ったところ、配送中の破損で同じ商品を再送する場面で行き詰まる。購入したのは1個なので quantity を2にはできず、単価0円の Order を足すと、購入点数、売上集計、返品処理、後から作る推薦システムの学習データすべてで例外扱いが必要になる。
別の概念設計の世界線では、「何をいくつ、いくらで買ったか」を Order、「その約束をどう履行したか」を Fulfillment として分ける。注文と履行を別の概念として区別することで、通常の注文は Order と Fulfillment の対応で表され、再送のような事態も無理なく記録できるようになる。
Anthropic の
2026年8月に
埋め込み先は「LLM が次の単語を選ぶときの揺らぎ」。出発点とされる2023年の KGW 法では、直前のトークンから疑似乱数で語彙をグリーンリストとレッドリストに二分し、グリーン側のロジットに小さなボーナスを加えて生成する。検出側は緑の語が全体の何割を占めるかを数え、z 検定で偶然を否定できれば AI 生成と判定する。モデル本体にアクセスできなくても、鍵さえあれば検出できる。
筆者が2023年に「実用化は無理だろう」と考えた理由——鍵を埋め込めば品質が下がるはず、言い換えられれば消えるはず——が、そのまま研究コミュニティの課題になった。記事はこの2点と派生する2テーマがどう解かれてきたかを軸に整理している。Google は既に SynthID-Text を Gemini で実運用している。
Next.js + Cloudflare Workers + Turso で
Next.js 16 (App Router) を
コストは Workers Paid の月5ドルとドメイン代のみ。有料プランが必須な理由は3つで、OpenNext のビルド成果物が gzip 後 3.6MB で無料枠の 3MB を超えること、無料プランの1リクエスト CPU 10ms では Next.js の SSR が収まらないこと、リアルタイム機能で Durable Objects を使っていること。それ以外の R2・KV・DO・Turso・SES は無料枠に収まっている。
D1 を採らなかった理由は 10GB 制限と、外部からのアクセスに wrangler が要る点。罠の1つ目として、OpenNext + Workers では画像最適化サーバーが動かず next/image が使えないため、next/link もあわせて使わない方針にしたことが挙げられている。Cloudflare が出した実験的な vinext にも触れており、安定すれば本命になりそうだとしている。
確認メールを
アカウント登録時の
仕様は2つに分かれる。IETF の Internet-Draft(draft-hardt-email-verification-01、2026年7月4日)が発行者ディスカバリーやトークンの形式と検証というブラウザと発行者の間を、W3C/WICG の Email Verification API が autocomplete や nonce といったユーザー・サイト・ブラウザ間の処理モデルを担当する。著者は OAuth 2.0 の Dick Hardt 氏と FedCM の Sam Goto 氏。
登場人物は Verifier(RP)、User Agent、Issuer の3者。発行者はブラウザの公開鍵に紐づく EVT を発行するだけで、どのサイトが確認を求めたかは知らず、RP への紐付けはブラウザが行う。RP 側の実装はフォームに hidden の input を1つ足すだけで、autocomplete に email-verification-token を指定する。
TS/TSX 約800ファイルで
TS/TSX 約800ファイルの
一方、同じ6ルールでの型認識 lint は 0.38秒 対 5.98秒 と逆転し、Biome が約16倍速い。計測は npx を介さずローカルバイナリを直接叩き、交互に8〜10回実行した中央値を採っている。oxc 公式のベンチマークでは差が2.5〜3.3倍で、対象コードベースとルール構成の違いが開きの理由と説明される。
速度差の理由の1つが解析範囲の広さ。Biome v2 はプロジェクトスキャナを持ち、ファイルを跨いだ解析や CSS・JSON など JS/TS 以外の lint、フォーマッタとの構文木の共有まで行う。この機能は opt-in で、公式ブログも「スキャナには遅さという荷物がついてくる」と率直に書いている。
調査・計画・PR レビューを
Codex には
利用枠は、ChatGPT の Chat が ChatGPT 側のモデル利用制限、Codex と ChatGPT Work が同じエージェント利用枠、という区分。Workspace Agents などエージェント系の機能は Codex と枠を共有する。記事はこれがレート制限の迂回ではなく、正規の用途と利用条件の範囲での使い分けだと明記している。
著者はモデルに GPT-5.6 Sol Extra High または GPT-5.6 Sol Pro を使い、複雑な調査や実装計画では精度を優先している。業務リポジトリを接続する際は、組織の AI 利用ポリシーに加えて、リポジトリの内容を外部サービスへ提供できる権限があるかも確認するよう注意書きがある。
Google の
Google の
Go は標準ライブラリだけである程度の開発ができることに加え、コンパイラ、テスト、依存関係管理、脆弱性検査までを標準ツールチェーンとして備える。そのため単なるプログラミング言語ではなくソフトウェアエンジニアリングのプラットフォームだと位置づけられ、これが AI エージェントが自分の出力を検証し自分で修正する Loop Engineering の足場になる、という筋立て。
書きやすさより読みやすさと書式の統一を優先した設計は、人間がコードを書かない時代のレビュー負荷軽減に効くとする。AI のガードレールは Skills や Hooks のように LLM のツール内で語られがちだが、Go は言語そのものがガードレールとして機能する、というのが結論。訳者は Google 側のポジショントークである点も断っている。
同一仕様の
メモリ価格の
計測アプリは 1280×800 のダークテーマ固定で5つのモジュールを持つ。サムネイル100枚のギャラリー、5000行 JSON の仮想スクロールエディタ、10000行×10列のリアルタイム更新テーブル、10タブ×50コントロールのフォーム、ノード240とベジエ320のダイアグラム。単体、順次実行、画面4分割の同時実行の3パターンで走らせ、250ms 間隔でサンプリングする。
対象は Electron・Tauri・Wails・Neutralino の WebView 系、Flutter・Compose Multiplatform・Avalonia・Fyne、Slint・egui・iced の Rust 系、GTK4・Qt 6・AppKit・SwiftUI のネイティブ。ギャラリー単体のピークは Slint 124.4MB、AppKit 129.0MB、GTK4 139.8MB が上位で、Wails は 322.6MB。
AI エージェントの
GitHub、
目指すのは SSO のように一度の認証で認可まで済ませる体験。ただし SSO は OpenID Connect の認証フローと、IdP が持つログイン済みセッション(ブラウザには Cookie としてその参照が保存される)の2つで成り立っており、ブラウザを持たない AI エージェントは Cookie を使えない。
そこで使うのが OBO と ID-JAG で、エージェントが認証フローの結果として得る id_token を起点にする。記事は Section 1〜3 で原因と解決策を実装込みで解説し、Section 4 で AWS での実装、Section 5 で本番運用時の考慮点をまとめる構成になっている。
AI エージェントの
Claude Code に
設計方針は5つ。原本は案件フォルダに置き Git を正本として配信はコピー、人間はアップロードせずエージェントに日本語で頼む、見せる相手で公開範囲を分ける(URL を知っている人だけ、はアクセス制御ではない)、合格判定は PC ではなくスマホ、スマホからは見るだけでなく作業を投げて確認依頼に返す。
仕組みは S3 に置いて CloudFront で配るだけで、配信時に LLM は動かない。公開範囲は、自分は Cognito のパスキー、同僚は社内 IP か期限付きの署名 URL、誰でもは IP 制限なしの期限付き署名 URL で分ける。中身は CLI とスキルなので、Claude Code、Codex、Cursor のどのエージェントからでも同じように呼び出せる。
Windows 11 の
自宅の
Windows Defender は有効だったが、マルウェアのフォルダが除外リストに登録されており5日間素通しだった。常駐は Windows の正規タスク名を乗っ取ったスケジュールタスク5つで、すべて最上位特権。タスクスケジューラを開いても名前だけでは気づけない。侵入経路は Defender の詳細ログがローテーションで消えており特定できなかった。
検知の端緒は自作 Bot の不調で、筆者は当初「AI が余計なコードをいじったせい」だと考えていた。発見・調査・駆除はすべて Claude Code が実施。永続化機構8種、全465プロセス、通信、Chrome を再調査して他のマルウェアは検出されず、情報流出は確認されていないが「漏れた前提」で事後対応している。
30分で
難しい
先輩に相談すると「それは考える力の差ではなく体力の差」と返される。長時間考え続けることも休憩でちゃんと切り替えることもどちらも体力で、筋トレをしたことがない人が急に何時間も走れないのと同じ、新人のうちに30分で疲れるのは当たり前だ、という説明。まずポモドーロ(25分集中・5分休憩)で練習するよう勧められる。
翌日から実践し、休憩中はスマホを見ず席を立って軽く体を動かすだけにした。最初は25分でもきつかったが、1週間ほど続けると25分が苦でなくなり、気づけば夕方まで集中が持つ日が増えたという。
/watch-video スキルは
動画を
モードは transcript(既定、無料で速く、文字起こしとメタデータのみ)、visual(フレーム抽出と Claude の画像解析による重要シーン特定を追加)、multimodal(Gemini のネイティブ動画取り込み、長い動画ほど高コスト)の3つ。画像解析や注目シーンが欲しければ visual 以上を明示的に選ぶ必要があり、10分を超える動画で visual 以上を使う場合は処理前に確認が入る。
使い分けは、講演やポッドキャストは transcript、画面共有つきのデモや UI レビューは visual、判断がつかない長尺はまず transcript で流す、という整理。フレーム抽出の間隔も内容で自動的に変わり、画面共有・デモは5秒に1枚、話者が映るだけなら30秒に1枚、スライド発表は10秒に1枚と場面転換の検出、それ以外は15秒に1枚。
cross-session messaging は
Claude Code v2.1.224 で
1つ目のズレは渡るものの範囲。公式には、メッセージとはある Claude が別の Claude に向けて書くテキストであって、会話履歴やファイルではないと明記されている。会話や文脈をまるごと移したいならセッションを再開せよ、と別機能が名指しされており、文脈の引き継ぎは /resume の担当だと線が引かれている。受信側に届くのは Slack の DM のような短い1文になる。
2つ目のズレは対応 OS で、ネイティブの Windows では動かない。日本語の紹介ではほぼ触れられていない点として挙げられている。
8月14日発売の
SB クリエイティブから
筆者の評価は「網羅的なのに辞書的ではない」。機能を並べるのではなく、どこで使うか、どんなデメリットがあるか、どう使うのがおすすめかまで書かれている。各機能に実際の動作の検証が添えられており、サンドボックス機能の図解で理解が整理できたという。
特に良かったのはセキュリティの解説で、Claude に .env を読ませようとして止められるまでをログで見せたうえで、その設定では防げない範囲まで正直に書いてある点を挙げる。組み込みスキルの広さや、ヘッドレスモードと /loop・/goal の組み合わせは、使い込んでいる側にも発見だったとしている。
diagram-design スキルに
Qiita で
結果、書いていた style 指定は全て破棄された。4層の入れ子図で4件、侵入経路の図で4件、セッション間の図で5件が discarded と明示される。理由はドキュメントの1行目にあり、これはレンダリングや変換ではなく再描画で、Mermaid が供給するのは内容と宣言された方向であって座標ではない、という設計。light / dark / full の3変種が最初から生成されるため、ダークテーマ対策そのものが不要になる。
日本語を通した結果は、ラベルの折り返し崩れも枠からの突き抜けも文字の見切れも起きず、凡例の日本語化も問題なかったという。CJK について明記もあった。
Palantir 発祥の
a16z が
2010年代に米 Palantir が作った職種で、最近は OpenAI、Anthropic、Salesforce、日本向けでは ExaWizards やソフトバンクが採用を進めているという。背景には、AI を使ったシステムは会社ごとに使い方も困りごとも全く違うという事情がある。
1人ですべてをこなす場合も、少人数のチームで分担する場合もある。Palantir では実装担当、現場担当、UI・UX 担当という役割分担が取られている。コードを書く力だけでなく、人の話を聞く力と使いやすさを形にする力が組み合わさって、1つの現場に深く入り込む形になる。
レビューで
初めて
技術面で最初に気づいたのは命名の重要性。data という変数名を userAgeList に変えるだけで関数内での役割が一目で分かるようになり、バグの混入も減った。次が関数の責務の大きさで、入力チェック・変換・保存を1つの関数でやっていたものを分割したところ、テストが書きやすくなり変更の影響範囲が狭くなった。
コメントについても、何をやっているかはコードを読めば分かるという考えから、なぜこのアルゴリズムを選んだのかという意図が伝わっていないと指摘され、目的と仮定を簡潔に書く習慣をつけたという。個々は些細に見えても積み重なると可読性と保守性が大きく変わり、自分のストレスも減ったとしている。
WSL2 + Ollama + RTX 5070 Ti
公開された
環境は Ryzen 7 5800X3D(8コア16スレッド)、メモリ 64GB、RTX 5070 Ti(VRAM 16GB、Power Limit 300W)、NVIDIA Driver 596.36、CUDA 13.2、ストレージは 2TB NVMe SSD。ホストは Windows で、WSL2 上の Ubuntu 24.04.1 に 48GB を割り当てている。Ollama は 0.32.13 で、古いバージョンでは Qwen3.8-27B をロードできないと注意がある。
メモリは DDR4-3600 対応品を積んでいるが 2667 MT/s 動作に留まっており、モデルを CPU/RAM にオフロードする場合はチューニングの余地があると断っている。この環境に限った検証であり、必ずしも一般性があるとは言えない点にも留意するよう書かれている。